英伟达曝光SpaceX持仓成第六大股东,Codex解锁百万上下文窗口

资本动作:英伟达押注SpaceX,Stripe巨额收购OpenRouter
本周AI圈的资本层面动作频频,多笔重磅交易同时浮出水面。据B站AI日报披露,英伟达在最新的持仓文件中首次曝光其持有SpaceX约1.228亿股,一跃成为SpaceX的第六大股东。这一披露引发市场高度关注——作为全球AI算力的核心供应商,英伟达此番对太空科技公司的深度布局,被外界解读为其正试图在AI基础设施之外,构建更广泛的前沿科技投资版图。
从战略逻辑来看,英伟达的数据中心业务收入已超过总营收的80%,其GPU产品线支撑着全球绝大多数AI训练和推理任务。投资SpaceX的深层考量在于:SpaceX旗下的Starlink星链网络正在构建覆盖全球的低轨卫星通信基础设施,而未来AI推理服务的全球化部署——尤其是面向偏远地区和移动场景——离不开无处不在的网络连接。SpaceX的Starlink计划目前已部署超过6000颗低轨卫星,覆盖全球70多个国家和地区。低轨卫星(LEO)运行在约550公里高度,相比传统地球同步轨道卫星(36000公里),通信延迟从600毫秒降至20-40毫秒,接近地面光纤水平。这一特性使其成为AI推理服务全球化部署的理想连接层——未来自动驾驶车辆在偏远地区的实时决策、海上船舶的智能导航,都可能依赖星链提供的低延迟连接。此外,卫星边缘计算、太空数据中心等前沿概念同样需要高性能GPU的支撑。太空边缘计算(Space Edge Computing)的核心思路是在卫星上直接部署GPU进行数据预处理,减少地面传输带宽压力,这正是英伟达与SpaceX可能深度合作的技术前沿。两家公司在"算力+连接"的技术层面存在深度协同的可能,目前更多交易细节仍待后续文件披露。
另一边,支付巨头Stripe也传出大动作。彭博社消息称,Stripe已敲定收购AI初创公司OpenRouter,交易金额超过70亿美元,双方尚未发布正式公告确认。OpenRouter作为聚合多家大模型API的路由平台,近年来在开发者群体中影响力快速攀升。其核心商业模式是为开发者提供统一的API接口,背后聚合了OpenAI、Anthropic、Google、Meta等数十家模型供应商——开发者无需逐一对接各家API,只需通过OpenRouter即可按需调用不同模型,并享受自动负载均衡和成本优化。
从技术架构来看,OpenRouter类似于AI领域的"API网关"或"模型代理层"。开发者通过其统一的RESTful API发送请求,OpenRouter根据预设的路由策略(如成本优先、延迟优先、质量优先)将请求分发到最合适的模型供应商。其盈利模式通常是在模型原始调用价格基础上加收一定比例的服务费。这种"模型聚合路由"的定位,与Stripe在支付领域的聚合支付思维高度一致。Stripe的核心业务本质上也是一个"聚合路由"——聚合全球数百家银行和支付网络,为开发者提供统一的支付API。若交易属实,Stripe有望将AI模型调用的计费、结算、成本分析整合进其已有的数十万商户生态中,形成"代码调用模型→Stripe计费结算"的闭环,把AI时代的"算力消费"变成其支付基础设施的新增量,意图掌控模型调用的计费入口,争夺模型调用市场的话语权。
国内资本市场同步升温
国内方面,语述科技公告显示,公司股票将于8月19日登陆上交所科创板,发行价为每股150.80元,成为AI相关企业冲刺资本市场的又一案例。科创板设立于2019年,定位于服务"硬科技"企业,采用注册制并允许未盈利企业上市,是中国资本市场对科技创新的制度性支持。150.80元的发行价在科创板中属于中高水平,反映出当前市场对AI赛道企业的估值溢价,同时也意味着企业将接受更严格的信息披露和业绩兑现要求。
此外,阿里据报将出售旗下灵犀互娱(游戏业务),加速向人工智能全面转型,信成资本接手后现有管理团队短期预计保持稳定——这一动向再次印证了大厂"聚焦AI主航道、剥离非核心资产"的战略趋势。

模型能力升级:OpenAI Codex开放百万级上下文窗口
本次日报中最受开发者关注的,当属OpenAI Codex的能力更新。据Tibor消息,ChatGPT订阅用户现可在Codex中使用5.6版本,并获得百万级(1M)上下文处理能力。
上下文窗口(Context Window)是大语言模型单次推理所能处理的最大token数量,直接决定了模型能"看到"多少信息。早期GPT-3.5仅支持4K token(约3000个英文单词),GPT-4将其扩展到128K,而百万级上下文意味着模型可以一次性处理约75万个英文单词——相当于十几本完整的技术书籍,或一个中大型软件项目的全部源代码。
这一能力突破依赖于多项前沿技术创新。传统Transformer的自注意力机制计算复杂度为O(n²),即上下文长度翻倍时计算量增加四倍,这使得长上下文在工程上极其昂贵。稀疏注意力机制(Sparse Attention)通过只计算部分token对之间的注意力来降低计算量;Ring Attention是UC Berkeley提出的分布式注意力计算方法,将超长序列分块分配到多个设备上,每个设备只计算局部注意力后通过环形通信交换KV缓存,从而将单设备内存瓶颈转化为多设备协作问题。KV Cache压缩则针对推理阶段的内存占用——每个token都需要存储其Key和Value向量供后续token参考,百万token级别的KV Cache可能占用数百GB显存,通过量化压缩、选择性丢弃不重要token的KV对等技术,可将内存需求降低数倍。此外,位置编码的外推能力(如RoPE的NTK-aware缩放)也是支撑长上下文的关键技术基础。这些架构创新使得模型不再受限于短窗口下的信息截断和上下文丢失问题。对于处理大型工程项目、跨文件重构和长链路调试而言,这是质的飞跃——开发者可以将整个代码仓库一次性输入模型,获得全局性的理解和建议。
不过,能力升级的同时也伴随着商业化的收紧。社区用户反馈,Codex额度用完后会弹出付费重置选项,有Plus用户根据截图显示,支付8美元即可将额度恢复至100%,但该机制目前官方尚未确认。这一细节折射出AI编程工具正从"免费试用"逐步过渡到"精细化计费"阶段,如何平衡开发者体验与商业可持续性,将成为各家产品长期博弈的焦点。

国产大模型持续发力:智谱GLM与阿里Qwen Audio 3.0
开源与国产模型阵营同样动作不断。智谱开放了GLM系列的网安全线申请,安全研究员和相关机构获批后可获得更高使用自由度,体现出模型厂商在安全研究场景下的开放姿态。这种做法借鉴了国际上"红队测试"(Red Teaming)的实践——通过向安全研究者开放模型限制,主动发现潜在漏洞和对抗性攻击路径,从而在正式发布前加固模型的安全防线。红队测试源自军事术语,在AI安全领域特指有组织地对模型进行攻击性测试,包括越狱攻击(Jailbreaking)、提示注入(Prompt Injection)、数据提取等手段,目的是在攻击者之前发现并修补模型的安全弱点。OpenAI、Anthropic等国际厂商均建立了系统化的红队计划,智谱此举标志着国产模型在安全治理方面正与国际接轨。
阿里则发布了Qwen Audio 3.0并上线千问平台,覆盖语音识别(ASR)、语音合成(TTS)和实时交互三个赛道,据称多项指标位居全球第一。语音多模态能力的持续突破,正在为端侧智能助手和实时交互应用打开新的想象空间——从自然对话式的人机交互,到会议实时转写和多语种同传,语音模态正成为大模型走向日常应用的关键入口。
端侧与Agent落地:美团9万员工覆盖到硬件适配
在AI落地应用层面,几则消息颇具代表性。美团被曝正推进大规模Agent组织化建设——从此前"每天消耗上千万元"的粗放投入,转向系统化推进,其内部Agent平台已覆盖9万名员工并搭建了3万个Agent。
AI Agent(智能体)区别于传统的对话式AI,它具备自主规划、工具调用和多步骤任务执行的能力——不只是回答问题,而是能够拆解任务、调用API、操作系统并完成端到端的工作流。美团3万个Agent的规模化部署面临一系列深层工程化挑战。首先是权限治理问题:每个Agent需要访问特定的内部系统(如订单系统、商家后台、客服系统),如何实现最小权限原则、防止Agent越权操作是安全基础。其次是可观测性——当Agent执行多步骤任务失败时,需要完整的执行链路追踪(类似微服务架构中的分布式追踪)来定位问题节点。任务编排的可靠性同样关键:Agent调用外部API可能超时或返回异常,需要重试、降级、补偿等机制确保业务一致性。成本方面,每个Agent的每次复杂决策可能涉及数十次LLM调用和工具调用,乘以9万员工的日常使用量,token消耗和API调用成本需要精细的预算管控和优先级调度。从"每天消耗上千万元"到组织化推进,反映出企业正从探索期的粗放试错转向生产级的系统治理,包括建立Agent效果评估体系、成本核算机制和人机协作流程规范。这一数字也直观展现了头部互联网公司在企业内部Agent规模化部署上的激进程度,预示着"人手一个AI助手"的办公形态正在从概念走向现实。

硬件端侧加速接入
端侧AI的落地也在提速。联发科宣布,其天玑汽车座舱平台CX-1和旗舰移动芯片完成了Qwen 3.8B模型的适配,端侧接入速度更快。
端侧推理指在本地设备(手机、汽车芯片等)上直接运行AI模型,其核心优势是低延迟(无需网络往返)、隐私保护(数据不出设备)和离线可用;但劣势在于受限于设备算力,只能运行参数量较小的模型。Qwen 3.8B(38亿参数)是阿里专为端侧场景优化的轻量模型,联发科天玑平台集成的NPU(神经网络处理单元)通过INT4量化等技术实现高效部署。INT4量化将模型权重从FP16(16位浮点数,每参数2字节)压缩为4位整数表示(每参数仅0.5字节),理论上可将模型体积从约7.6GB压缩到2GB以内。具体实现通常采用分组量化(Group Quantization)——将权重矩阵按组划分,每组共享一个缩放因子和零点,在压缩率和精度损失之间取得平衡。GPTQ、AWQ等先进量化算法通过分析激活值分布来优化量化策略,可将精度损失控制在1-2个百分点以内,对于日常对话和简单推理任务几乎无感知。芯片厂商主动适配主流大模型,标志着"云端处理复杂任务、端侧处理高频简单任务"的混合推理架构正逐步成为行业标配,为智能座舱语音交互、手机本地助手等场景提供了兼顾能力与速度的硬件基础。

在消费级应用方面,豆包新增了手机远程控制电脑功能,用户可在移动端处理跨设备任务;阿里则推出Happy Shrimp,用户只需描述情绪、故事或记忆,模型即可完成作词、作曲、编曲和演唱的一条龙创作。AIGC正从单一模态向"一句话生成完整作品"的全流程创作演进,这种端到端的多模态生成能力,代表着AI创作工具从"辅助人类"向"自主完成"的阶段性跨越。
行业隐忧:AI客服投诉激增与劳动者权益
技术狂飙之下,也有值得警惕的信号。中消协报告显示,AI客服相关投诉显著增多,人工转接困难、不实承诺和生成内容失准成为主要争议点。
当前大多数AI客服基于大语言模型的检索增强生成(RAG)架构运行。其工作流程为:用户提问→系统将问题转化为向量嵌入→在企业知识库中通过向量相似度检索最相关的文档片段→将检索结果作为上下文注入LLM的提示词→LLM基于检索内容生成回答。理论上RAG能将模型的回答"锚定"在真实文档上,但实际问题在于:检索环节可能因语义理解偏差召回不相关内容、模型可能忽略检索结果而依赖自身参数知识生成回答、或者对检索内容进行错误的推理和组合。模型固有的"幻觉"问题(Hallucination,即生成看似合理但实际错误的信息)在客服场景中尤为致命——错误的退换货承诺、混淆不同产品的保修条款、或编造不存在的优惠活动,可能直接造成消费者经济损失和企业法律风险。
目前业界的缓解方案包括:添加事实性验证层对生成内容进行二次校验、限制模型只能引述原文而非自主推理、设置置信度阈值在模型不确定时主动转人工、以及在涉及承诺性表述时强制转人工审核等。这提醒行业:在追求降本增效的同时,AI客服若过度替代人工,反而可能损害用户体验和企业信誉,"人机协同"——即AI处理标准化问题、复杂和情绪化场景及时转人工——而非"完全替代",或许才是更务实的路径。
此外,一则新闻引发广泛讨论:一名39岁程序员在公司厕所内猝死,深圳人社局认为其虽已打卡但未到工位,暂不认定为工伤。在AI行业高速运转、从业者普遍承受高强度工作的背景下,这一案例再次将科技从业者的健康与劳动权益问题推到台前。中国互联网行业长期存在的"996"乃至更极端的工作文化,叠加AI竞赛带来的紧迫感,使得从业者的身心健康风险被持续放大,值得整个行业深思。
结语
从英伟达的太空布局、Stripe的巨额收购,到Codex的百万上下文、国产模型的多点突破,本周的AI圈可谓资本与技术双线狂奔。而AI客服投诉与劳动者权益话题的浮现,则为这场热潮提供了一面冷静的镜子。技术进步的速度令人振奋,但如何让AI真正服务于人、如何守护技术背后的从业者,同样是行业不可回避的命题。
相关推荐

Claude Code入门指南:终端原生AI编程助手完整教程
详解Claude Code安装部署、多模型切换、代码生成与项目重构等核心功能。掌握这款终端原生AI编程工具,告别IDE依赖,在命令行实现高效开发闭环。

Modelstamp:为ML模型持久化加上完整性校验与环境漂移检测
Modelstamp是一款轻量级开源工具,为scikit-learn等ML模型的保存加载流程添加SHA-256完整性校验、依赖漂移报告和HMAC认证,解决模型持久化中环境不一致的隐患。

Claude Code接入DeepSeek完整教程:低成本AI编程实战指南
详细介绍Claude Code安装配置全流程,通过CC-Search工具接入DeepSeek大模型,实现低成本AI编程体验。涵盖Node.js环境搭建、配置文件修改、API密钥获取及实战演练。