DeepSeek V4视觉版开源,智谱收入暴涨400%

DeepSeek V4视觉权重开源:305B多模态模型正式登场
9月1日的AI圈可谓热闹非凡。开源阵营方面,DeepSeek放出了V4的首个视觉版本权重,模型规模达到305B(约3050亿参数),并同步提供了最小推理实现,方便开发者上手体验和二次开发。这一参数规模使其跻身全球最大开源多模态模型之列。所谓多模态模型,是指能够同时处理和理解文本、图像、音频等多种信息形式的AI模型,相比纯文本大模型具有更丰富的感知和推理能力。视觉权重的开源,意味着模型中负责图像理解、视觉推理的参数矩阵被完整公开,社区开发者可以直接在此基础上进行下游任务的适配和优化。
不过,规模巨大也意味着部署门槛不低。官方给出的部署要求是需要4张GB300显卡才能支撑起完整的推理服务。GB300是NVIDIA最新一代数据中心GPU,单卡配备了超大规模显存和极高的计算吞吐能力,4张GB300意味着推理所需的显存总量可能超过1TB,这在当前硬件条件下属于典型的企业级配置。对于普通开发者和小型团队而言并不友好,更多是面向具备充足算力资源的企业和研究机构。DeepSeek此次将视觉能力开源,标志着其正式从纯文本模型迈向多模态领域,也为国产开源多模态生态注入了新的活力。
值得关注的是,DeepSeek坚持开源路线的策略,与其一贯的技术普惠理念相符。视觉权重的开放,意味着社区可以在此基础上进行微调、蒸馏(即通过知识蒸馏技术将大模型的能力压缩到更小的模型中),衍生出更多轻量化、可落地的应用版本,从而在一定程度上缓解高部署门槛带来的使用障碍。这种"大模型开源、社区蒸馏"的路径已经在LLaMA等开源生态中被验证为行之有效的技术扩散方式。
ChatGPT Apps年化收入破10亿美元,OpenAI商业化提速
在商业化维度,OpenAI交出了一份亮眼的成绩单。ChatGPT Apps上线还不到200天,其年化收入运行率(ARR)就已经达到了10亿美元的量级,增长速度令人瞩目。ARR(Annual Recurring Revenue)是SaaS和订阅制企业最核心的财务指标之一,它将当前收入水平按年化方式计算,用以衡量业务的可持续增长能力和未来收入的可预测性。ChatGPT Apps是OpenAI推出的应用生态平台,允许第三方开发者基于GPT模型构建独立应用并分发给用户,类似于苹果App Store的模式,但底层能力由AI模型驱动。

话说回来,OpenAI的广告业务已经覆盖40多个国家,自助投放服务也扩展到了印度、欧洲、中东和北非等新兴市场。广告业务的全球化布局标志着OpenAI正在借鉴Google和Meta验证过的成熟变现路径——通过AI驱动的精准广告投放来创造规模化收入。这一系列布局表明,OpenAI正在从单一的技术供应商,加速转型为具备"技术平台+广告变现+订阅收入"多元商业闭环的平台型公司。广告与自助投放的全球化铺开,也预示着AI应用的商业模式正在逐步走向成熟,从依赖融资输血的烧钱阶段迈向自我造血的新阶段。
智谱收入暴涨400%,API业务占比超八成但亏损仍是隐忧
把目光转回国内市场,智谱公布的财务数据同样引人关注。上半年智谱实现收入9.54亿元,同比增长约400%,增速惊人。其中API(Application Programming Interface,应用程序编程接口)业务占据了收入的86.5%,成为绝对的营收主力。API业务模式是当前大模型公司最主要的B端变现方式,企业客户通过调用API接口获取模型的推理能力,通常按token(模型处理文本的基本单位)用量计费。86.5%的高占比说明智谱的收入结构高度依赖企业级客户的模型调用需求,反映出国内企业对大模型能力接入的旺盛需求正在快速转化为实际购买力。

然而,高增长的背后仍有隐忧。同期智谱亏损达到20.72亿元,远超其收入规模,亏损额约为收入的2.2倍。这一数据折射出当前大模型行业普遍面临的结构性困境:训练一个前沿大模型的算力成本动辄数亿元甚至更高,加上持续的推理服务器运营费用、高端AI人才的薪酬支出,以及行业激烈价格战导致的API定价压力,使得收入增长在短期内难以覆盖总成本。这种"以亏损换规模"的策略在互联网行业并不罕见,但大模型行业的资本密集程度更高。如何在快速扩张与财务健康之间找到平衡,将是智谱乃至整个国产大模型厂商需要长期面对的课题。
Runway Solaris界面生成与Meta MuseCode开发工具升级
在产品形态上,两大动向值得关注。首先是Runway推出的界面模型Solaris,它能够根据用户的点击和拖拽操作,逐帧生成下一张界面,而无需先编写代码。这种交互式的界面生成方式代表了一种全新的人机交互范式——不再是人类用代码或设计工具描述界面,而是通过自然的交互动作,由AI实时推断并生成下一帧界面状态。从技术本质上看,Solaris将UI设计问题转化为了视觉序列预测问题,类似于视频生成模型对下一帧画面的预测,极大降低了原型设计和界面开发的门槛。
在官方评测中,71%的自然行为偏好投给了Solaris,意味着在对比测试中,大多数用户认为Solaris生成的界面响应比传统方法更符合直觉预期,显示出其在交互体验上的显著优势。不过,文字处理仍是它的短板。这一问题实际上是当前视觉生成模型的普遍瓶颈——文字的渲染需要像素级的精确性,而生成模型擅长的是语义层面的内容创作,两者之间的精度差距说明当前的界面生成模型在细节精度上仍有提升空间。

在开发工具方面,Meta的MuseCode正式结束Beta测试,开始面向更复杂的工程任务,并开放了开发者预览SDK(Software Development Kit,软件开发工具包)。该SDK支持自定义工具、流式进度反馈和恢复绘画等功能,同时产品还新增了阅读套餐。流式进度反馈意味着开发者可以实时监控AI执行任务的中间状态,而非等待最终结果一次性返回,这在处理耗时较长的复杂工程任务时尤为重要。这一系列升级表明,Meta正在将其AI开发工具从实验阶段推向生产级应用,为开发者提供更完整的工程化支持,与GitHub Copilot、Cursor等AI编程工具形成更直接的竞争。
Google TimesFM 3发布:330M参数时序预测基础模型
研究前沿方面,Google发布了TimesFM 3,这是一个拥有330M参数的多变量预测模型。它在超过1万亿个时间点的数据上进行训练,能够在一次前向传播中联合预测多个目标,并输出9个概率分位数。

时间序列预测在金融、能源、供应链、气象等领域有着广泛应用。传统的时序预测方法包括ARIMA、Prophet等统计模型和LSTM等深度学习方法,但这些模型通常需要针对特定数据集单独训练和调参。TimesFM 3的创新在于采用了基础模型(Foundation Model)的思路,在超过1万亿个时间点的大规模异构数据上进行预训练,使其获得了跨领域的通用时序理解能力,无需为每个新场景从零训练。
其多变量联合预测能力意味着它能够同时预测多个相互关联的指标(如同时预测某商品的价格、销量和库存),捕捉变量之间的协同变化关系,而非孤立地处理单个变量。9个概率分位数输出(如第5、10、25、50、75、90、95百分位等)则提供了预测结果的完整置信区间,决策者可以据此评估最乐观和最悲观的情景,这对于风险管理和资源规划具有重要的实际价值——例如供应链管理者可以根据不同分位数制定安全库存策略。值得注意的是,330M的参数量相对于动辄数百亿参数的大语言模型来说非常轻量,使其在边缘部署和实时预测场景中更具可行性,正在成为时序预测领域的新范式。
总结
从DeepSeek V4视觉权重开源,到智谱营收的爆发式增长,再到OpenAI商业化的加速推进,9月1日的AI动态清晰地勾勒出行业的两条主线:一方面是技术能力的持续突破,多模态、界面生成、时序预测等方向百花齐放;另一方面是商业化探索的全面提速,但高增长与高亏损并存的局面,也提醒着行业参与者们,AI的规模化盈利之路仍需时间验证。开源与闭源两种路线在技术扩散和商业变现上各有优劣,而如何平衡技术投入的长期价值与短期财务压力,将持续考验每一家AI公司的战略定力。
核心要点
相关推荐

澳洲全球首创:外卖骑手将获最低工资保障
澳大利亚推出全球首个外卖骑手最低工资保障协议,在保留零工灵活性的同时为配送司机提供收入底线。本文解析协议核心内容、对平台企业的影响及全球零工经济监管趋势。

DeepSeek首个视觉模型开源,多模态Agent门槛骤降
DeepSeek开源首个视觉模型V-Flash-Vision-XP,多模态Agent能力逼近顶级闭源模型;阿里通义上线多智能体视频创作团队;400美元双足机器人开源;ChatGPT广告年化营收破10亿美元。

ReactOS 0.4.16发布:图形安装器、3D硬件加速与更强硬件支持
ReactOS 0.4.16正式发布,带来全新图形化安装程序、真实硬件GPU 3D加速能力及更广泛的硬件兼容性支持。详细解读这个与Windows NT二进制兼容的开源操作系统的最新进展与实际应用场景。