每日AI新鲜事·09月12日早间版:月之暗面20亿目标与机器人数据淘金热
每日AI新鲜事·09月12日早间版:月之暗面20亿目标与机器人数据淘金热
2026年09月12日(周六)早间版 AI新闻速递+热点深度讨论
2026年09月12日(周六)早间版 AI新闻速递+热点深度讨论
今天AI圈又有不少新消息, 周六也闲不住啊. 我这边刷到好几条挺有意思的, 先快速过一下.
第一条, TechCrunch上有篇报道说, Kimi的开发商月之暗面把年营收目标定在了20亿美元. 李博, 你看到这条了吗?
看到了, 第一反应就是, 这个数字挺激进的. 20亿美元, 折合人民币接近一百五十亿了.
但你再看OpenRouter的数据, 它K3系列日均生成大概三千亿Token, 这个调用量是真实的. 问题不是没人用, 问题是调用量跟营收之间有个大裂缝.
你是说现在推理成本高, 定价又在往下打, 用的人越多可能亏得越多?
对, 这就是中国大模型公司现在集体面对的困境. 技术竞赛打完了, 现在要进入商业化阶段了. 但Token价格一路卷, 企业级收入又还没跑起来.
而且报道里还提到最近几个月使用量有小幅下滑. 这个细节值得注意, 因为竞争对手也没停, DeepSeek, 通义, 都在抢这块.
所以20亿美元这个目标, 更像是给投资人看的信号, 还是内部真的有路径能打到?
我觉得两者都有. 但核心还是得看企业级服务能不能起量. 开发者调用便宜, 毛利很低. 企业级定制, 才有利润空间.
好, 这条我们等后面DeepSeek的话题一起聊. 先接着过新闻.
第二条, TechCrunch报道了TechCrunch Disrupt的中亚欧亚区域赛结果. Cerberus, WeGlobal AI, LOOQ三家拿到了旧金山决赛的资格.
这条我觉得最有意思的不是结果, 是中亚欧亚被单独划成一个赛区这件事本身. 说明这块的创业生态已经到了被全球投资人当作独立市场对待的阶段.
WeGlobal AI是做AI方向的, 另外两家没透露细节. 十月旧金山见分晓吧, 这条先过了.
然后还有一条, 来自Databricks的博客. 讲的是医疗保险公司的核心财务指标MLR, 就是医疗赔付率. 传统BI工具能告诉你指标动了, 但不能告诉你为什么动.
这个场景我觉得说到了AI分析能力的本质. 描述性分析跟诊断性分析, 是两个完全不同的维度. 前者BI就够了, 后者需要跨多维度做关联归因.
等一下, 你说的关联归因, 听起来好像也不是很新鲜? 以前数据分析也能做多维下钻啊.
区别在于规模和自动化程度. 以前多维下钻是分析师手动定义维度, AI是自动扫全量特征找相关性. 比如某个地区某类慢性病住院率突然涨, 这种组合人工很难主动发现.
行, 这个说得通. 不过文章也提醒了, 在强监管行业, AI归因的可信度高度依赖数据质量和可解释性. 这个限制在医疗保险里应该更明显.
对, 可解释性在这类场景是硬门槛, 不是锦上添花. 黑盒输出在精算师面前根本没法用.
最后一条新闻, GitHub博客发了一篇关于营销运营即代码的文章. GitHub亚太区营销团队把活动策划到跟进整个流程, 全部搬到Issues和Actions里跑自动化.
我对这个有点感触. 工程化思维渗入非技术部门, 这个趋势已经不是预测了, 是正在发生的事. Copilot把门槛拉低了, 非技术人员也能构建自动化流程.
文章里有句话挺有意思, 说关键第一步就是把工作流程写下来. 光这一步很多团队就做不到.
对, 流程不写下来就没办法自动化. 这倒是个很朴素的洞察.
好了新闻就先聊到这儿, 接下来我们聊聊最近两个特别火的话题. 一个是DeepSeek V4.1 Flash刚出来, 另一个是机器人训练数据的淘金热.
先说DeepSeek V4.1 Flash. B站上有个测评视频互动分破了十二万, 讨论热度相当高. 李博, 你觉得这次Flash版本有什么不一样?
你的感觉没错, 有点不一样. Flash系列的定位本来是轻量快速, 但这次V4.1 Flash的测评结果显示它在好几个维度上表现出乎意料地强.
重点不在于它跑分有多高, 重点在于Flash级别的模型能打到这个精度, 意味着推理成本会进一步往下走. 这对整个行业的定价逻辑影响很大.
你这么说我突然想到一个问题. 刚才月之暗面那条, 我们说调用量大但变现难, 推理成本高是原因之一. 如果Flash这种轻量模型越来越强, 成本往下走, 月之暗面的压力是不是更大?
这是个很好的问题. 逻辑上确实是这样的. DeepSeek出一个更强的Flash, 等于把整个行业的成本预期再往下压一档. 用户觉得便宜的门槛就会相应降低.
月之暗面要对抗这个, 要么跟进降价, 毛利继续缩; 要么在企业级场景做出差异化, 靠服务溢价. 两条路都不容易.
不对吧, DeepSeek自己不也要面对同样的变现困境吗? 它开源, 很多人直接自己部署, 根本不付费.
这就是两个不同的商业模式了. DeepSeek开源是为了把自己的技术标准变成行业标准, 通过生态影响力获益. 月之暗面走的是闭源服务路线, 逻辑完全不同.
所以你觉得Flash这次爆火, 核心信号是什么?
核心信号是, 轻量模型和旗舰模型之间的能力差距在快速收窄. 以前你要顶级性能就要接受高成本, 现在这个trade-off越来越小.
这对Agent类产品来说是个大利好. Agent需要高频调用, 如果Flash级别就够用, 边际成本会大幅下降, 产品化的门槛也跟着低.
总结一下就是, Flash这次的意义不只是跑分好看, 而是轻量高性能这件事本身在重塑行业成本预期和产品化路径.
对, 说得很准. 而且结合OpenRouter上K3系列的数据来看, 开发者生态已经在用脚投票了. 谁的性价比高, 流量就往哪走.
好, 接下来说第二个话题. 机器人训练数据公司Mecka AI, 估值快到五亿美元了, 红杉领投. 这家公司才成立两年.
这条我看到的时候觉得, 机器人数据这个赛道要开始真正热起来了. 以前大家聊AI数据, 基本就是文本和图像. 机器人的具身数据完全是另一回事.
具身数据是指什么? 跟普通训练数据有什么不一样?
简单说就是机器人在物理世界里操作的数据. 手怎么抓东西, 力度是多少, 环境里的障碍怎么绕, 这些都要记录. 不只是视觉, 还有传感器, 触觉反馈, 时序动作数据.
这种数据采集成本应该很高吧? 总不能完全靠仿真环境生成.
这就是为什么Mecka这类公司估值能涨这么快. 真实物理世界的操作数据没办法完全靠仿真替代, 因为仿真和真实环境之间有个叫sim-to-real gap的问题.
仿真环境训练出来的模型, 真实世界一跑就容易出问题. 所以真实操作数据是硬通货. 谁能大规模采集高质量的具身数据, 谁就有竞争壁垒.
可是这就矛盾了啊. 数据采集成本高, 但机器人硬件普及还需要时间, 客户在哪里? 谁现在愿意掏钱买这些数据?
买家就是那些在做具身智能的大公司. Figure, 特斯拉Optimus, 还有国内一堆人形机器人公司, 都在拼命找训练数据. 他们自己采集速度跟不上研发节奏.
所以Mecka这类公司的逻辑是, 我帮你采集和标注数据, 你专注做模型和硬件. 分工明确, 需求真实存在.
你这么说我想起来, 这不就是当年大语言模型爆发前, 数据标注公司先热起来的那个逻辑吗?
完全一样的逻辑. 基础设施先行. 大模型训练数据那一波, Scale AI估值先涨起来了, 后来模型公司才真正爆. 现在机器人这条线上, 数据基础设施开始重演这个故事.
但是, 大语言模型那一波文本数据有互联网这个天然供给, 机器人数据是要靠人工采集的. 这个规模化的难度完全不是一个量级吧?
你说到关键点了. 这就是为什么具身数据公司的壁垒比文本数据公司更深, 同时扩张速度也更慢. 你没办法爬虫采集机器人操作数据.
但反过来想, 正因为难采集, 所以先跑起来规模的公司就有很强的护城河. 这也是红杉愿意在这个时间点领投的原因, 窗口期在这里.
所以结论是, Mecka五亿美元估值背后, 是机器人训练数据赛道的淘金热正在开启, 而且这个赛道的壁垒比大模型数据更深, 时间窗口也更清晰.
对. 我加一句, 这个赛道的爆发节点, 就是人形机器人真正开始量产部署的那一天. 到时候对数据的需求量会指数级增长.
行, 今天就聊到这儿. 周六嘛, 不用拼命. 有新动态我们中午见.
相关推荐
科技前沿AI行业罕见平静日:递归自我改进暗流涌动
AI领域迎来罕见的平静一天,多个资讯源集体沉默。但平静背后,递归自我改进(RSI)研究仍在持续推进。解读AI行业发展节奏与从业者应对策略。
科技前沿Reve 2与Ideogram 4对比:AI图像生成布局控制能力全面解析
深度对比Reve 2和Ideogram 4两款AI图像生成模型在布局控制方面的核心突破,分析精确布局技术路径、实用场景及行业趋势,帮助设计师和创作者把握AI可控生成的新方向。
科技前沿AI行业难得的平静日:信息过载时代的冷思考
当AI行业迎来罕见的平静一天,从业者该如何应对?本文从AINews简报出发,探讨高速发展中的喘息节奏、信息疲劳与内容价值的平衡,以及如何利用平静期进行技术深耕和战略思考。