[控场AI]
科技前沿· 1 分钟阅读· 1,848 字

前沿论文解读·第6期:AI模型能力竞争与操作系统入口争夺

科技前沿

前沿论文解读·第6期:AI模型能力竞争与操作系统入口争夺

每周五解读本周最值得关注的AI研究论文

每周五解读本周最值得关注的AI研究论文

收听播客对话
0:004:41

欢迎回来,今天咱们前沿论文解读专栏聊点劲爆的。这周信息量巨大,我整理素材的时候都看傻了。

你说的是Opus 4.6和GPT-5.3那个对比,还是谷歌那个反重力的事儿?

都有都有。而且你发现没有,这周的主线其实特别清晰——巨头们都在抢下一代计算的入口。

对,一边是模型能力的白刃战,一边是谷歌直接从操作系统层往上掀桌子。咱们一个一个聊。

先说模型吧。Opus 4.6和GPT-5.3几乎同时发布,百万Token窗口直接成了标配。李博你怎么看这轮对比?

先抛结论:这轮没有碾压级胜者。两家都到了一个能力高原期,差异更多是风格层面的。

风格层面?你展开说说。

比如那个农夫过河的改编题,GPT-5.3快准狠,秒出正确步骤。Opus 4.6呢,慢一拍,但它用emoji画了每一步两岸的状态图。

这个我太有感触了。做产品的时候经常纠结,用户到底要快还是要好看。

本质上是两种产品哲学。OpenAI追求的是效率优先,Anthropic更在意表达的完整性和可解释性。

中文能力那个测试也挺有意思的。让模型写长相思词牌,格律居然都对了?

对,这才是真正让我惊讶的地方。格律这东西是硬约束,平仄押韵一个字都不能错。两家都做到了,说明中文语料的训练质量有质的飞跃。

GPT-5.3那句「一夜东风吹小红,柳丝摇暖空」确实有点意境。

Opus那个「花渐红,杏渐红」就稍微匠气了一点。不过说实话,能写到这个水平,很多中文系学生都未必能赢。

得了吧,你一个理工博士评价人家中文系。

我好歹也是个业余诗词爱好者好吧。不过说正经的,百万Token窗口这件事才是真正的分水岭。

怎么讲?

百万Token意味着你可以把一整个代码仓库、一整本书、甚至一个项目的全部文档一次性喂进去。这不是量变,是交互范式的质变。

所以这就跟谷歌那边的事情接上了。模型能力到了这个水平,下一步争的就是谁来承载这些能力。

没错,这就是谷歌Antigravity项目最值得关注的地方。他们不是在做一个新App,是在做操作系统。

我看了好几篇相关报道,谷歌这个Antigravity团队又出SDK又出OS,信息还特别碎。你帮我捋捋?

简单说,Antigravity是谷歌内部一个类似X实验室的团队,但更偏产品落地。他们同时推了三样东西:一个新OS、一套SDK、可能还有硬件参考设计。

谷歌已经有Android、ChromeOS、Fuchsia了,再来一个OS图什么呢?

图的是AI原生。你想想,现在的Android是为触屏设计的,ChromeOS是为浏览器设计的。但AI Agent时代需要什么?系统级的调度、跨设备协同、全新的权限模型。

就像智能手机时代不能继续用Windows XP一样。

完美类比。而且你注意到没,SDK是产品级发布,不是实验性项目。这说明谷歌内部已经跑通了完整的开发流程。

从产品经理角度看,这步棋太狠了。模型层大家打得难解难分,谷歌直接下沉到系统层去卡位。

对,这就是我说的掀桌子。你模型再强,也得跑在操作系统上面。谁控制了AI时代的OS,谁就控制了分发。

但这也意味着开发者要重新选边站了。这对行业是好事还是坏事?

短期是阵痛,长期是好事。竞争会倒逼标准化。就像当年Android和iOS竞争最终让移动开发变得更成熟一样。

说到这里我突然想到一个更大的问题。模型越来越强、系统越来越智能,我们到底在往哪个方向走?

你这个问题让我想到这周还有篇关于宇宙精细调节的文章。里面提到物理常数稍微变一点,整个宇宙就不存在了。

等等,你怎么从AI聊到宇宙学去了?

你听我说完。AI系统的设计其实也面临类似的精细调节问题。模型参数、系统架构、交互范式,每一个选择都会导向完全不同的技术宇宙。

你是说,我们现在做的每一个技术决策,都在筛选出某一种未来?

某种意义上是的。谷歌选择做AI原生OS,OpenAI选择死磕模型能力,Anthropic选择安全优先。这些选择最终会分叉出完全不同的技术生态。

好,那咱们最后收一下。这周的核心观察,你用一句话总结?

大模型的能力竞赛正在从模型层溢出到系统层,下一个战场是谁来定义AI时代的基础设施。

说得好。我补一个产品视角:当模型能力趋同,用户体验和生态才是真正的护城河。

留个思考题给听众吧。如果AI原生操作系统真的来了,你现在用的哪些App会第一个被淘汰?

这个问题太刺激了,欢迎大家在评论区聊聊。我们下期前沿论文解读见。

分享:

相关推荐