每日AI新鲜事·09月18日午间版:Qwen全模态发布与多Agent协作:P、y、T、o、r、c、h、
每日AI新鲜事·09月18日午间版:Qwen全模态发布与多Agent协作:P…
2026年09月18日(周五)午间版 AI新闻速递+热点深度讨论
2026年09月18日(周五)午间版 AI新闻速递+热点深度讨论
今天AI圈又热闹起来了, 一早上刷到好几条挺有意思的消息. 李博, 你上午应该也看到了吧?
看到了, 我觉得今天的料还挺足的. 全模态模型, 多Agent框架, 还有一个供应链安全的事情让我有点心惊.
对, 那我们先快速过几条新闻. 第一条, 今天B站上的AI早报提到, Qwen发了Qwen3-Omni Flash, 一个全模态的新模型.
重点是它支持百万token上下文, 而且音视频处理成本比之前降了93%以上. 这个降幅真的是有点离谱.
你的感觉没错, 93%这个数字确实很猛. 重点不在于它便宜, 重点在于音视频推理成本降这么多之后, 原来做不起来的应用就变得可以做了.
比如实时的多模态Agent, 以前每次调用音视频接口都很贵, 现在成本打下来, 跑在移动端或者可穿戴设备上就有了经济逻辑.
而且同一条早报里还提到了Mozilla的一个说法, 说开源和闭源模型的差距已经缩小到大概四个月了. 这个说法我有点半信半疑.
这个要看怎么定义「差距」. 如果是跑分的话, 确实越来越近. 但工程化能力, 还有在复杂Agent任务上的表现, 我觉得四个月这个说法还是偏乐观的.
行吧行吧, 这个争议暂时放着. 同一条早报里还有个小彩蛋, Grok 4.7出现在了谷歌云的配额页面上, 挺突然的.
这种事挺常见的, 配额页提前露出来说明上架在准备中了. 不过Grok在谷歌云上卖这个组合倒是有点意思.
好, 接下来说说PyTorch的消息. PyTorch Foundation官宣了, 今年12月10号会在东京办一场PyTorch Day Japan. 亚太区第一次这种规模的线下活动.
这个方向是对的. 亚太的开发者很多, 但长期以来这类顶级技术活动基本都在北美或者欧洲. 能在东京办, 对日本本地还有周边的中韩开发者都是好事.
然后还有一条能源方面的, 跟AI也有关系. TechCrunch报道了一个叫Mazama Energy的地热公司, 完成了一点三五亿美元融资, Khosla领投.
他们的路子是往地下钻到大概四点八公里深的地方, 那里的岩层超过350摄氏度, 用超临界流体来取热. 单口井能提供十五兆瓦的稳定电力.
这个跟AI的关联就是, AI数据中心现在最头疼的就是稳定供电. 太阳能风能都是间歇性的, 地热可以做基荷电源, 就是全天候不断电的那种.
对, 之前我们聊过超过六成选民反对在当地建AI数据中心, 核心原因之一就是耗电. 地热如果真能商业化, 这个阻力会小很多.
难点在「商业化」这三个字. 深层钻探的工程挑战极端复杂, 这轮融资主要是验证钻探技术本身. 从一口示范井到大规模复制, 还有很长的路.
最后一条新闻我觉得挺需要警惕的. Simon Willison的博客转发了一条Rust安全团队的警告, 说有人在定向攻击rust-lang的维护者.
手法是用招聘或者合作的幌子发起视频通话, 然后诱导对方装恶意软件或者执行剪贴板里预置好的恶意命令. 上个月已经有一个叫arrayref的crate中招了.
这个手法跟朝鲜APT的Operation Dream Job高度相似. 不只是Rust, 整个开源生态都有这个风险, 每一个有发布权限的维护者都是潜在攻击面.
文章里提到了一个比较务实的防御方式, 叫「依赖冷却期」. 就是新版本出来之后先等几天再升级, 让社区帮你排雷. 这个建议我觉得对大部分工程师都可以落地.
好了新闻就先聊到这儿, 接下来我们深入聊聊今天一个挺有意思的话题, 多Agent框架这块最近有条新闻火起来了.
B站上有个视频在讲一个叫Buzz的开源框架, 三万星, 最近互动分也挺高的. 李博, 你有了解这个吗?
看过一些. Buzz的核心创新是引入了类似Slack频道的机制, 让多个Agent能共享上下文, 然后再分工协作. 这解决的是单Agent模式下一个很经典的问题.
等一下, 你说「经典问题」, 具体指什么? 单Agent不就是一个AI自己干吗?
对, 单Agent最大的问题有两个. 一个是记忆断层, 任务长了它就忘前面干了什么. 另一个是错误级联, 一步错后面全错, 还没人帮它检查.
Buzz的思路是把任务拆开, 让不同Agent专门负责不同角色, 通过共享频道来保持上下文. 架构上分了三层, CLI执行, 调度运行时, 还有底层模型, 三层解耦.
三层解耦的好处是什么? 我理解是可以换模型?
你理解得对. 底层模型可以在Claude, Kimi, DeepSeek之间灵活切换. 这个对成本控制很重要, 比如简单任务用便宜的模型, 复杂任务才上贵的.
这个思路挺像软件工程里的依赖注入. 但我有个疑问, 多Agent协作感觉管理难度会大很多, Agent之间怎么对齐?
这正是视频里踩了很多坑之后总结出来的核心教训. 他们试过全AI流水线, 全自动化流水线, 最后发现都不行.
现在他们用的是V3版本的人机协作流程, 有三个关键点: 每个Agent必须有硬边界的角色定义, 中间有人工检查节点, 还有用JSON合约来对齐不同Agent之间的输出格式.
等等, 「人工检查节点」这个我觉得有点反直觉. 大家搞多Agent不就是为了减少人工介入吗? 现在又要人来查?
这就是有意思的地方. 文章的结论很直白, 多Agent协作本质上是一个管理问题, 不是编码问题. 你得管人, 一样得管Agent.
这个说法我挺认同的. 但我觉得还有个角度, 就是这个框架的成本怎么样? 你刚才说可以换模型, 但多Agent跑起来调用次数也会多很多吧?
这是真实存在的问题. 多Agent模式下API调用次数会显著增加. 所以Buzz强调灵活换模型这件事就更关键了, 不是所有步骤都需要最贵的模型来跑.
你再想想, Qwen3-Omni Flash今天的发布, 把音视频成本打下来93%, 这两件事其实是配套的. 推理成本往下走, 多Agent才真的用得起.
这个连接挺有意思. 一边是框架层在解决协作问题, 一边是模型层在降成本, 两个方向同时在推.
说到B站上的热点, 最近还有另外两条挺火的. 一个是有人用DeepSeek V4.1f根据单张照片复刻房间三维建模, 互动分两千多.
这个我看了. 单张照片推断三维结构这件事技术上本来挺难的, 需要模型有很强的空间推理能力. 能跑通说明V4.1f在几何理解上有实质进步.
还有一条是讲h3模型的, 说它不需要专门的开源图片编辑模型, 能直接出角色三视图. 这个对做游戏或者动画的人来说应该是很实用的功能.
三视图这个需求在游戏设计和3D建模里非常刚. 以前要出三视图你得专门画, 或者用专门的工具. 如果一个通用模型能顺手完成这件事, 工作流就直接少了一步.
不对吧, 通用模型输出三视图的一致性真的靠得住吗? 三个视角之间的比例不对的话, 建模师还是得手动修.
这个质疑是对的. 一致性确实是痛点. 但你想, 就算有20%的误差需要修, 总比从零画还是快多了. 现阶段能用就是好工具, 不用追求完美.
行, 这倒也是. 够用就行这个标准在内容生产里确实更实际.
还有一条有意思的, 有个视频在聊DeepSeek被伪装成本地部署的GPT来卖套餐, 标题都叫「我真的要伪装成本地部署GPT」. 这个我觉得挺值得聊的.
这件事背后有个现实逻辑. 就是普通用户对GPT品牌认知度远高于DeepSeek, 用GPT这个名字更好卖. 但这种包装方式其实挺有争议的.
对啊, 这都不只是品牌问题了, 用户根本不知道他们实际用的是什么模型. 你觉得这种做法怎么看?
我觉得挺扭曲的. 说明市面上还有很大一批用户根本不在意底层是什么模型, 他们只认品牌名字. 这对整个模型生态来说不是好事.
而且联系到B站上最近Token套餐横评视频互动分动不动就四万以上, 说明普通用户对怎么选套餐, 怎么用模型, 其实还有大量教育空间需要填.
所以总结一下今天聊的几个角度. Qwen3-Omni Flash把多模态成本打下来, 多Agent框架Buzz把协作问题往前推了一步, 两件事叠在一起, 说明Agent产品真正落地的条件越来越成熟了.
对. 结论就是, 推理成本往下走加上框架层的工程化成熟, 是多Agent产品大规模普及的两个核心前提. 现在两个条件都在同步推进.
今天就聊到这里, 消息太多了有点过瘾. 晚上见.
晚上见.
相关推荐
科技前沿AI行业罕见平静日:递归自我改进暗流涌动
AI领域迎来罕见的平静一天,多个资讯源集体沉默。但平静背后,递归自我改进(RSI)研究仍在持续推进。解读AI行业发展节奏与从业者应对策略。
科技前沿AI行业难得的平静日:信息过载时代的冷思考
当AI行业迎来罕见的平静一天,从业者该如何应对?本文从AINews简报出发,探讨高速发展中的喘息节奏、信息疲劳与内容价值的平衡,以及如何利用平静期进行技术深耕和战略思考。
科技前沿GLM-5.2登顶全球开源模型榜首:前端编码能力领跑业界
智谱AI发布GLM-5.2模型,在Artificial Analysis Intelligence Index评测中登顶全球开放权重模型榜首,同时被评为顶级前端编码模型。深入解析GLM-5.2的突破性表现与开源模型竞争格局变化。