每日AI新鲜事·09月17日早间版:DeepMind泄露与AI基准测试
每日AI新鲜事·09月17日早间版:DeepMind泄露与AI基准测试
2026年09月17日(周四)早间版 AI新闻速递+热点深度讨论
2026年09月17日(周四)早间版 AI新闻速递+热点深度讨论
今天AI圈的消息挺杂的, 有金融, 有自动驾驶, 还有一个让我看了有点兴奋的技术进展. 李博, 你今天早上都刷到啥了?
我一直在看那个FlashAttention 4的东西, 但先别急, 新闻先过一遍, 有几条挺值得说的.
行, 那先快速过一下. 第一条, 刚看到TechCrunch上说, X宣布要让美国用户直接通过Cashtags交易股票了.
就是以前你在X上看到$AAPL, 点进去是信息聚合页. 现在直接能在里面下单, 不用跳第三方券商了.
马斯克这个万能应用的路子一直在走, 支付, 交易, 全往里塞. 但你想想, X上的金融讨论氛围, 那散户情绪一旦能直接转化成交易, 这波动能放大多少?
对啊, 我就在想这个问题. 社交情绪本来就容易带节奏, 现在讨论现场直接变交易现场, 监管那边怎么看这件事?
合作券商, 资产类别, 费率这些细节都还没披露. 现在信息太少, 这个功能到底怎么跑起来, 还得等落地再看. 不过方向上, 这是典型的把流量变金融的玩法.
然后还有一条, 也是TechCrunch的, 前Waymo的CFO Elisa de Martel, 跳槽去英国自动驾驶创业公司Wayve了.
这个有点意思. Waymo背靠Alphabet, 是行业标杆. 她一月才离职, 现在去一个英国的创业公司, 这种资历的财务高管这个时间点做这个选择, 通常意味着那边要有大动作, 融资或者上市.
Wayve走的是端到端AI学习的技术路线, 跟Waymo不一样. 她常驻硅谷办公, 说明这家英国公司对美国资本市场很重视.
对, 说白了就是要去融美国的钱. 具体职责没公开, 但高管从巨头流向初创这个信号本身, 行业里都会读出来.
接下来说说PyTorch Conference. 官网刚发了公告, 今年北美的会定在十月二十号二十一号, 加州圣何塞, 主题是开放研究, 工具链和性能优化.
这个时间点搞这个会, 核心压力就是AI芯片生态越来越分散. 不光英伟达, 各家都在搞自己的加速卡, 框架层要让同一份模型代码在不同硬件上都跑得好, 这个难度是真的高.
Triton那个内核DSL就是干这个的对吧?
对, Triton加上torch.compile这两个是PyTorch现在应对异构硬件的主要手段. 说白了就是, 你写一次代码, 它帮你编译到不同硬件上去. 训练推理成本现在是硬约束, 这个方向是绕不过去的.
然后最后一条新闻我觉得特别值得说一下. PyTorch博客上出了一篇关于FlashAttention 4的技术文章. FA4 MX8, 专门为英伟达Blackwell架构设计的.
这个我今早一直在看. 重点不在于版本号更新, 重点在于它把MXFP8这个低精度格式贯穿到注意力机制的前向和反向传播里去了.
以前FP8是张量级别的缩放, 精度容易出问题. MXFP8是块级别的共享缩放因子, 能更好地处理注意力计算里那种数值剧烈变化的场景.
等一下, 你说的块级别共享缩放是什么意思? 能说人话一点吗?
你可以这么想. 传统FP8是整个张量用一个缩放参数, 就像一把尺子量所有东西. 但注意力计算里有些地方数值很大, 有些很小, 一把尺子量不准.
MXFP8是把数据分成小块, 每块用自己的缩放因子, 精度就稳多了. 然后实测前向吞吐达到两点八五PetaFLOPS, 反向两PetaFLOPS. 这是真的进到PetaFLOP级别了.
这对训练成本影响大吗? 因为我们前几天也聊到训练和推理成本一直是卡脖子的问题.
训练和推理都受益. 但要注意, 论文里说了不同模型形状之间性能差异很明显, 落地还是要针对具体模型验证. 不是说拿过来直接就快这么多.
好, 新闻先到这儿. 接下来我们深入聊聊最近两个特别火的话题. 一个是Google DeepMind的RSI泄露传言, 另一个是AI基准测试这个老问题最近又被拿出来讨论了.
李博, 先说DeepMind这个. B站和YouTube上都有人在聊, 说是GPT-6 Astra被削弱了, 还有Kimi K2.8代码相关的消息. 你怎么看这些传言?
我的结论先说: 这类泄露消息, 一半是真实信号, 一半是信息噪声. 关键要看谁在传, 怎么传.
DeepMind的RSI, 也就是递归自我提升相关研究方向, 这个在业内一直有讨论. 如果泄露的是内部进展而不是产品发布计划, 那这类消息的置信度其实比较低.
GPT-6 Astra被削弱这个说法, 我看B站评论区争得挺厉害的. 有人说是主动降低能力防止失控, 也有人说就是产品策略调整.
这两种解读都有可能. 但你想想, 如果一个模型能力强到需要主动削弱, 那首先要问的是, 怎么界定强到需要削弱? 这本身就是一个没有共识的问题.
不对吧, 我觉得这里有个矛盾. 各家都在卷性能, 现在又说要主动削弱, 这个逻辑能说通吗?
你这个追问很好. 说通的方式是这样的: 面向消费者和面向研究内部用的是两个版本. 对外发布的可能确实经过了能力裁剪, 内部研究版本还是跑全量的.
Anthropic在Fable 5这条线上其实也有类似的做法. 对外的版本和内部评估版本能力表现不完全一样.
那Kimi K2.8代码这块呢? 这个我不太了解背景.
Kimi K2.8如果是代码专项版本的话, 这个方向其实我们最近也有聊到. 垂直任务专用模型在特定领域打败通用大模型, 这个趋势现在很明确. Kimi系列在代码任务上本来就有投入.
对, 我们今天在别的地方也聊到SWE-2用Kimi K3做基座, 效果还不错. 所以K2.8如果是代码专项, 逻辑上是延续的.
但这类泄露消息的问题在于, 你没法验证来源. 我的建议是, 把它当作行业动向的参考, 别当成确认事实来传. 等官方发布才是靠谱的信号.
然后B站上还有个视频我觉得挺有意思的, 标题叫「我真的要伪装成本地部署GPT」, 讲的是用DeepSeek大肥鱼这个思路来做什么?
这个其实是B站上很有代表性的一类内容. 就是把商业API包装成本地部署的样子给企业客户用, 本质上是一种部署架构的伪装. 互动分能到一千四百多, 说明这个需求在开发者里很真实.
为什么企业会需要这个? 直接用API不行吗?
数据合规问题. 很多企业的数据不能出境, 或者内部规定不能走外部API. 但自己真的做本地部署成本又很高. 所以这种中间层方案就有市场了.
这就有点灰色了啊. 合规层面怎么说?
这是真正的风险点. 如果客户以为数据是本地处理, 结果实际还是出去了, 这个责任很麻烦. 所以这类方案要做的话, 透明度是关键, 客户得知道数据流向.
好, 那我们来聊聊第二个大话题. AI基准测试这件事. YouTube上有个视频叫「How To Benchmark AI Models Yourself」, 讲自己动手测模型, 为什么最近这个话题又火起来了?
因为大家开始不信官方基准了. 这是核心原因.
你看最近这些发布, 各家都说自己在某个榜上第一, 但用户实际用起来感受完全不一样. 这个落差积累到一定程度, 就会有人站出来说, 我自己测.
我理解这种感受. 官方说的分数跟实际体验对不上, 这个挫败感是真实的.
根本问题是, 现有的基准大多是固定题库. 模型训练的时候可能见过类似的数据, 或者专门针对这些基准做了优化. 这个叫benchmark contamination, 基准污染.
等一下, 你说专门针对基准优化, 这不就是作弊吗?
不能说作弊, 但确实是一种过拟合. 就像学生只刷考试真题, 分数高但实际能力不一定强. 模型也是一样.
所以自己动手测这件事的价值就在这里. 你用自己的真实业务场景来测, 结果对你的意义远大于任何官方榜单.
但普通用户或者小团队哪有资源自己做基准测试? 这个门槛不低吧.
门槛没你想的那么高. 核心方法其实很简单: 收集你自己业务里真实出现过的问题, 整理成一个小测试集. 然后让不同模型跑一遍, 人工评分或者用另一个模型评分.
用另一个模型来评分这个靠谱吗? 会不会有偏好?
这是个真问题. 研究里叫LLM as judge, 模型当裁判这个方法已经有一定实践了. 确实存在偏好问题, 比如有些模型评分会偏向更长的回答, 或者偏向和自己风格接近的回答.
所以比较好的做法是, 同时用两三个不同家的模型来评, 再加上人工抽检. 多数情况下足够用了.
那自己测的时候有什么常见坑?
第一个坑, 测试集太小. 几十道题的结论其实很不稳定, 随机性很高. 至少要几百道才有参考价值.
第二个坑, 只测你擅长的场景. 你自己整理的题目天然会偏向你熟悉的领域, 但模型在其他场景的表现你就不知道了.
第三个呢, 肯定还有第三个.
第三个是提示词不一致. 你给不同模型的提示词如果不一样, 测出来的根本不是模型能力, 是提示词工程能力. 要保证相同的输入才能比较输出.
这个点很关键. 业内确实有人因为提示词没控制好, 测出来的结论完全跑偏的.
还有一个更底层的问题, 你测的指标是什么? 速度, 准确率, 成本, 这些之间有取舍. 你得先想清楚对你最重要的是哪个, 再设计测试.
所以这个话题为什么现在火? 我觉得是因为模型太多了. 以前选择少, 跟着官方榜走就行. 现在一堆模型声称自己是最强, 用户不得不自己判断.
你说到点子上了. AI工具市场现在已经进入了一个阶段, 能不能用不是问题, 值不值才是问题. 这倒逼用户要有自己评估的能力.
总结一下: 官方基准参考价值有限, 自建测试集门槛不高但有方法论要求. 控制好提示词一致性, 测试集规模够大, 指标和业务对齐, 这三点做到了就比大多数人的评估靠谱.
好, 还有一个快速提一下. HackerNews上有个帖子在讨论用四B参数的模型来做数据库查询优化, 说生成的执行计划比Postgres原生快81%, 这个你怎么看?
学习式查询优化这个方向不新, MIT的Neo和Bao早就在做了. 但这次用大模型时代的训练方法来搞, 工程上更简洁. 四B这个规模是权衡的结果, 要在毫秒级延迟里完成推理, 不能太大.
81%这个数字听起来很夸张, 但实际落地能用吗?
这是核心问题. 数据库最怕的是最坏情况, 优化器偶尔生成一个极差的执行计划会导致查询超时. 模型的泛化能力和可靠性没有传统规则系统那么可解释. 所以现阶段更务实的做法是把它当传统优化器的增强层, 不是完全替代.
好, 那今天就聊到这儿吧. X的Cashtags交易, Waymo高管跳槽, PyTorch会议, FA4 MX8的性能进展, 还有AI基准测试和数据库查询优化, 今天内容还挺密集的. 中午见.
中午见.
相关推荐
科技前沿AI行业罕见平静日:递归自我改进暗流涌动
AI领域迎来罕见的平静一天,多个资讯源集体沉默。但平静背后,递归自我改进(RSI)研究仍在持续推进。解读AI行业发展节奏与从业者应对策略。
科技前沿AI行业难得的平静日:信息过载时代的冷思考
当AI行业迎来罕见的平静一天,从业者该如何应对?本文从AINews简报出发,探讨高速发展中的喘息节奏、信息疲劳与内容价值的平衡,以及如何利用平静期进行技术深耕和战略思考。
科技前沿GLM-5.2登顶全球开源模型榜首:前端编码能力领跑业界
智谱AI发布GLM-5.2模型,在Artificial Analysis Intelligence Index评测中登顶全球开放权重模型榜首,同时被评为顶级前端编码模型。深入解析GLM-5.2的突破性表现与开源模型竞争格局变化。