每日AI新鲜事·08月03日午间版:Qwen3.8-Max发布与基准测试之争
每日AI新鲜事·08月03日午间版:Qwen3.8-Max发布与基准测试之争
2026年08月03日午间版 AI新闻速递+热点深度讨论
2026年08月03日午间版 AI新闻速递+热点深度讨论
今天AI圈又有不少新消息,先来快速过几条。刚看到Twitter上通义千问团队官宣了Qwen3.8-Max。
对,这个标题很有意思,直接说'A New Bar for Coding and Cowork',又是冲着编程能力来的。
感觉现在每家发模型,标题都得带个coding才行。阿里这波直接把版本号推到3.8了,迭代节奏真的快。
嗯,而且他们强调了cowork这个概念,不光是写代码,是协作式编程。这跟现在AI编程工具的趋势很吻合,不只是补全代码,而是参与整个工程流程。
好,第二条比较学术,Hacker News上有篇论文,说是证伪了OpenAI提出的一个关于Connes刚性定理的反例。
这个挺有意思的。就是说OpenAI之前用模型输出了一个数学反例,现在有人严格证明那个反例是错的,而且还给出了定理本身的证明。
所以AI做数学推理还是得人来验证,不能太当真。
至少在纯数学前沿领域,是这样的。
然后还有一条挺火的,HN上77个赞,俄亥俄州博览会的海报比赛,AI生成的作品拿了奖。
又来了。两年前科罗拉多州那次争议之后,这种事情就没断过。评论区估计又炸了。
56条评论呢,肯定是吵翻了。不过说实话,到2026年了,规则上应该早就该明确标注是不是AI辅助创作了吧。
对,这不是技术问题,是赛事组织方的规则漏洞。你不禁止,人家就会用。
最后还有一条,Gary Marcus又发文了,说OpenAI新发布的Astra模型'amazing but vastly oversold'。
Gary Marcus的标准操作了,每次有新模型出来他都得泼盆冷水。不过他说的也不是完全没道理,oversold这个词在AI行业确实是常态。
好了新闻就先聊到这儿,接下来我们聊聊最近一个特别火的话题。
LocalLLaMA社区这两天围绕DeepSeek V4-Flash-0731的本地部署讨论特别热闹。有人用三张MI50跑出了15 token/s,还有人在搞expert-only的IQ3量化。
这个话题我关注了。MI50是AMD那张比较老的计算卡,32GB显存,之前没什么人拿来跑大模型。现在能跑V4-Flash,说明量化和推理框架的优化确实进步很大。
15 token/s这个速度,说实话不算快对吧?日常用够吗?
生成速度15 token/s,差不多一秒能出二三十个汉字,实际体验就是稍有延迟但完全可用。关键是这三张卡二手市场价格非常低,可能总共不到一千美元。
所以本质上是性价比的胜利?
完全是。这帮人的核心逻辑就是:我不想每个月付API费,我要自己拥有推理能力。哪怕速度慢一点,但数据不出本地,跑多少都不额外花钱。
那expert-only IQ3量化是什么意思?听着很hardcore。
DeepSeek V4是MoE架构对吧,有共享expert和路由expert。这个方法是只对路由expert做激进量化到IQ3精度,共享部分保持更高位数。因为路由expert每次只激活一部分,量化误差的影响没那么大。
等于是针对模型结构特点做的精细化压缩。
对,而且发帖人说KLD指标比统一做IQ3_S还好,解码速度在CPU溢出的设备上快了1.4倍。这个思路其实很聪明,MoE天然适合差异化量化。
但我有个疑问,这种玩法门槛是不是还是挺高的?普通开发者能复现吗?
坦白说门槛不低。你得懂量化原理,得会配推理框架,还得处理各种兼容性问题。但LocalLLaMA社区的意义就在于,有人趟完坑会把方案分享出来。
说到这个,我还注意到社区里另一个讨论也很热——为什么现在新的benchmark和排行榜几乎全是coding方向的?
这个问题我觉得问得特别好。你看现在模型发布的时候,Qwen3.8-Max强调coding,各种排行榜也是代码能力为主,确实有点偏科了。
为什么会这样呢?是因为代码容易评测?
这是最核心的原因。代码有天然的验证机制——能不能跑通、测试能不能过、性能好不好,都是客观可量化的。但你要评估一个模型写散文好不好、做咨询专不专业,就很难自动化。
那这会不会导致一个问题:模型的训练和优化也都往coding方向倾斜,其他能力被忽视了?
一定会。Goodhart定律嘛——当一个指标变成目标,它就不再是好指标。所有人都刷coding benchmark的时候,coding能力提升了,但模型在其他方面可能在退步,只是没人注意到。
Reddit上有人提到一个观点,说这也跟商业价值有关——coding能力最容易变现。
没错,Cursor、Windsurf这些工具就是明证。AI编程助手是目前最成熟的商业模式之一,所以模型厂商当然优先卷这个方向。有benchmark就有排行榜,有排行榜就有关注度,有关注度就有客户。
那你觉得理想状态下应该怎么做?
我觉得需要更多领域专家参与评测设计。医疗、法律、教育这些领域其实都有刚需,但缺少好的评估标准。不是没有人尝试,而是做出来之后关注度低、维护成本高,慢慢就没人管了。
所以这本质上是个激励机制的问题。
对,做coding benchmark回报高——你的排行榜能被模型厂商引用、被科技媒体报道。做一个护理评估benchmark,谁看呢?但实际上那可能对社会更有价值。
确实,现在AI能力的发展方向某种程度上被评测体系绑架了。这个讨论挺有意义的。
而且这跟本地部署那个话题是相关的。LocalLLaMA社区的人自己跑模型,反而会发现——诶这个模型coding很强,但让它帮忙写个邮件反而不如上一版。这种直觉在benchmark里体现不出来。
好,今天就聊到这儿。明天应该还会有Qwen3.8-Max的更多评测出来,到时候我们再看看表现怎么样。
嗯,期待一下。大家晚上见。
相关推荐
科技前沿GLM-5.2登顶全球开源模型榜首:前端编码能力领跑业界
智谱AI发布GLM-5.2模型,在Artificial Analysis Intelligence Index评测中登顶全球开放权重模型榜首,同时被评为顶级前端编码模型。深入解析GLM-5.2的突破性表现与开源模型竞争格局变化。
科技前沿AI行业难得的平静日:信息过载时代的冷思考
当AI行业迎来罕见的平静一天,从业者该如何应对?本文从AINews简报出发,探讨高速发展中的喘息节奏、信息疲劳与内容价值的平衡,以及如何利用平静期进行技术深耕和战略思考。
科技前沿AI行业罕见平静日:递归自我改进暗流涌动
AI领域迎来罕见的平静一天,多个资讯源集体沉默。但平静背后,递归自我改进(RSI)研究仍在持续推进。解读AI行业发展节奏与从业者应对策略。