每日AI新鲜事·08月17日午间版:Qwen3.8过度思考与Agent Skills
每日AI新鲜事·08月17日午间版:Qwen3.8过度思考与Agent Sk…
2026年08月17日(周一)午间版 AI新闻速递+热点深度讨论
2026年08月17日(周一)午间版 AI新闻速递+热点深度讨论
今天周一,AI圈的消息倒是挺有意思的,有几条我觉得值得聊聊。
周一嘛,攒了周末的料,来吧。
先说第一条,Simon Willison在博客上写了篇文章,说Qwen 3.8的27B版本很优秀,但有个问题——默认会overthink,想太多。
这个我有印象,Hacker News上54分20条评论,讨论度不低。其实之前我们聊过Qwen3.8那个2.4万亿参数的大版本,这次是27B的小模型。
对,小模型也继承了大模型的毛病。Simon说它质量确实好,但回答问题的时候会过度推理,绕很大一圈才给结论。
这其实是现在推理模型的通病。训练的时候用chain-of-thought奖励太重了,模型就学会了什么问题都要深思熟虑一番,哪怕你问它一加一等于几。
得了吧,一加一还不至于,但确实简单问题也要铺垫半天挺烦的。
所以现在很多模型都在做thinking budget的控制,让用户能选择要不要深度推理。Qwen这边可能还需要调优一下默认行为。
好,第二条挺有意思。Hacker News上有篇文章标题特别猛——年轻人对AI公司CEO的厌恶程度强烈到令人难以置信。
56分38条评论,这话题果然能引战。
Futurism报道的一个调查,说年轻群体对AI行业高管的反感情绪特别强烈。具体原因文章里展开了,但这个趋势本身就挺值得关注的。
不意外啊,你想想这两年AI对就业市场的冲击,年轻人刚毕业就发现很多岗位被压缩了,他们的情绪肯定要找个出口。
而且这些CEO天天在社交媒体上高调发言,确实容易成为靶子。
没错,越高调越挨骂,这是铁律。
再快速过两条。Racket语言生态下的Rhombus发布了1.1版本,HN上15分7条评论,算是小众语言圈的事。
Rhombus是Racket上面的一个新语法层,走的是现代化表面语法的路线。关注的人不多但社区质量挺高。
最后一条,物理学家在质子内部发现了一种隐藏的胶子结构,Science Daily的报道。这算纯科学新闻了。
跟AI没啥关系,但说明基础物理还有很多未知结构等着被揭开。挺酷的。
好了新闻就先聊到这儿,接下来我们聊聊最近一个特别火的话题——Matt Pocock的Agent Skills。
这个话题我很想展开聊。Matt Pocock之前以TypeScript教学出名,现在他搞的这个skills项目在B站的讨论度非常高。
对,他上了一个播客叫Unhandled Exception,第88期,专门讲他做skills背后的思路。核心概念是让AI反过来拷问你。
这个思路其实挺颠覆的。我们平时用AI助手,都是我们给它指令,它执行。但skills的设计理念是——AI不确定的时候,应该主动向你提问来澄清需求。
等等,这跟之前那种简单的clarification question有什么区别?很多chatbot都会追问的呀。
区别在于结构化。Skills不是随便问你一句,而是把一整套交互模式封装成可复用的技能包。你可以理解为,给AI定义好了在什么情境下该问什么问题、怎么组织对话流。
所以这就是为什么叫skills而不是叫prompts。它不只是一段提示词,是一个交互协议。
没错!而且Matt这个项目之前就火过了,十六万星七百万次下载。这次上播客等于是系统性地把设计哲学讲清楚了。
从产品角度我觉得这个方向特别对。业内做AI产品最头疼的就是用户给的需求太模糊,模型又不敢追问,只能硬猜,猜错了用户就觉得AI笨。
对,所以现在越来越多agent框架在强调这个——不要假装你什么都懂,该问就问。这比闷头干活然后交个错误答案好一百倍。
但这里有个平衡问题吧?问太多用户也烦,问太少又容易跑偏。
这就是skills这个框架要解决的核心问题。它让开发者预定义好哪些参数是必须澄清的、哪些可以用默认值。相当于给AI画了条线——这条线以上你自己决定,以下你必须问人。
这跟DeepSeek Harness的思路有点像。我看B站上小马哥的技术周报也在讨论DeepSeek Harness,说它的设计和很多传统软件设计有类似之处。
你说得对,这两个东西本质上都在解决同一个问题——怎么把agent的行为约束在一个可控的框架里,同时又不丧失灵活性。
DeepSeek Harness那个项目现在star数都快十万了吧?
是的,八万多快九万了,速度非常快。它做的事情简单说就是给agent套一个harness,一个缰绳,让它在一定范围内自主行动但不失控。
所以现在整个行业的共识是——纯粹自由的agent不靠谱,必须有结构化的约束。
可以这么说。从去年到今年,大家从狂热追求全自主agent,慢慢转向了半自主加人在环的模式。Matt的skills和DeepSeek的harness都是这个大趋势下的产物。
而且你注意到没有,这两个项目都特别强调开发者体验。不是面向终端用户的,是给搭建agent的开发者用的基础设施。
没错,这说明市场已经走过了demo阶段,进入了工程化阶段。大家不再满足于看AI秀操作了,而是真的要把它嵌到生产流程里去。
这个判断我同意。之前LangChain和LangGraph刚发V1.0,也是同样的信号——框架层面在走向稳定和标准化。
对,整个生态在成熟。从模型层到框架层到工具层,每一层都在从wild west走向有序。
好吧,那今天就聊到这儿。总结一下,Qwen小模型优秀但想太多,年轻人恨AI大佬,以及agent工程化是当前的主旋律。
精准概括。行了小雨,晚上见。
晚上见!
相关推荐
科技前沿GLM-5.2登顶全球开源模型榜首:前端编码能力领跑业界
智谱AI发布GLM-5.2模型,在Artificial Analysis Intelligence Index评测中登顶全球开放权重模型榜首,同时被评为顶级前端编码模型。深入解析GLM-5.2的突破性表现与开源模型竞争格局变化。
科技前沿Reve 2与Ideogram 4对比:AI图像生成布局控制能力全面解析
深度对比Reve 2和Ideogram 4两款AI图像生成模型在布局控制方面的核心突破,分析精确布局技术路径、实用场景及行业趋势,帮助设计师和创作者把握AI可控生成的新方向。
科技前沿Claude Slack智能体升级:多人协作、主动响应与持久记忆全解析
Anthropic为Claude推出Slack集成重大升级,新增多人协作、主动响应和持久记忆三大核心能力,将AI从被动问答工具转变为真正的团队协作伙伴,重新定义企业级AI智能体应用标准。