每日AI新鲜事·09月14日晚间版:Agent容错与AI治理博弈
每日AI新鲜事·09月14日晚间版:Agent容错与AI治理博弈
2026年09月14日(周一)晚间版 AI新闻速递+热点深度讨论
2026年09月14日(周一)晚间版 AI新闻速递+热点深度讨论
今天AI圈又有不少新动静, 来自Reddit, HN, 还有几篇挺有意思的论文, 我们快速过一遍.
第一条, 从Reddit的LangChain社区来的. 有个开发者做了一个叫Resumate的工具, 专门给LangGraph的Agent加了一层repair-and-resume能力, 现在免费公测.
它解决的核心问题是LangGraph原生重试的两个缺陷. 第一, 每次重试方式一模一样. 第二, 不记录历史状态. 所以失败了再试, 还是以同样的方式失败.
对, 这个痛点非常真实. 你想想一个Agent在生产环境跑, 中途调API失败了, 它重试三次都用同一个姿势去敲, 那不是白费?
Resumate做的事情是, 把历史失败和修复的配对存下来, 下次碰到一样的错误直接复用已验证的解法. 另外还做了一个副作用防重, 比如Stripe扣款这种不可逆操作, 成功了就不会因为重试再触发一次.
这个副作用防重感觉是真的痛点. Agent要是在支付环节失败了再重试, 用户被扣两次钱, 那就是生产事故.
而且作者自己也说得很清楚, 有三个局限. 一是它依赖异常来检测错误, 错了但没抛异常它不知道. 二是副作用保护要手动接入. 三是不支持回滚.
能把能力边界说清楚的开源作者, 我反而更信任. 免费公测阶段, 专门跑LangGraph加Python的团队可以试试.
说得对. 好, 第二条消息, 来自HN, 这条挺有意思的. Airbnb在搞一件事, 限制别人使用BnB这个缩写.
就是Bed and Breakfast那个BnB. 这个词比Airbnb早多了, 本来是业内通用说法. 但Airbnb说我的品牌名就叫Airbnb, 所以我对BnB有商标权.
这个逻辑其实在法律上是个灰区. 通用词汇按商标法是不受保护的. 但Airbnb硬说自己的品牌是从这个词里来的, 所以它有权限制别人用.
受影响的就是那些真正做民宿的小B&B, 他们用了几十年的行业词汇, 现在平台说不让用就不让用.
这其实就是大平台对语言本身的管控延伸. 不只是定价和流量, 连词汇都可以圈起来. HN上大家讨论得挺激烈.
好, 然后还有一条, 也是HN上的, 来自Cohere的一篇博客, 标题叫「谁有权为AI制定规则?」.
文章识别出三股力量. 科技大厂, 政府监管, 还有学术和开源社区. 三方都有问题, 大厂自己当裁判, 政府立法速度跟不上, 开源社区开放了又带来滥用风险.
这个问题在2026年格外尖锐. 你看前几天Dario Amodei发公开信说要主动降速, Sam Altman他们表示认可, 但特朗普和国会那边明确反对. 就是这三方博弈的真实缩影.
对, 各说各话, 而且动机都不一样. 文章最后说多利益相关方协作是出路, 但你觉得这个在现实里能落地吗?
难. 问责链条建立起来之前, 这个局面大概率还是大厂说了算. 因为规则本身就是他们在写.
然后快速带两条论文. 一条是arXiv上关于古兰经背诵自动评分的研究, 挺小众但有点意思.
他们发现AI定位背诵异常的F1能到零点七八以上, 但判断是哪种类型的错误, F1只有零点五左右. 核心瓶颈不是检测能力, 而是跨度边界怎么裁定这种人为约定.
这个规律放到宗教, 法律这类高度依赖约定的场景里都成立. 模型能找到异常, 但没法理解人类约定俗成的判断标准, 这是很多垂直场景落地时的真正瓶颈.
还有一篇叫CCPS, 是给LLM推理的序列蒙特卡洛方法做的改进. 传统方式在拉平粒子权重时, 会把低权重的推理路径直接砍掉, 导致搜索空间多样性下降.
CCPS的思路是, 设置最大最小权重之比的上界, 不强制拉平, 保留更多不同的推理路径. 最后投票时也是用语义聚类之后按独立路径数量来决定, 而不是简单多数.
效果怎么样?
在三个模型, 五个推理基准上测, 十五个设置里十四个都超过了基线, 最高绝对提升超过十个百分点. 而且全程不用微调模型.
好了新闻先聊到这儿, 接下来我们深入聊聊今天B站上一个很火的话题, 是关于RP场景离开DeepSeek之后的体验.
那条视频标题写的是「离了DeepSeek才知道, RP外面的世界根本没下雨」, 互动分快到三万三了. 这到底在讲什么?
RP就是Role Play, 角色扮演. 这个圈子一直是AI应用里非常活跃的一块, 但主流讨论里很少被认真对待.
视频的核心观点是, DeepSeek在RP场景下的体验, 跟其他模型差距大到用户觉得「根本没下雨」. 你切换回其他模型, 感觉就像进了一个干旱地带.
这个比喻太生动了. 但我想追问一下, 为什么RP这个场景, DeepSeek会表现得更好? 这不是纯粹的推理任务啊.
重点不在推理能力, 在两个东西. 一是人物一致性, 扮演一个角色能不能从头到尾保持性格稳定. 二是情绪颗粒度, 就是回应有没有细腻的情绪层次, 而不是平铺直叙.
很多大模型在这两点上会被安全策略拉垮. 一旦涉及情绪冲突或者灰色地带的对话, 模型就开始绕, 开始说「作为AI我不能」, 整个沉浸感直接碎掉.
我理解了. 所以DeepSeek在这个场景下相对宽松, 加上中文语境的细腻度, 所以RP用户对它的依赖度很高?
基本上是这样. 而且你再想想, RP用户是一群使用频次极高, 对话轮次极长的用户. 他们对模型的理解深度比普通用户强多了.
所以他们的反馈其实是一种很高强度的测试. 他们能发现普通用户两三轮对话发现不了的问题.
对. 长对话里的记忆一致性, 跨主题的角色稳定性, 这些都是RP场景天然会暴露的问题. 普通问答根本不会碰到.
不对吧, 李博. 我想反驳一个地方. RP用户说DeepSeek好, 这会不会有幸存者偏差? 就是最活跃的那批人留在了DeepSeek, 所以声音最大.
这个反驳有道理. 但你看互动数据, 光这一条视频就快三万三了. 而且B站上这类RP评测内容的热度一直很高, 不是个别用户的偏好.
另外这个话题为什么此刻火起来? 我觉得和最近CommandCode Go这类工具的讨论有关. 大家在各个垂直场景重新审视不同模型的边界在哪里.
说到CommandCode Go, B站上还有一条视频互动分一千多, 是讲把CommandCode Go接进OpenCode里, 标题说一美元当十美元用. 这是什么思路?
CommandCode Go是Cohere出的一个代码模型, 定价比较便宜. OpenCode是一个开源的命令行编程工具, 类似Claude Code那种. 把两个接在一起就是用便宜的模型跑编程Agent.
所以本质上还是成本问题. 大家在想怎么用更低的钱, 跑出接近顶级模型的编程效果.
对. 而且这条视频互动分虽然不高, 但受众非常精准. 愿意自己接CLI工具的人, 都是在认真算API成本的工程师.
这让我想到一个更大的问题. 我们现在看到的, 不管是RP用户对DeepSeek的依赖, 还是工程师在算CommandCode的成本, 都说明一件事.
用户已经足够成熟了, 他们在主动给不同模型分类, 按场景选工具. 不再是谁发布了就用谁.
你这个角度很有意思. 小雨说得对. 这其实是市场分层在加速. 顶层拼的是推理能力和安全边界, 中层拼性价比, 垂直场景拼的是某个很细的维度做得有多好.
DeepSeek在RP这个细分场景成了标杆. CommandCode Go在成本这个维度做到了用户愿意主动折腾CLI去接. 这种分层以前是不存在的.
所以总结一下就是, 单一大模型通吃所有场景的时代可能已经过了. 不同用户群在用脚投票, 按需选模型, 这才是2026年AI应用的真实状态.
而且这对厂商也是个信号. 与其在所有维度都做到七十分, 不如在某个关键维度做到九十分, 然后把最在乎那个维度的用户留住.
好, 今天就聊到这里. 从Agent容错机制到RP场景的模型选择, 感觉用户和开发者都在往更精细的方向走. 明天见.
明天见.
相关推荐
科技前沿AI行业罕见平静日:递归自我改进暗流涌动
AI领域迎来罕见的平静一天,多个资讯源集体沉默。但平静背后,递归自我改进(RSI)研究仍在持续推进。解读AI行业发展节奏与从业者应对策略。
科技前沿AI行业难得的平静日:信息过载时代的冷思考
当AI行业迎来罕见的平静一天,从业者该如何应对?本文从AINews简报出发,探讨高速发展中的喘息节奏、信息疲劳与内容价值的平衡,以及如何利用平静期进行技术深耕和战略思考。
科技前沿GLM-5.2登顶全球开源模型榜首:前端编码能力领跑业界
智谱AI发布GLM-5.2模型,在Artificial Analysis Intelligence Index评测中登顶全球开放权重模型榜首,同时被评为顶级前端编码模型。深入解析GLM-5.2的突破性表现与开源模型竞争格局变化。