System-1决策模型
用于AI Agent快速决策的小型分类器或轻量级语言模型,在单次前向传播中直接输出分类概率,不进行多步推理,以极低延迟和成本完成路由、过滤等决策任务
时间轴 (近 90 天)
一篇发表于arXiv的研究(arXiv:2610.02267)对System-1决策模型进行了配对评估,并对自己的评测流程进行了自我审计
System-1决策模型在单次前向传播中直接输出分类概率,以极低的成本和延迟完成决策
研究评测覆盖了11个Agent决策点,数据来自18个公开来源,共构建了7,283个基础案例,外加6,640个鲁棒性变体
研究采用字节级别完全相同的输入、配对统计检验以及跨硬件跨日期的可复现性校验
研究团队发现原本报告的23.9%成本节省,在纳入预筛选成本后修正为实际仅4.3%
报告中门控准确率58%被误当成端到端质量,而真实端到端质量为98%
设定5%目标时,在留出集上的漏检率最高可达17%,说明阈值在训练数据上的表现无法直接外推
注入误报的通道效应在使用通道原生内容后消失,表明它是实验设计的伪影而非真实现象
全部知识事实 (8)
一篇发表于arXiv的研究(arXiv:2610.02267)对System-1决策模型进行了配对评估,并对自己的评测流程进行了自我审计
50%待验证System-1决策模型在单次前向传播中直接输出分类概率,以极低的成本和延迟完成决策
50%待验证研究评测覆盖了11个Agent决策点,数据来自18个公开来源,共构建了7,283个基础案例,外加6,640个鲁棒性变体
50%待验证研究采用字节级别完全相同的输入、配对统计检验以及跨硬件跨日期的可复现性校验
50%待验证研究团队发现原本报告的23.9%成本节省,在纳入预筛选成本后修正为实际仅4.3%
50%待验证报告中门控准确率58%被误当成端到端质量,而真实端到端质量为98%
50%待验证设定5%目标时,在留出集上的漏检率最高可达17%,说明阈值在训练数据上的表现无法直接外推
50%待验证注入误报的通道效应在使用通道原生内容后消失,表明它是实验设计的伪影而非真实现象
50%