待验证50% 置信基准精确时间
试点实验让三个编程代理和八个模型各跑八次20分钟单次任务,标签感知F1从0.143到0.892方差极大
1
来源数
50%
置信度
长期有效
时效性
2026/9/14
首次发现
来源
涉及实体
相关事实
待验证Agent 任务需要模型多轮调用,12B 模型在消费级显卡上单次推理已需数秒,多步任务耗时会显著叠加76% 相似待验证在智能体场景中可用大模型生成高质量任务执行轨迹,再用这些轨迹微调参数量小10-100倍的模型来执行特定子任务73% 相似待验证AI智能体每一次与大模型的交互都会消耗Token,一次复杂任务可能触发数十次模型调用,每次调用延迟通常1-10秒72% 相似待验证在多智能体初步实验中给足8小时,程序基准最高只到30.04(单智能体为20.39),科学类智能体基准仅31.2,落后于对手的51.872% 相似待验证Anthropic招募了1053名程序员做对照实验,在正常任务中混入危险命令,人类放行了800条危险命令,机器只漏掉了6条71% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/919725API
curl https://kongchang.com/api/v1/knowledge/claims/919725MCP
get_claim(id=919725)