待验证50% 置信事实精确时间
结果层的核心指标是任务整体成功率(Task-level Success)
1
来源数
50%
置信度
长期有效
时效性
2026/7/17
首次发现
来源
相关事实
待验证基于单元测试执行结果的奖励信号(Execution-based Reward)在提升代码正确率方面效果显著69% 相似待验证评测重心正从模型输出文本的质量转向Agent完成端到端任务的能力,评测维度从单一准确率扩展为包含任务完成率、步骤效率、错误恢复能力、时间开销等多维指标69% 相似待验证OpenAI内部测试数据显示,经过思维链分解的提示词在结构化任务上的准确率平均提升约30%-40%66% 相似待验证评估指标选择需与业务目标对齐,客服Agent优先任务完成率,代码生成Agent则更关注语法正确率和可运行率65% 相似待验证将反馈数据与具体执行上下文精确关联是定位问题根源和针对性优化提示词的关键65% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/541551API
curl https://kongchang.com/api/v1/knowledge/claims/541551MCP
get_claim(id=541551)