Unverified80% confidenceEventTime unknown
实验中当工具返回2的8次方等于200(错误答案)时,模型选择信任自身知识(256)而非工具返回结果
1
Sources
80%
Confidence
Long-term
Relevance
6/3/2026
First Seen
Valid until: 9/1/2026
Sources
从Cursor系统提示词看Function Calling与MCP工作原理详解
bilibili荒野芯智观察
Related Claims
Unverified在工具数量超过20个的场景下,工具描述的语义歧义度与模型选择准确率之间存在显著的负相关关系68% similarUnverified第五题实际不存在,考验模型的元认知能力,两个模型都未察觉只回答了四题并接受了五分制评分63% similarUnverified修复前模型每约29次下一token预测中约有1次的选择与数学上应有结果不同63% similarUnverified测评题量与信度存在权衡:低于30题的『快测』因抽样不足信度偏低,但200题以上的专业量表易产生答题疲劳导致后半段随意作答,60-120题是兼顾信度与完成质量的区间63% similarUnverified研究表明模型在自我批评任务中的准确率显著低于由另一模型执行批评的场景62% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/40469API
curl https://kongchang.com/api/v1/knowledge/claims/40469MCP
get_claim(id=40469)