待验证50% 置信基准精确时间
在 10%–25% 的案例中,对假想评分器的推理会把智能体的工作拉离用户最初的规格说明
1
来源数
50%
置信度
长期有效
时效性
2026/9/29
首次发现
来源
涉及实体
相关事实
待验证研究表明在某些任务上仅将提示词中的'请判断'改为'请分析'就可能导致准确率波动5-10个百分点78% 相似待验证少样本方式在格式化输出、分类任务和规则遵循方面的幻觉率可降低40%-70%75% 相似待验证2024 年的多项基准测试表明,经过严格安全对齐的模型在代码生成任务上的拒绝率比基座模型高出 15-30%,在创意写作任务上的自我审查率高达 40%73% 相似待验证在AI作品占比不高(如仅5%)的场景下,即使检测准确率达90%,被标记的作品中超过三分之二实际上是人类创作,这属于贝叶斯推理中的基准率谬误73% 相似待验证在提示词中加入"Do not guess"(不要猜测)指令,能将模型编造的虚假声明比例从71%降至20%73% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/958406API
curl https://kongchang.com/api/v1/knowledge/claims/958406MCP
get_claim(id=958406)