一句"不要猜测"让AI幻觉从71%降至20%

在提示词中加入"不要猜测",可将AI幻觉率从71%降至20%,揭示幻觉部分是交互方式诱导的行为。
一项实验发现,仅在提示词中加入"Do not guess",就能将大语言模型编造虚假声明的比例从71%降至20%。这一结果揭示出,AI幻觉并非全是模型能力的硬性缺陷,相当一部分源于模型在RLHF训练中被塑造成"倾向给出流畅完整答案"的行为惯性。通过在系统提示中明确允许模型承认不知道,相当于重新校准了它对"好回答"的隐含判断。这为开发者提供了低成本的可靠性提升路径,也指向了当前评测体系的缺陷——若不惩罚错误的自信回答,模型便缺乏优化诚实度的动力。文章同时提醒,20%的幻觉率仍未消除,且抑制猜测存在准确性与召回率之间的固有权衡。
一个提示词的惊人效果
大语言模型的"幻觉"问题一直是落地应用的最大障碍之一。模型在缺乏依据时,往往会自信满满地编造看似合理的答案,而非坦承"我不知道"。一项在 Hacker News 引发讨论的实验揭示了一个出乎意料的发现:仅仅在提示词中加入"Do not guess"(不要猜测)这样一句简单的指令,就能将模型编造的虚假声明比例从 71% 大幅削减至 20%。
这个数字背后的意义值得深思。它意味着大量所谓的"AI幻觉",可能并非模型能力的硬性缺陷,而是我们与模型交互方式所诱导出的行为模式。

为什么模型爱"猜"
要理解这个现象,需要回到大语言模型的训练机制。模型在训练与对齐过程中,被大量数据塑造成一个"乐于助人"的助手——它倾向于给出一个完整、流畅的答案,而不是留白或拒绝回答。当用户抛出一个问题,模型的默认行为是尽力生成一个连贯的回应,即便它对答案并无把握。
换句话说,模型默认在"赌":赌一个听起来合理的答案能满足用户。这种倾向在标准评测中甚至可能被无意间强化——如果一个基准测试奖励"给出答案"而不惩罚"错误答案",那么猜测在统计上就是划算的策略。这正是 71% 这个高比例的根源。
而当提示词明确加入"不要猜测"时,相当于重新校准了模型的行为边界,允许甚至鼓励它在不确定时选择沉默或坦承无知。这一句话改变了模型对"什么是好回答"的隐含判断。
这种行为倾向与大语言模型的训练流程密切相关。主流大语言模型在预训练阶段通过海量文本学习语言规律,随后经历"对齐"阶段——通常采用基于人类反馈的强化学习(RLHF)。在RLHF中,人类评估者对模型的不同回答进行排序,排名靠前的回答被用来训练奖励模型,再通过强化学习优化模型输出。问题在于,人类评估者往往对"听起来自信且完整"的回答给予更高评分,对"我不确定"这类回答则评价偏低,即便后者更诚实。这种偏差在训练信号中不断累积,最终使模型学会了用流畅、确定的语气掩盖自身的不确定性。这也解释了为什么模型的"过度自信"是系统性的,而非偶然的。
提示工程的低成本高回报
这个实验最实用的启示在于:改善AI输出质量未必需要更大的模型、更多的算力或复杂的检索增强系统(RAG)。有时,一句精心设计的指令就能带来数量级的改善。
对于开发者和重度使用者而言,这提供了几条可操作的思路:
- 显式约束模型行为:在系统提示中明确写入"如果不确定,请回答不知道"之类的指令,为模型划定诚实的底线。
- 允许模型说"我不知道":很多幻觉源于模型"不敢"留白。主动给它退路,反而能提升整体可靠性。
- 区分场景:在事实性要求高的任务(如法律、医疗、财务)中,这类抑制猜测的提示尤为关键;而在创意写作等场景中则可放宽。
需要注意的是,将幻觉率降到 20% 并不等于问题被彻底解决。剩下的两成虚假声明依然存在,且模型可能因过度保守而拒绝回答一些它本可以正确回答的问题——这是准确性与召回率之间的经典权衡。
检索增强生成(RAG,Retrieval-Augmented Generation)是目前业界应对幻觉问题的主流方案之一。其核心思路是:在模型生成回答前,先从外部知识库中检索与问题相关的文档片段,再将这些片段作为上下文喂给模型,约束其基于实际证据作答,而非纯粹依赖训练时习得的参数知识。RAG在需要访问私有数据或实时信息的场景中效果显著,但系统搭建成本较高,涉及向量数据库、文档切片、检索排序等多个工程环节。相比之下,"Do not guess"这类提示词干预几乎零成本,能在不引入额外架构的情况下收获部分类似效果——当然,两者解决的问题维度有所不同,提示词无法为模型补充它本就不掌握的知识,只能让它在无知时更诚实地沉默。
对AI评测与产品设计的启示
这一发现也把矛头指向了当前AI评测体系的设计缺陷。如果评测标准不对"错误的自信回答"施加足够惩罚,模型开发者就缺乏动力去优化模型的诚实度。业界已有声音呼吁,评测应当引入"弃权选项"(abstention),奖励模型在不确定时保持克制,而非一味追求答题率。
从产品层面看,这意味着面向终端用户的AI应用,可以在不改动底层模型的前提下,通过提示词层的工程优化,显著降低误导用户的风险。对于企业级应用,这几乎是零成本的可靠性提升。
当然,Hacker News 上的讨论也提醒我们保持谨慎:单一实验的结论需要更多复现与不同模型、不同任务上的验证,才能确认其普适性。但"Do not guess"这个极简干预背后的逻辑——重新对齐模型对诚实与有用之间的取舍——无疑指向了一个正确的方向。
评测体系中的"弃权选项"(abstention)概念,源于信息检索和机器学习分类领域对"拒绝回答"的研究传统。在分类任务中,允许模型在置信度低于阈值时输出"不确定",可以显著提升已回答样本的精确率。迁移到大语言模型评测,这意味着需要设计专门的评分机制:正确回答得正分,错误回答得负分,弃权得零分(或小负分)。这种设计会改变模型在不确定情况下的最优策略,使"承认不知道"在统计上优于随机猜测。目前主流的基准测试如MMLU、TruthfulQA等,已开始关注这一维度,但业界尚未形成统一的弃权评分标准,这也是当前AI评测领域的活跃研究方向之一。
写在最后
从 71% 到 20% 的跨越,用一句话完成,这既让人惊喜,也发人深省。它提醒我们,AI的行为在很大程度上是可塑的,而塑造它的钥匙,往往就握在使用者的表述之中。在追逐更强大模型的同时,如何更聪明地与现有模型对话,或许是被低估的一片高价值洼地。
相关推荐

30分钟搭建视觉AI代理:NVIDIA VSS蓝图实战
基于NVIDIA VSS Blueprint 3.3,用一句自然语言提示在30分钟内、约3美元成本搭建视觉AI代理。Cosmos负责看、Nemotron负责写报告,本地部署实现每任务仅几分钱的运行成本。

Tulip联手NVIDIA打造可回放工厂:用视觉语言模型重构制造现场
Tulip联合NVIDIA推出Factory Playback,用视觉语言模型、Metropolis VSS蓝图与Cosmos模型把工厂摄像头录像变成可查询、可对话的现场情报,混合云架构兼顾隐私与算力,助力制造业根因分析与精益优化。

用 NVIDIA NeMo Relay 和 Phoenix 追踪评估 Hermes 智能体
NVIDIA 工程师演示如何用 NeMo Relay 对 Hermes 智能体进行链路追踪,并在 Phoenix 中可视化工具调用、搜索与验证的完整执行过程,实现证据驱动的智能体评估与优化。