Unverified50% confidenceOpinionExact time
对齐悖论指若模型真实理解比其能输出的语言更精细,则基于语言输出的对齐评估可能无法真正捕捉模型内部状态的对齐程度
1
Sources
50%
Confidence
Long-term
Relevance
7/7/2026
First Seen
Sources
大模型为何开始「造词」:LLM语言边界的本质解析
hackernewshackernews7/6/2026
Related Claims
Unverified当模型本身缺乏对特定问题的理解能力时,再精巧的提示词也无法弥补这一缺陷76% similarUnverified困惑度是整体统计指标,无法捕捉模型在逻辑推理、事实准确性、指令遵循等特定能力维度上的退化情况73% similarUnverified当模型缺乏某个库的准确知识时,倾向于生成语法正确但语义错误的代码,即'自信错误'71% similarUnverified自回归语言模型在训练时从未见过'我不知道'作为高频合理输出,因此在知识边界处生成虚构内容概率高于表达不确定性70% similarUnverified大语言模型有两个致命缺点:知识存在时间差和范围局限导致会编造,以及完全被动不会主动行动69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/168703API
curl https://kongchang.com/api/v1/knowledge/claims/168703MCP
get_claim(id=168703)