待验证50% 置信事实精确时间
由于大语言模型的输出具有非确定性,同一输入可能产生不同输出,仅靠单元测试难以覆盖所有边界情况
1
来源数
50%
置信度
长期有效
时效性
2026/9/7
首次发现
来源
涉及实体
相关事实
待验证大型语言模型具有固有的非确定性——即使使用相同的Prompt输入,模型在不同时间可能返回格式、内容甚至逻辑不同的结果79% 相似待验证大语言模型本质上是概率性的,相同的输入可能产生不同的输出,这与传统软件的确定性行为截然不同74% 相似待验证自回归语言模型的OOD检测比传统机器学习更困难,因为语言组合空间庞大、语义OOD与表面形式OOD不对应,且对抗者可构造统计上看似in-distribution但语义触发OOD的输入74% 相似待验证困惑度衡量语言模型对测试文本的预测能力,数值越低表示模型越不惊讶于看到这些文本71% 相似待验证语言模型输出具有概率性和语义模糊性,难以用精确断言衡量质量,这使得TDD思想迁移至提示词领域面临挑战71% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/869559API
curl https://kongchang.com/api/v1/knowledge/claims/869559MCP
get_claim(id=869559)