Unverified50% confidenceSolutionExact time
LLM输出具有非确定性,同一输入在不同时间可能产生不同输出,因此评估流水线常用LLM-as-Judge方法用另一个强大模型评判目标模型输出质量
1
Sources
50%
Confidence
Long-term
Relevance
8/21/2026
First Seen
Sources
Related Claims
VerifiedLLM的输出具有天然的非确定性,即使输入相同的Prompt,模型在不同时刻可能返回格式、内容甚至逻辑不同的结果78% similarUnverifiedLLM 的输出非确定性根源于自回归生成机制,即使输入相同,Temperature、Top-p 等采样参数也会导致不同输出77% similarUnverifiedLLM虽然不直接输出归一化概率向量,但可通过多种工程手段近似估计决策置信度75% similarUnverifiedLLM的行为本质上是统计性的,同一输入在不同上下文中可能产生不同输出,使得传统基于规则的WAF难以有效防护73% similarVerifiedLLM-as-a-judge模式即用一个能力更强的模型来评判另一个模型的输出质量,降低评测成本但引入评判模型自身的偏见问题73% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/784036API
curl https://kongchang.com/api/v1/knowledge/claims/784036MCP
get_claim(id=784036)