Unverified50% confidenceFactExact time
LLM-as-a-Judge这类评估会带来双倍甚至多倍的Token开销,因为既要生成待评估答案,又要消耗Token让另一个模型打分
1
Sources
50%
Confidence
Long-term
Relevance
8/31/2026
First Seen
Sources
Related Entities
Related Claims
Unverified以 3 个顾问加 1 个决策者的标准配置为例,MoA 总 Token 消耗约为单模型的 4-6 倍66% similarUnverified两个智能得分相近的模型其推理成本可能相差数倍甚至一个数量级65% similarUnverifiedGLM-5.2 的输出 Token 消耗量比同级模型高不少,单次调用成本更高64% similarUnverified对同一测试用例执行多次调用统计成功比例得到通过率,比二元的通过/失败判断更能反映模型真实表现64% similarUnverified工程实践中通常对生产流量做5%–20%的随机采样使用LLM-as-a-Judge以平衡覆盖率与成本63% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/830136API
curl https://kongchang.com/api/v1/knowledge/claims/830136MCP
get_claim(id=830136)