Unverified50% confidenceFactExact time
LLM评估需同时考量事实准确性、指令遵循度、有害性、有用性和表达质量等多个维度,这些维度之间常存在张力
1
Sources
50%
Confidence
Long-term
Relevance
8/16/2026
First Seen
Sources
Related Claims
Unverified对于需要审查完整轨迹的复杂Skill,可以引入LLM as a Judge配合评分标准(rubric)来判断通过或失败76% similarUnverified评估集构建可采用LLM-as-Judge方法用另一个模型评估输出质量以处理语义层面的质量判断73% similarUnverifiedLLM语义级断言的常见实现方式包括基于规则的检查器、嵌入向量余弦相似度阈值(如0.85)、LLM-as-judge评分,以及基于NLI模型验证事实一致性72% similarUnverifiedLLM智能体运行时监控方案主要包括三类:工具调用序列分析、权限使用审计和因果追踪70% similarUnverifiedLLM在可验证领域(如数学和代码)表现出色,但在其他领域呈现'锯齿状'的能力分布70% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/757576API
curl https://kongchang.com/api/v1/knowledge/claims/757576MCP
get_claim(id=757576)