[控场AI]
待验证85% 置信事实时间未知

目前主流LLM评测基准如MMLU、HumanEval、MT-Bench主要关注知识能力和指令遵循能力,对谄媚行为的系统性评估尚未形成行业标准

1
来源数
85%
置信度
中期 (~90 天)
时效性
2026/6/1
首次发现
有效期至:2026/8/30

来源

涉及实体

相关事实

引用此条事实

Stable URI
https://kongchang.com/claim/32882
API
curl https://kongchang.com/api/v1/knowledge/claims/32882
MCP
get_claim(id=32882)