[KongchangAI]
Unverified85% confidenceFactTime unknown

目前主流LLM评测基准如MMLU、HumanEval、MT-Bench主要关注知识能力和指令遵循能力,对谄媚行为的系统性评估尚未形成行业标准

1
Sources
85%
Confidence
Medium-term (~90 days)
Relevance
6/1/2026
First Seen
Valid until: 8/30/2026

Sources

Related Entities

Related Claims

Cite This Claim

Stable URI
https://kongchang.com/claim/32882
API
curl https://kongchang.com/api/v1/knowledge/claims/32882
MCP
get_claim(id=32882)