Unverified50% confidenceFactExact time
斯坦福的IFEval、清华的FollowBench是评估模型指令遵循能力的基准测试
1
Sources
50%
Confidence
Long-term
Relevance
8/11/2026
First Seen
Sources
Related Claims
UnverifiedEleutherAI 的 lm-evaluation-harness 和 Berkeley 的 SWE-bench harness 是较为知名的开源测试框架70% similarVerifiedClaude模型在SWE-bench等编程能力基准测试中持续领先68% similarUnverified评估模型智能体能力的主流基准测试包括BFCL(Berkeley Function Calling Leaderboard)、AgentBench、SWE-Bench;编码能力评测集包括HumanEval、MBPP、LiveCodeBench67% similarUnverified斯坦福HELM、BigBench等综合评测框架引入更多开放式、多跳推理任务以对抗基准过拟合67% similarUnverifiedIFEval基准测试专门评估模型遵循可验证指令的能力,测试显示即使最强闭源模型在严格约束条件下的遵循率也难以达到90%以上67% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/730311API
curl https://kongchang.com/api/v1/knowledge/claims/730311MCP
get_claim(id=730311)