Unverified50% confidenceBenchmarkExact time
IFEval是衡量模型对格式约束、内容限制、角色扮演等复杂指令遵循程度的专项基准测试
1
Sources
50%
Confidence
Long-term
Relevance
7/14/2026
First Seen
Sources
Related Claims
UnverifiedIFEval将指令分解为格式约束、内容约束、角色约束三大类,通过程序化验证评估遵循率83% similarUnverifiedAISI的评估采用多层次测试框架,参照CVE数据库中的真实案例,同时设计全新挑战场景测试模型泛化能力65% similarUnverifiedIFEval基准测试专门评估模型遵循可验证指令的能力,测试显示即使最强闭源模型在严格约束条件下的遵循率也难以达到90%以上65% similarUnverified基准测试往往是标准化、相互孤立的编程题目,而真实软件工程涉及庞大上下文、遗留代码、模糊需求和复杂依赖65% similarUnverified鸿蒙自动化测试是典型长链路任务,涉及跨领域知识融合、强依赖性和反馈循环,链路从读取需求到测试用例设计、脚本执行、输出测试报告64% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/503645API
curl https://kongchang.com/api/v1/knowledge/claims/503645MCP
get_claim(id=503645)