待验证50% 置信基准精确时间
IFEval是衡量模型对格式约束、内容限制、角色扮演等复杂指令遵循程度的专项基准测试
1
来源数
50%
置信度
长期有效
时效性
2026/7/14
首次发现
来源
相关事实
待验证IFEval将指令分解为格式约束、内容约束、角色约束三大类,通过程序化验证评估遵循率83% 相似待验证AISI的评估采用多层次测试框架,参照CVE数据库中的真实案例,同时设计全新挑战场景测试模型泛化能力65% 相似待验证IFEval基准测试专门评估模型遵循可验证指令的能力,测试显示即使最强闭源模型在严格约束条件下的遵循率也难以达到90%以上65% 相似待验证基准测试往往是标准化、相互孤立的编程题目,而真实软件工程涉及庞大上下文、遗留代码、模糊需求和复杂依赖65% 相似待验证鸿蒙自动化测试是典型长链路任务,涉及跨领域知识融合、强依赖性和反馈循环,链路从读取需求到测试用例设计、脚本执行、输出测试报告64% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/503645API
curl https://kongchang.com/api/v1/knowledge/claims/503645MCP
get_claim(id=503645)