[
控场AI
]
知识动态
实体
播客
深度
开发者
关于
Get CLI
EN
概念
evaluation format gap
评估格式差距
指LLM在选择题(识别)与生成任务(回忆)之间出现的系统性性能差距,反映不同评估格式对模型能力测量的影响
时间轴 (近 90 天)
9月24日
研究者将选择与生成之间的差距解读为'评估格式差距',而非直接证明模型词汇知识完好无损
待验证
50%
全部知识事实 (1)
待验证
研究者将选择与生成之间的差距解读为'评估格式差距',而非直接证明模型词汇知识完好无损
50%
来源文章
识别却不会生成:LLM在文化亲属称谓上的评估盲区
9月24日