[控场AI]
概念evaluation format gap

评估格式差距

指LLM在选择题(识别)与生成任务(回忆)之间出现的系统性性能差距,反映不同评估格式对模型能力测量的影响

时间轴 (近 90 天)

9月24日

研究者将选择与生成之间的差距解读为'评估格式差距',而非直接证明模型词汇知识完好无损

待验证50%

全部知识事实 (1)

来源文章