Neo-Classic
专为评测大语言模型古典中文诗词理解能力设计的基准,采用当代专家创作的格律诗词作为样本外数据集,结合逆向理解探针检验模型的层级化约束满足与全局规划能力
时间轴 (近 90 天)
一项新研究提出了名为 Neo-Classic 的评测基准,用于检验大模型对古典诗词的真实推理能力
Neo-Classic 由样本外(OOS)数据集和一套逆向理解探针(reverse understanding probes)两部分组成
Neo-Classic 收录的是当代专家创作的、严格符合格律的诗词,以降低模型从训练数据中检索答案的可能性
研究团队设计了五种行为探针,用来测试模型对层级化约束满足的能力
当模型从历史文本转向当代文本时,出现了 20% 到 50% 的性能下滑
模型在篇章级排序任务中的标准准确率仅为 0% 到 13%
引入专家级引导提示后,具备推理增强能力的模型在篇章级排序任务上的表现提升到 36%,仍与人类专家有明显差距
研究结论认为模型能够捕捉局部形式模式,却难以完成稳健语言-美学推理所需的全局层级规划
全部知识事实 (8)
研究结论认为模型能够捕捉局部形式模式,却难以完成稳健语言-美学推理所需的全局层级规划
70%待验证Neo-Classic 由样本外(OOS)数据集和一套逆向理解探针(reverse understanding probes)两部分组成
50%待验证Neo-Classic 收录的是当代专家创作的、严格符合格律的诗词,以降低模型从训练数据中检索答案的可能性
50%待验证研究团队设计了五种行为探针,用来测试模型对层级化约束满足的能力
50%待验证模型在篇章级排序任务中的标准准确率仅为 0% 到 13%
50%待验证引入专家级引导提示后,具备推理增强能力的模型在篇章级排序任务上的表现提升到 36%,仍与人类专家有明显差距
50%待验证当模型从历史文本转向当代文本时,出现了 20% 到 50% 的性能下滑
50%待验证一项新研究提出了名为 Neo-Classic 的评测基准,用于检验大模型对古典诗词的真实推理能力
50%