基准Bilingual Evaluation Understudy
BLEU
由IBM研究人员于2002年提出的机器翻译自动评估指标,通过计算机器译文与参考译文之间的n-gram重叠程度来衡量翻译质量,是最早被广泛采用的MT评估工具
时间轴 (近 90 天)
9月7日
腾讯团队将3.3GB的翻译模型压缩到440MB,压缩幅度接近87%,且BLEU分数几乎没有可见退化
待验证50%
9月5日
任务完成率定义为无需人工干预即可完成既定编程任务的比例,比BLEU分数等传统指标更能反映真实可用性
待验证50%
8月4日
当前主流的LLM评估方法包括基于参考答案的指标(如BLEU、ROUGE)、基于模型的评估(LLM-as-a-Judge)和基于人类偏好的评估(如Chatbot Arena的ELO评分)
待验证50%