[控场AI]
基准Bilingual Evaluation Understudy

BLEU

由IBM研究人员于2002年提出的机器翻译自动评估指标,通过计算机器译文与参考译文之间的n-gram重叠程度来衡量翻译质量,是最早被广泛采用的MT评估工具

时间轴 (近 90 天)

9月7日

腾讯团队将3.3GB的翻译模型压缩到440MB,压缩幅度接近87%,且BLEU分数几乎没有可见退化

待验证50%
9月5日

任务完成率定义为无需人工干预即可完成既定编程任务的比例,比BLEU分数等传统指标更能反映真实可用性

待验证50%
8月4日

当前主流的LLM评估方法包括基于参考答案的指标(如BLEU、ROUGE)、基于模型的评估(LLM-as-a-Judge)和基于人类偏好的评估(如Chatbot Arena的ELO评分)

待验证50%

全部知识事实 (3)