[KongchangAI]
BenchmarkBilingual Evaluation Understudy

BLEU

由IBM研究人员于2002年提出的机器翻译自动评估指标,通过计算机器译文与参考译文之间的n-gram重叠程度来衡量翻译质量,是最早被广泛采用的MT评估工具

Timeline (last 90 days)

Sep 7

腾讯团队将3.3GB的翻译模型压缩到440MB,压缩幅度接近87%,且BLEU分数几乎没有可见退化

Unverified50%
Sep 5

任务完成率定义为无需人工干预即可完成既定编程任务的比例,比BLEU分数等传统指标更能反映真实可用性

Unverified50%
Aug 4

当前主流的LLM评估方法包括基于参考答案的指标(如BLEU、ROUGE)、基于模型的评估(LLM-as-a-Judge)和基于人类偏好的评估(如Chatbot Arena的ELO评分)

Unverified50%

All Facts (3)