已验证75% 置信事实精确时间
BLEU是1990年代提出的自然语言生成评估指标,通过计算生成文本与参考译文之间的n-gram重叠度来衡量质量,仍是机器翻译领域的标准基准
3
来源数
75%
置信度
长期有效
时效性
2026/7/7
首次发现
来源
循环工程(Loop Engineering):让AI自主进化的新范式
bilibili镇渊AI2026/6/30
相关事实
待验证BLEU常用于机器翻译评估,ROUGE广泛应用于摘要任务,两者均通过统计n-gram重叠程度衡量文本质量81% 相似待验证BLEU的核心思路是计算机器译文与参考译文之间的n-gram重叠程度,其局限性包括对词序变化不敏感、无法捕捉语义等价的同义替换、依赖参考译文质量和数量74% 相似待验证BM25通过词频、逆文档频率和文档长度归一化三个维度对文档相关性进行评分67% 相似待验证BERTScore 通过计算候选文本与参考文本在语义嵌入空间中的余弦相似度来衡量质量,区别于基于词汇重叠的BLEU、ROUGE等指标66% 相似待验证chrF++ 是基于字符级 n-gram 的评估指标,在处理形态丰富语言时比 BLEU 更为鲁棒65% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/170754API
curl https://kongchang.com/api/v1/knowledge/claims/170754MCP
get_claim(id=170754)