待验证60% 置信事实精确时间
BLEU的核心思路是计算机器译文与参考译文之间的n-gram重叠程度,其局限性包括对词序变化不敏感、无法捕捉语义等价的同义替换、依赖参考译文质量和数量
2
来源数
60%
置信度
长期有效
时效性
2026/7/15
首次发现
来源
相关事实
待验证BLEU是1990年代提出的自然语言生成评估指标,通过计算生成文本与参考译文之间的n-gram重叠度来衡量质量,仍是机器翻译领域的标准基准74% 相似待验证BLEU常用于机器翻译评估,ROUGE广泛应用于摘要任务,两者均通过统计n-gram重叠程度衡量文本质量71% 相似待验证通用语言模型基准(如MMLU、HellaSwag)对创意写作能力几乎是盲区,BLEU、ROUGE等n-gram重叠指标在创意场景效度存疑65% 相似待验证实验数据显示,语法约束解码使小型语言模型生成Bash代码的语法正确率大幅提高,引号不匹配和结构不完整等错误几乎被完全消除64% 相似待验证从表征到有限词汇的映射过程本质上是一种有损编码(Lossy Encoding)64% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/510735API
curl https://kongchang.com/api/v1/knowledge/claims/510735MCP
get_claim(id=510735)