待验证50% 置信事实精确时间
BLEU常用于机器翻译评估,ROUGE广泛应用于摘要任务,两者均通过统计n-gram重叠程度衡量文本质量
1
来源数
50%
置信度
长期有效
时效性
2026/7/11
首次发现
来源
亲历NCA-GENL认证:IT转型者的备考实录与避坑指南
redditr/learnmachinelearning2026/7/9
相关事实
待验证BLEU是1990年代提出的自然语言生成评估指标,通过计算生成文本与参考译文之间的n-gram重叠度来衡量质量,仍是机器翻译领域的标准基准81% 相似待验证BLEU的核心思路是计算机器译文与参考译文之间的n-gram重叠程度,其局限性包括对词序变化不敏感、无法捕捉语义等价的同义替换、依赖参考译文质量和数量71% 相似待验证自动评估指标如BLEU、ROUGE、困惑度主要衡量表面统计特征,难以捕捉语言的地道性问题65% 相似待验证BM25通过词频、逆文档频率和文档长度归一化三个维度对文档相关性进行评分65% 相似待验证自动化文献综述工具如Semantic Scholar、Elicit借助LLM提取论文关键贡献并生成结构化对比64% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/482294API
curl https://kongchang.com/api/v1/knowledge/claims/482294MCP
get_claim(id=482294)