Unverified50% confidenceFactExact time
BLEU、ROUGE等基于n-gram重叠的传统指标在开放式对话中表现不佳
1
Sources
50%
Confidence
Long-term
Relevance
9/12/2026
First Seen
Sources
Related Entities
Related Claims
Unverified传统n-gram模型和单语训练的神经语言模型在遇到跨语言词序列时会给出极低的概率分数,导致解码器倾向于将外语词强行映射为发音相近的本语言词63% similarVerified大语言模型在长时间对话中会因上下文窗口限制而丢失早期信息62% similarUnverified通用大模型在多层嵌套从句、修辞性倒装等复杂阿拉伯语场景中准确率显著下降62% similarUnverified传统对话历史模式的局限性包括:无法原生表达工具调用的中间状态、缺乏时序元数据、不支持并发事件流、在上下文窗口有限时难以进行选择性压缩和摘要61% similarUnverified自回归语言模型的OOD检测比传统机器学习更困难,因为语言组合空间庞大、语义OOD与表面形式OOD不对应,且对抗者可构造统计上看似in-distribution但语义触发OOD的输入61% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/911452API
curl https://kongchang.com/api/v1/knowledge/claims/911452MCP
get_claim(id=911452)