Unverified50% confidenceFactExact time
困惑度(Perplexity)、BLEU分数、ROUGE分数等自动化指标最初为机器翻译等任务设计,在衡量创意性方面存在天然缺陷
1
Sources
50%
Confidence
Long-term
Relevance
8/19/2026
First Seen
Sources
Related Claims
Unverified自动评估指标如BLEU、ROUGE、困惑度主要衡量表面统计特征,难以捕捉语言的地道性问题73% similarUnverified通用语言模型基准(如MMLU、HellaSwag)对创意写作能力几乎是盲区,BLEU、ROUGE等n-gram重叠指标在创意场景效度存疑68% similarUnverifiedLLM输出的困惑度(Perplexity)通常低于人类写作,可用于检测AI生成内容67% similarUnverified提示工程已从早期的关键词拼接演进为包含角色设定、思维链、少样本示例等技术的完整体系62% similarUnverified少样本提示中精心挑选的3-5个示例在格式化输出、风格迁移和复杂分类任务上往往能显著超越冗长文字说明62% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/772774API
curl https://kongchang.com/api/v1/knowledge/claims/772774MCP
get_claim(id=772774)