Unverified50% confidenceTradeoffExact time
自动化指标(如BLEU、COMET、chrF)与人类判断的相关性有限,在评估语气和细微含义时尤其容易失真,应作为辅助而非主要依据
1
Sources
50%
Confidence
Long-term
Relevance
7/15/2026
First Seen
Sources
Related Claims
Unverified自动化检测工具无法判断alt描述语义准确性、键盘焦点顺序逻辑性等语义层面问题,必须结合人工审查和真实残障用户测试71% similarUnverified没有可靠评估指标的提示优化本质上仍是试错而非工程,提示工程应与评估体系深度集成70% similarUnverified仅依靠提示词约束AI行为存在根本性不可靠问题,因为LLM注意力机制和上下文窗口限制会导致早期指令被忽略69% similarUnverified增加负样本描述(When NOT to Use)能明确 Skill 的决策边界,显著减少误触发68% similarUnverified朴素贝叶斯分类器基于条件独立性假设,在特征高度相关的场景下表现不佳68% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/510744API
curl https://kongchang.com/api/v1/knowledge/claims/510744MCP
get_claim(id=510744)