Unverified50% confidenceBenchmarkExact time
2023年的多项Benchmark测试(如HaHackathon数据集)显示,顶级LLM在讽刺识别任务上的准确率仍显著低于普通人类标注者
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/9/2026
First Seen
Valid until: 10/7/2026
Sources
AI为何看不懂英国政治闹剧?算法的文化理解困境
hackernewshackernews7/8/2026
Related Claims
Unverified在事实性评估任务上模型评判者准确率仍显著低于人类专家,但在风格、连贯性等主观维度已接近人类评审员间一致性水平72% similarUnverified美团LongCat推出Lohosearch搜索智能体基准,11个前沿模型测试中最佳得分仅34.74%,远低于人类约90%的表现70% similarUnverified研究显示,在专业技术领域,LLM 的幻觉率显著高于通用知识领域,因为训练数据中领域专家的纠错反馈相对稀少67% similarUnverified在标准行人检测数据集(如MOTChallenge)上训练的模型,在俯视视角下的检测精度(mAP)通常下降40%-60%67% similarUnverified2022年Chen等人在ACL发表的工作发现GPT系列模型在'解释为何好笑'任务上的表现(约62%人类满意度)显著低于'识别是否好笑'任务(约78%)66% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/381002API
curl https://kongchang.com/api/v1/knowledge/claims/381002MCP
get_claim(id=381002)