待验证50% 置信基准精确时间
2023年的多项Benchmark测试(如HaHackathon数据集)显示,顶级LLM在讽刺识别任务上的准确率仍显著低于普通人类标注者
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/9
首次发现
有效期至:2026/10/7
来源
AI为何看不懂英国政治闹剧?算法的文化理解困境
hackernewshackernews2026/7/8
相关事实
待验证在事实性评估任务上模型评判者准确率仍显著低于人类专家,但在风格、连贯性等主观维度已接近人类评审员间一致性水平72% 相似待验证美团LongCat推出Lohosearch搜索智能体基准,11个前沿模型测试中最佳得分仅34.74%,远低于人类约90%的表现70% 相似待验证研究显示,在专业技术领域,LLM 的幻觉率显著高于通用知识领域,因为训练数据中领域专家的纠错反馈相对稀少67% 相似待验证在标准行人检测数据集(如MOTChallenge)上训练的模型,在俯视视角下的检测精度(mAP)通常下降40%-60%67% 相似待验证2022年Chen等人在ACL发表的工作发现GPT系列模型在'解释为何好笑'任务上的表现(约62%人类满意度)显著低于'识别是否好笑'任务(约78%)66% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/381002API
curl https://kongchang.com/api/v1/knowledge/claims/381002MCP
get_claim(id=381002)