待验证50% 置信基准精确时间
2022年Chen等人在ACL发表的工作发现GPT系列模型在'解释为何好笑'任务上的表现(约62%人类满意度)显著低于'识别是否好笑'任务(约78%)
1
来源数
50%
置信度
长期有效
时效性
2026/7/10
首次发现
来源
AI为何看不懂英国政治闹剧?算法的文化理解困境
hackernewshackernews2026/7/8
相关事实
待验证2023年的多项Benchmark测试(如HaHackathon数据集)显示,顶级LLM在讽刺识别任务上的准确率仍显著低于普通人类标注者66% 相似待验证斯坦福大学2023年研究表明,GPT-4V等多模态模型解析嵌套条件逻辑流程图时,准确率比等效文字描述低约15-25个百分点64% 相似待验证GPT 5.2在前沿科学基准的竞赛题中得分约77%,但在开放式研究任务中表现下降到约25%64% 相似待验证即便是GPT-4级别的Agent,面对含有5步以上工具调用的复杂任务时,端到端成功率往往低于60%61% 相似待验证2024年一项研究对GPT-4在Temperature=0下的代码生成任务进行100次测试,发现约8%的测试用例存在跨次运行的输出差异61% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/411659API
curl https://kongchang.com/api/v1/knowledge/claims/411659MCP
get_claim(id=411659)