待验证50% 置信事实精确时间
GPT-4作为裁判时与人类评价的一致性可超过80%,但存在位置偏差、冗长偏差和自我偏好等系统性问题
1
来源数
50%
置信度
长期有效
时效性
2026/9/11
首次发现
来源
涉及实体
相关事实
已验证微软、谷歌等公司的内部研究表明,即便是GPT-4级别的模型在法律、财务、医疗等垂直领域的事实错误率可能高达15%-30%69% 相似待验证BCG与哈佛联合研究发现,使用GPT-4进行管理咨询任务时人机协作组表现比纯人类组高出约40%,但前提是准确识别AI能力边界68% 相似待验证GPT-4等大模型在Spider等基准测试上的零样本或少样本SQL生成准确率已超过80%68% 相似已验证2023年斯坦福大学研究实验证明,当关键信息被放置于输入文档中间位置时,GPT-4的正确召回率相比首尾位置下降约20-30%67% 相似已验证斯坦福大学2023年研究表明,GPT-4V等多模态模型解析嵌套条件逻辑流程图时,准确率比等效文字描述低约15-25个百分点67% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/894786API
curl https://kongchang.com/api/v1/knowledge/claims/894786MCP
get_claim(id=894786)