待验证50% 置信基准精确时间
在分歧富集数据集上,gpt-4o-mini裁判与两位作者共同确认的黄金标准之间的Cohen's kappa一致性系数仅为0.04
1
来源数
50%
置信度
长期有效
时效性
2026/9/28
首次发现
来源
涉及实体
相关事实
待验证在均匀随机抽查中,gpt-4o-mini裁判的kappa为0.4271% 相似已验证在MMLU、HumanEval等主流基准测试上,Claude 3.5、GPT-4o、Gemini 1.5 Pro、Grok-2之间的分差已压缩至统计误差范围内68% 相似待验证表现最佳的Edu-QuRater在还原留出集的GPT-4.1-mini成对判断时平均准确率达到0.91768% 相似待验证该研究发现GPT-4在判断素数任务上的准确率从2023年3月的97.6%骤降至6月的2.4%66% 相似待验证Brown等人2020年的GPT-3论文发现仅通过改变提示格式,同一模型在标准基准测试上的表现可相差30%以上66% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/955608API
curl https://kongchang.com/api/v1/knowledge/claims/955608MCP
get_claim(id=955608)