Unverified50% confidenceBenchmarkExact time
在分歧富集数据集上,gpt-4o-mini裁判与两位作者共同确认的黄金标准之间的Cohen's kappa一致性系数仅为0.04
1
Sources
50%
Confidence
Long-term
Relevance
9/28/2026
First Seen
Sources
Related Entities
Related Claims
Unverified在均匀随机抽查中,gpt-4o-mini裁判的kappa为0.4271% similarVerified在MMLU、HumanEval等主流基准测试上,Claude 3.5、GPT-4o、Gemini 1.5 Pro、Grok-2之间的分差已压缩至统计误差范围内68% similarUnverified表现最佳的Edu-QuRater在还原留出集的GPT-4.1-mini成对判断时平均准确率达到0.91768% similarUnverified该研究发现GPT-4在判断素数任务上的准确率从2023年3月的97.6%骤降至6月的2.4%66% similarUnverifiedBrown等人2020年的GPT-3论文发现仅通过改变提示格式,同一模型在标准基准测试上的表现可相差30%以上66% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/955608API
curl https://kongchang.com/api/v1/knowledge/claims/955608MCP
get_claim(id=955608)