Unverified50% confidenceBenchmarkExact time
OpenAI与Nature合作评估了GPT-4的审稿能力,发现其与人类审稿人的意见重合度约为50-60%
1
Sources
50%
Confidence
Long-term
Relevance
8/14/2026
First Seen
Sources
Related Claims
UnverifiedOpenAI的研究表明,精心设计的提示词可以将GPT-4在特定任务上的表现提升30%-50%76% similarUnverifiedGPT-4级别的模型作为Judge时,其评判结果与人类专家的一致性超过80%74% similarUnverified研究表明GPT-4作为评估者与人类专家评分的一致性超过80%,显著高于BLEU、ROUGE等基于词汇匹配的自动化指标70% similarUnverifiedGPT-4等模型在作为评判者时会系统性地偏好特定位置的回答70% similarUnverifiedOpenAI在2024年初发布的研究验证了Top-K SAE在GPT-4上的有效性,发现其在特征可解释性评分和下游任务保真度上均优于L1方法69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/746901API
curl https://kongchang.com/api/v1/knowledge/claims/746901MCP
get_claim(id=746901)