Unverified50% confidenceBenchmarkExact time
表现最佳的Edu-QuRater在还原留出集的GPT-4.1-mini成对判断时平均准确率达到0.917
1
Sources
50%
Confidence
Long-term
Relevance
9/11/2026
First Seen
Sources
Related Entities
Related Claims
Unverified该研究发现GPT-4在判断素数任务上的准确率从2023年3月的97.6%骤降至6月的2.4%74% similarUnverified在GPT-4发布初期,主流模型在GPQA上的准确率约为35-40%,人类领域专家基准线约为65%,随机猜测为25%74% similarUnverifiedGPTQ(2022年)和AWQ(2023年)能将70B参数的LLM量化到INT4精度,困惑度损失不到1%70% similarUnverified4Bit量化下模型的基准测试得分通常能保持原始精度的90%-95%70% similarUnverified在Artificial Analysis的Omniscience幻觉指标上,GPT-5.6 Sol Max高达89%,高于Claude Fable的55%和GLM 5.2的28%69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/893229API
curl https://kongchang.com/api/v1/knowledge/claims/893229MCP
get_claim(id=893229)