[KongchangAI]
Unverified85% confidenceFactTime unknown

Gemini 2.5 Pro在Humanities Last Exam基准测试中得分18.8%,远超O3 Mini的14%和其他模型的10%以下

1
Sources
85%
Confidence
Medium-term (~90 days)
Relevance
6/1/2026
First Seen
Valid until: 8/30/2026

Sources

Related Entities

Related Claims

Cite This Claim

Stable URI
https://kongchang.com/claim/20627
API
curl https://kongchang.com/api/v1/knowledge/claims/20627
MCP
get_claim(id=20627)