待验证50% 置信事实精确时间
主流大模型评测基准包括 MMLU、HumanEval/SWE-bench、MATH、GPQA 等
1
来源数
50%
置信度
长期有效
时效性
2026/7/13
首次发现
来源
Grok 4.5实测:速度、准确性与性价比三维评测
redditr/cursor2026/7/12
相关事实
引用此条事实
Stable URI
https://kongchang.com/claim/500912API
curl https://kongchang.com/api/v1/knowledge/claims/500912MCP
get_claim(id=500912)