待验证50% 置信基准精确时间
在 GSM8K 基准上,标准思维链准确率约为 56%-63%(GPT-3 规模),PAL 可提升至 72% 以上
1
来源数
50%
置信度
长期有效
时效性
2026/7/6
首次发现
来源
补齐大模型三大短板:知识、计算与工具调用
bilibili晴天AI实战2026/7/4
相关事实
已验证CoT提示将PaLM 540B在GSM8K数学基准测试中的准确率从17.9%提升至58.1%72% 相似待验证MTP-LX 4bit版本在理财规划推理任务上经GPT-5.5 Thinking评分为55分(满分100),而同题GPT-5.5 Pro得分82分70% 相似待验证在GPT-4发布初期,主流模型在GPQA上的准确率约为35-40%,人类领域专家基准线约为65%,随机猜测为25%70% 相似待验证GSM8K发布时GPT-3的zero-shot准确率仅约5%,加入few-shot示例也不超过35%70% 相似待验证在Artificial Analysis第三方评测的编码指数(推理模式)上,GPT-5 Mini High的得分比Haiku 4.5高出9个点69% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/112765API
curl https://kongchang.com/api/v1/knowledge/claims/112765MCP
get_claim(id=112765)