Unverified50% confidenceBenchmarkExact time
在 GSM8K 基准上,标准思维链准确率约为 56%-63%(GPT-3 规模),PAL 可提升至 72% 以上
1
Sources
50%
Confidence
Long-term
Relevance
7/6/2026
First Seen
Sources
补齐大模型三大短板:知识、计算与工具调用
bilibili晴天AI实战7/4/2026
Related Claims
VerifiedCoT提示将PaLM 540B在GSM8K数学基准测试中的准确率从17.9%提升至58.1%72% similarUnverifiedMTP-LX 4bit版本在理财规划推理任务上经GPT-5.5 Thinking评分为55分(满分100),而同题GPT-5.5 Pro得分82分70% similarUnverified在GPT-4发布初期,主流模型在GPQA上的准确率约为35-40%,人类领域专家基准线约为65%,随机猜测为25%70% similarUnverifiedGSM8K发布时GPT-3的zero-shot准确率仅约5%,加入few-shot示例也不超过35%70% similarUnverified在Artificial Analysis第三方评测的编码指数(推理模式)上,GPT-5 Mini High的得分比Haiku 4.5高出9个点69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/112765API
curl https://kongchang.com/api/v1/knowledge/claims/112765MCP
get_claim(id=112765)