Unverified50% confidenceBenchmarkExact time
在AIME-2024数学推理基准上,pass@1从0.39提升至0.49
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/12/2026
First Seen
Valid until: 10/10/2026
Sources
DeepSeek-V4 Flash RL训练成功迁移AMD MI355X GPU全解析
twitterlmsysorg7/10/2026
Related Claims
Unverified对于双精度浮点数,在数值 1.0 附近一个 ULP 约为 2^-52 ≈ 2.22×10^-1659% similarUnverified初代Codex在HumanEval基准测试上的pass@1指标达到28.8%,而直接使用GPT-3仅为0%57% similarUnverified与INT4纯整数量化不同,浮点格式能更好地表示接近零的小数值57% similarUnverified在 XBEN 白盒模式下 T3MP3ST 的 pass@1 达到 98.7%,最差单轮为 98.1%(102/104)56% similarUnverifiedGPTQ(2022年)和AWQ(2023年)能将70B参数的LLM量化到INT4精度,困惑度损失不到1%56% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/490937API
curl https://kongchang.com/api/v1/knowledge/claims/490937MCP
get_claim(id=490937)