Unverified50% confidenceBenchmarkExact time
实验发现塑形奖励配置下的task_score仅为0.125,而朴素奖励配置为0.417,效应量d=4.47
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
9/7/2026
First Seen
Valid until: 12/6/2026
Sources
Related Entities
Related Claims
UnverifiedOSWorld 2.0采用细粒度检查点部分奖励评分,平均每个任务有27.25个检查点,不要求固定顺序66% similarUnverified在实验中,由4B模型编写技能时27B模型在LiveMath上得分61.0%,而27B自己编写技能时得分56.3%63% similarUnverified跑分排名不等于所有场景的实际表现,Terra跑分接近5.5但游戏任务中5.5完成度略高63% similarUnverifiedMiniMax M2.7每任务提问0.6个问题,但澄清推进率只有60.7%,存在低信息增益提问问题62% similarUnverifiedSonnet 5 的 Max Effort 模式相比 Sonnet 4.6,每个 Intelligence Index 任务的输出 Token 多约 40%61% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/871626API
curl https://kongchang.com/api/v1/knowledge/claims/871626MCP
get_claim(id=871626)