Unverified50% confidenceBenchmarkExact time
RLDS在ScienceWorld上每步墙钟时间比标量GRPO减少10.9%,原因是长轨迹摊薄了反思与评分的固定开销
1
Sources
50%
Confidence
Long-term
Relevance
9/24/2026
First Seen
Sources
Related Entities
Related Claims
UnverifiedGRPO 相比传统RLHF降低显存占用约40%63% similarUnverifiedRLDS在ScienceWorld上提升+11.5分(95%置信区间[+9.8, +13.3]),在FrozenLake上提升+9.8分([+7.0, +12.8])63% similarUnverified研究表明当ReAct循环超过10步时,模型的任务完成率会出现显著下降63% similarUnverified从基于 glibc 的镜像迁移到 Alpine(musl)后,应用可能出现 10% 到数倍不等的性能下降63% similarUnverified据OpenAI 2024年初的技术报告,通过在RLHF数据中标注谄媚行为并给予负奖励,GPT-4后续迭代的无条件附和率有所下降61% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/946125API
curl https://kongchang.com/api/v1/knowledge/claims/946125MCP
get_claim(id=946125)