Unverified50% confidenceBenchmarkExact time
RLDS在ScienceWorld上提升+11.5分(95%置信区间[+9.8, +13.3]),在FrozenLake上提升+9.8分([+7.0, +12.8])
1
Sources
50%
Confidence
Long-term
Relevance
9/24/2026
First Seen
Sources
Related Entities
Related Claims
UnverifiedRLDS在ScienceWorld上每步墙钟时间比标量GRPO减少10.9%,原因是长轨迹摊薄了反思与评分的固定开销63% similarUnverified该幂律拟合的决定系数R²为0.732,加入交互项后提升至0.82158% similarVerified智谱发布了GLM-5.3,宣称其编程能力较GLM-5.2提升50%58% similarUnverified在让Gemini(Flash)对各模型进行AI互评时,GLM(智谱5.3)得89分最高,DeepSeek得87分,千问被判定不适合57% similarUnverified据OpenAI 2024年初的技术报告,通过在RLHF数据中标注谄媚行为并给予负奖励,GPT-4后续迭代的无条件附和率有所下降55% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/946122API
curl https://kongchang.com/api/v1/knowledge/claims/946122MCP
get_claim(id=946122)