待验证50% 置信事件精确时间
Grok 4.7原计划上周发布但推迟,马斯克透露原因是RL阶段可能过度惩罚了响应长度,导致模型在困难任务上过早放弃
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/25
首次发现
有效期至:2026/12/24
来源
涉及实体
相关事实
待验证Devin 团队认为 Grok 4.7 综合得分落后的原因是模型倾向于 over-scope(过度扩展任务范围),主动引入超出用户需要的额外改动或功能70% 相似待验证Grok 4.5 在编排能力(协调子智能体、分解复杂任务)方面明显不足,常因某个进程挂起而卡住64% 相似待验证三个模型都未能通过GRPO阶段,GRPO让模型学算术虽有小幅进步但通用能力显著退化63% 相似待验证低精度引入的数值扰动会在RL的多轮迭代中通过策略梯度的乘积形式被放大,可能导致训练崩溃或模型性能退化62% 相似待验证PLUG和ILRM仅在16-64步延迟上训练,成功外推到4096步,在一比特信息保留任务上达到100%准确率,而基线标准GRU退化到随机猜测水平61% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/948941API
curl https://kongchang.com/api/v1/knowledge/claims/948941MCP
get_claim(id=948941)