待验证50% 置信事件精确时间
三个模型都未能通过GRPO阶段,GRPO让模型学算术虽有小幅进步但通用能力显著退化
1
来源数
50%
置信度
长期有效
时效性
2026/8/29
首次发现
来源
涉及实体
相关事实
待验证在几百M参数的小模型规模上,GRPO这类强化学习方法可能并不适用,因为模型可能无法产生足够质量的正样本提供有效学习信号74% 相似待验证Grok 4.5 在编排能力(协调子智能体、分解复杂任务)方面明显不足,常因某个进程挂起而卡住62% 相似待验证Grisu 算法能在大多数情况下快速生成最短表示,但仍有约 0.5% 的困难情况需要回退到慢速路径60% 相似待验证对于中小型标准应用,Grok、GPT、Claude 三大模型基本都能给出可运行的结果,差距体现在错误处理、边界情况、可维护性和UI细节等最后20%的工作59% 相似待验证跳过或简化校准步骤往往是低比特量化后模型质量大幅下滑的主因57% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/819748API
curl https://kongchang.com/api/v1/knowledge/claims/819748MCP
get_claim(id=819748)