待验证50% 置信基准精确时间
在库存管理任务中RL学习策略累积回报194.5低于base-stock基线的196.7
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/18
首次发现
有效期至:2026/10/16
来源
相关事实
待验证在库存管理任务中,RL 策略得分为 194.5,略低于 base-stock 基线的 196.7,但从零重新发现了解析最优的 base-stock 策略77% 相似待验证在代码补全、函数改写等结构化任务上,中低端模型与顶级模型的输出质量差距通常在5%以内61% 相似待验证Long-Term团队实验表明,用同一个模型仅调整规则约束和记忆系统,成绩从52.8%涨到66.5%,排名从Top 30跳到Top 561% 相似待验证MemPalace在LongMemEval基准测试上,不使用LLM的纯检索方案前5召回率达到96.6%59% 相似待验证LoRA微调只需训练不到1%的参数即可达到接近全参微调的效果,显存需求大幅降低至单张消费级显卡可承受范围59% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/552377API
curl https://kongchang.com/api/v1/knowledge/claims/552377MCP
get_claim(id=552377)