Unverified50% confidenceBenchmarkExact time
在库存管理任务中RL学习策略累积回报194.5低于base-stock基线的196.7
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/18/2026
First Seen
Valid until: 10/16/2026
Sources
Related Claims
Unverified在库存管理任务中,RL 策略得分为 194.5,略低于 base-stock 基线的 196.7,但从零重新发现了解析最优的 base-stock 策略77% similarUnverified在代码补全、函数改写等结构化任务上,中低端模型与顶级模型的输出质量差距通常在5%以内61% similarUnverifiedLong-Term团队实验表明,用同一个模型仅调整规则约束和记忆系统,成绩从52.8%涨到66.5%,排名从Top 30跳到Top 561% similarUnverifiedMemPalace在LongMemEval基准测试上,不使用LLM的纯检索方案前5召回率达到96.6%59% similarUnverifiedLoRA微调只需训练不到1%的参数即可达到接近全参微调的效果,显存需求大幅降低至单张消费级显卡可承受范围59% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/552377API
curl https://kongchang.com/api/v1/knowledge/claims/552377MCP
get_claim(id=552377)