待验证50% 置信基准精确时间
以 SANA-1.6B 为基础模型、ImageReward 为奖励模型时,SatisDive 相比 FK steering 将最差候选奖励最多提升 0.70
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/10/5
首次发现
有效期至:2027/1/3
来源
涉及实体
相关事实
待验证在 Pick-a-Pic 数据集上以 DreamSim 作为多样性度量,以 FLUX.1-dev 为基础模型、HPSv3 为奖励模型时,SatisDive 相比 FK steering 将最差候选奖励最多提升 0.4373% 相似待验证SWE-2的基准得分与竞品Fable 5.1相差不到一个百分点,但成本低了64%60% 相似待验证使用最少指标的Top3配置反而取得了最高的平均性能,表明在该实验设定下更少的指标反而性能更高56% 相似待验证在基准测试中,Dyna-Q算法平均获得约0.62个徽章55% 相似待验证同一个DeepSeek v1.1模型在Terminal Bench 2.0上不同Harness下的得分从69.8%跨到74.2%54% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/975684API
curl https://kongchang.com/api/v1/knowledge/claims/975684MCP
get_claim(id=975684)