待验证50% 置信基准精确时间
在 Pick-a-Pic 数据集上以 DreamSim 作为多样性度量,以 FLUX.1-dev 为基础模型、HPSv3 为奖励模型时,SatisDive 相比 FK steering 将最差候选奖励最多提升 0.43
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/10/5
首次发现
有效期至:2027/1/3
来源
涉及实体
相关事实
待验证以 SANA-1.6B 为基础模型、ImageReward 为奖励模型时,SatisDive 相比 FK steering 将最差候选奖励最多提升 0.7073% 相似待验证领先的闭源模型在该评测中各拿53分,比小米模型高7分59% 相似待验证在SWE Marathon基准上领先的是Grok 4.5,Fable 5表现落后,这可能得益于XAI通过Cursor收购获得的数据56% 相似待验证一个元智能体变体在六个基准中的五个上取得了最高的Avg@3奖励56% 相似待验证在EvoArena测试中,Step Level最高的GPT-5.5只有50%出头的准确率,Chain Level表现最好的Gemini-3.1 Pro和GLM-5.1也只有约28%-29%55% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/975683API
curl https://kongchang.com/api/v1/knowledge/claims/975683MCP
get_claim(id=975683)