待验证50% 置信基准精确时间
MUSE Spark 1.2的基准测试表现大致介于Claude Opus和GPT高端模型之间
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/11
首次发现
有效期至:2026/12/10
来源
涉及实体
相关事实
待验证Muse Spark 1.3声称能匹敌或超越Claude Opus 5、GPT 5.6 SO的顶级代码编写与长文本推理能力69% 相似待验证在BMP炮塔低多边形3D模型测试中,GPT-5.6 Pro生成了可辨识度极高的模型,而Claude在同一测试中的表现明显逊色66% 相似待验证测试的两个项目此前已用Claude Opus 4.5加GPT-5.5的组合写过一轮66% 相似待验证GPT系列、Claude系列与开源Llama/Mistral系列不仅预训练语料来源不同,其RLHF偏好对齐策略也存在显著差异,因此错误相关性更低65% 相似待验证The benchmark tested leading AI models including Claude, GPT series, and Gemini.64% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/908005API
curl https://kongchang.com/api/v1/knowledge/claims/908005MCP
get_claim(id=908005)