待验证85% 置信事实时间未知
Qwen3.5在Multi-Challenge多轮对话评测中得分67.6,比GPT-5.2高出10个百分点
1
来源数
85%
置信度
中期 (~90 天)
时效性
2026/6/1
首次发现
有效期至:2026/8/30
来源
Qwen3.5深度解析:混合注意力架构实现19倍长上下文加速
bilibili雪天鱼
涉及实体
相关事实
待验证Qwen3.5在AIME 2026数学竞赛评测中得分91.3,GPT-5.2为96.777% 相似待验证Qwen3.5在HLE博士级综合题评测中得分28.7,而GPT-5.2为35.573% 相似待验证Qwen3.5在IFBench指令遵循评测中得分76.5,超过GPT-5.2的75.4和Claude 4.5 Opus的5872% 相似待验证Qwen 3 Max综合八项测试获得65分,得分率81.25%,在测评者排行榜上位居第二,仅次于得分82.5%的Claude旗舰72% 相似待验证在终端基准(Terminal Bench)测试中,Qwen 3.6 27B得分约60.7,而Muse Glimmer只有51.7,明显落后71% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/18081API
curl https://kongchang.com/api/v1/knowledge/claims/18081MCP
get_claim(id=18081)