待验证50% 置信基准精确时间
官方表示HY3在大部分场景中优于参数规模相当的Deepseek V4 Flash,并在内部盲测中平均得分高于GLM系列模型
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/10
首次发现
有效期至:2026/10/8
来源
腾讯混元HY3正式版开源:300B以下最强,1元/百万tokens
bilibiliinfinite灵感港2026/7/6
相关事实
待验证HY3在整体性能上仍落后于GLM 5.2(当前开源模型顶级水平)64% 相似待验证在HLE科学类基准上,Agent A1 据实测数据超过了Qwen 3.6和Step 3.5 Flash64% 相似待验证测评者认为GLM 5.2在纯编码上依然强劲,但涉及审美、物理感和模拟质感任务时HY3更胜一筹62% 相似待验证盘古2.0 Flash在AIME类数学测试中得分93.3,在HMMT测试中得分91.5,数学能力处于第一梯队62% 相似待验证Models like GPT-4 and Claude 3.5 surpassed 90% accuracy on MMLU, significantly diminishing its discriminative power60% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/465544API
curl https://kongchang.com/api/v1/knowledge/claims/465544MCP
get_claim(id=465544)