[控场AI]
模型MiMo V2.6 / MiMo-V2.6 Pro / MiMo-V2.6 Flash

MiMo-V2.6

小米推出的智能体强化学习模型系列,包含Pro和Flash两个版本,专注于软件工程智能体任务,采用RLVR训练范式

核心事实

时间轴 (近 90 天)

9月24日

MiMo-V2.6与V2.5属于同一架构类别,此前服务端组件可直接沿用,包括混合滑动窗口注意力+全局注意力、MiMo推理与工具调用解析器、DFlash投机解码

待验证50%
9月24日

MiMo-V2.6内置DFlash投机解码机制,每步可草拟7个token

待验证50%
9月24日

MiMo-V2.6采用原生FP8权重

待验证50%
9月24日

MiMo-V2.6模型支持1M(一百万)token的上下文长度

待验证50%
9月24日

MiMo-V2.6在发布当天即获得vLLM的零日(day-0)支持,两个规格版本发布当天即可通过vLLM部署运行

待验证50%
9月24日

该系统使用vLLM驱动rollout(采样生成)过程

待验证50%
9月24日

Peano AI团队在超过1000块TPU的集群上,为小米310B参数规模的MiMo-V2.6模型运行了全参数强化学习

待验证50%
9月24日

该工作的具体训练效果、模型性能提升幅度以及成本数据尚未公开

待验证50%
9月24日

310B参数在float16或bfloat16精度下约占620GB存储,2秒内完成全量同步意味着有效带宽需达到310GB/s以上

待验证50%
9月24日

全部310B参数在ICI(芯片间互联)网络上的传输在2秒内完成

待验证50%

还有 22 条时间轴事件

全部知识事实 (20)

已验证

小米官方披露 MiMo-V2.6 的总训练成本仅为350万美元

80%
已验证

直播页面同时训练MiMo-V2.6 Pro和MiMo-V2.6 Flash两个模型

65%
部分验证

小米公开了MiMo-V2.6的模型权重、技术报告、强化学习(RL)环境和训练代码

75%
待验证

MiMo V2.6 Pro 采用混合专家架构(MoE),Flash 版本同样是 MoE 架构

70%
待验证

MiMo-V2.6 覆盖文本、图像、语音等多种模态,是全模态模型

70%
待验证

MiMo-V2.6与V2.5属于同一架构类别,此前服务端组件可直接沿用,包括混合滑动窗口注意力+全局注意力、MiMo推理与工具调用解析器、DFlash投机解码

50%
待验证

MiMo-V2.6在发布当天即获得vLLM的零日(day-0)支持,两个规格版本发布当天即可通过vLLM部署运行

50%
待验证

MiMo-V2.6模型支持1M(一百万)token的上下文长度

50%
待验证

MiMo-V2.6采用原生FP8权重

50%
待验证

MiMo-V2.6内置DFlash投机解码机制,每步可草拟7个token

50%
待验证

该工作的具体训练效果、模型性能提升幅度以及成本数据尚未公开

50%
待验证

310B参数在float16或bfloat16精度下约占620GB存储,2秒内完成全量同步意味着有效带宽需达到310GB/s以上

50%
待验证

全部310B参数在ICI(芯片间互联)网络上的传输在2秒内完成

50%
待验证

该系统使用vLLM驱动rollout(采样生成)过程

50%
待验证

团队在验证环节实现了rollout与训练器之间的比特级匹配(bitwise-matched),使推理阶段和训练阶段的模型计算在数值上完全一致

50%
待验证

MiMo-V2.6 最大亮点是缓存命中定价极其实惠,尤其是 Pro 模型的缓存价格

50%
待验证

小米官方报告称两款新模型在同等智能水平下价格仅为海外模型的 1/20 到 1/60

50%
待验证

在动画 SVG「上海外滩」测试中,两款 MiMo 模型均存在世界知识缺陷,太阳和月亮运行轨迹错误

50%
待验证

对重度 Agent 用户而言,MiMo-V2.6 极低的缓存价格比榜单排名更值得关注

50%
待验证

MiMo-V2.6支持高达100万(1M)token的上下文长度

50%

来源文章