MiMo-V2.6
小米推出的智能体强化学习模型系列,包含Pro和Flash两个版本,专注于软件工程智能体任务,采用RLVR训练范式
核心事实
时间轴 (近 90 天)
MiMo-V2.6与V2.5属于同一架构类别,此前服务端组件可直接沿用,包括混合滑动窗口注意力+全局注意力、MiMo推理与工具调用解析器、DFlash投机解码
MiMo-V2.6内置DFlash投机解码机制,每步可草拟7个token
MiMo-V2.6采用原生FP8权重
MiMo-V2.6模型支持1M(一百万)token的上下文长度
MiMo-V2.6在发布当天即获得vLLM的零日(day-0)支持,两个规格版本发布当天即可通过vLLM部署运行
该系统使用vLLM驱动rollout(采样生成)过程
Peano AI团队在超过1000块TPU的集群上,为小米310B参数规模的MiMo-V2.6模型运行了全参数强化学习
该工作的具体训练效果、模型性能提升幅度以及成本数据尚未公开
310B参数在float16或bfloat16精度下约占620GB存储,2秒内完成全量同步意味着有效带宽需达到310GB/s以上
全部310B参数在ICI(芯片间互联)网络上的传输在2秒内完成
还有 22 条时间轴事件
全部知识事实 (20)
小米官方披露 MiMo-V2.6 的总训练成本仅为350万美元
80%已验证直播页面同时训练MiMo-V2.6 Pro和MiMo-V2.6 Flash两个模型
65%部分验证小米公开了MiMo-V2.6的模型权重、技术报告、强化学习(RL)环境和训练代码
75%待验证MiMo V2.6 Pro 采用混合专家架构(MoE),Flash 版本同样是 MoE 架构
70%待验证MiMo-V2.6 覆盖文本、图像、语音等多种模态,是全模态模型
70%待验证MiMo-V2.6与V2.5属于同一架构类别,此前服务端组件可直接沿用,包括混合滑动窗口注意力+全局注意力、MiMo推理与工具调用解析器、DFlash投机解码
50%待验证MiMo-V2.6在发布当天即获得vLLM的零日(day-0)支持,两个规格版本发布当天即可通过vLLM部署运行
50%待验证MiMo-V2.6模型支持1M(一百万)token的上下文长度
50%待验证MiMo-V2.6采用原生FP8权重
50%待验证MiMo-V2.6内置DFlash投机解码机制,每步可草拟7个token
50%待验证该工作的具体训练效果、模型性能提升幅度以及成本数据尚未公开
50%待验证310B参数在float16或bfloat16精度下约占620GB存储,2秒内完成全量同步意味着有效带宽需达到310GB/s以上
50%待验证全部310B参数在ICI(芯片间互联)网络上的传输在2秒内完成
50%待验证该系统使用vLLM驱动rollout(采样生成)过程
50%待验证团队在验证环节实现了rollout与训练器之间的比特级匹配(bitwise-matched),使推理阶段和训练阶段的模型计算在数值上完全一致
50%待验证MiMo-V2.6 最大亮点是缓存命中定价极其实惠,尤其是 Pro 模型的缓存价格
50%待验证小米官方报告称两款新模型在同等智能水平下价格仅为海外模型的 1/20 到 1/60
50%待验证在动画 SVG「上海外滩」测试中,两款 MiMo 模型均存在世界知识缺陷,太阳和月亮运行轨迹错误
50%待验证对重度 Agent 用户而言,MiMo-V2.6 极低的缓存价格比榜单排名更值得关注
50%待验证MiMo-V2.6支持高达100万(1M)token的上下文长度
50%