MiMo-V2.6
小米推出的智能体强化学习模型系列,包含Pro和Flash两个版本,专注于软件工程智能体任务,采用RLVR训练范式
Core Facts
Timeline (last 90 days)
MiMo-V2.6走的是让模型通过强化学习自我进化的技术路线
小米官方称MiMo-V2.6在同等聪明程度下花费只有海外头部模型的二十分之一到六十分之一
MiMo-V2.6在命令行任务测试上得分34.9,低于GPT-6 Astra的59.6分
MiMo-V2.6在一段F1赛车漂移演示中生成单个网页文件输出4.3万多个Token,生成成本约两毛多钱
MiMo-V2.6在英伟达物理仿真环境中通过手腕和桌面两个摄像头画面实时计算并控制机械臂放置方块
小米 MiMo 系列是小米发布的开源推理模型,MiMo-V2.5 在代码和数学推理任务上有较强表现,并采用强化学习进行后训练优化
MiMo-V2.6在发布当天即获得vLLM的零日(day-0)支持,两个规格版本发布当天即可通过vLLM部署运行
MiMo-V2.6与V2.5属于同一架构类别,此前服务端组件可直接沿用,包括混合滑动窗口注意力+全局注意力、MiMo推理与工具调用解析器、DFlash投机解码
MiMo-V2.6内置DFlash投机解码机制,每步可草拟7个token
MiMo-V2.6采用原生FP8权重
28 more timeline events
All Facts (20)
小米官方披露 MiMo-V2.6 的总训练成本仅为350万美元
80%Verified直播页面同时训练MiMo-V2.6 Pro和MiMo-V2.6 Flash两个模型
65%Partially Verified小米公开了MiMo-V2.6的模型权重、技术报告、强化学习(RL)环境和训练代码
75%UnverifiedMiMo V2.6 Pro 采用混合专家架构(MoE),Flash 版本同样是 MoE 架构
70%UnverifiedMiMo-V2.6 覆盖文本、图像、语音等多种模态,是全模态模型
70%UnverifiedMiMo-V2.6在一段F1赛车漂移演示中生成单个网页文件输出4.3万多个Token,生成成本约两毛多钱
50%UnverifiedMiMo-V2.6在命令行任务测试上得分34.9,低于GPT-6 Astra的59.6分
50%Unverified小米官方称MiMo-V2.6在同等聪明程度下花费只有海外头部模型的二十分之一到六十分之一
50%UnverifiedMiMo-V2.6走的是让模型通过强化学习自我进化的技术路线
50%UnverifiedMiMo-V2.6在英伟达物理仿真环境中通过手腕和桌面两个摄像头画面实时计算并控制机械臂放置方块
50%Unverified小米 MiMo 系列是小米发布的开源推理模型,MiMo-V2.5 在代码和数学推理任务上有较强表现,并采用强化学习进行后训练优化
50%UnverifiedMiMo-V2.6采用原生FP8权重
50%UnverifiedMiMo-V2.6内置DFlash投机解码机制,每步可草拟7个token
50%UnverifiedMiMo-V2.6在发布当天即获得vLLM的零日(day-0)支持,两个规格版本发布当天即可通过vLLM部署运行
50%UnverifiedMiMo-V2.6与V2.5属于同一架构类别,此前服务端组件可直接沿用,包括混合滑动窗口注意力+全局注意力、MiMo推理与工具调用解析器、DFlash投机解码
50%UnverifiedMiMo-V2.6模型支持1M(一百万)token的上下文长度
50%Unverified团队在验证环节实现了rollout与训练器之间的比特级匹配(bitwise-matched),使推理阶段和训练阶段的模型计算在数值上完全一致
50%Unverified310B参数在float16或bfloat16精度下约占620GB存储,2秒内完成全量同步意味着有效带宽需达到310GB/s以上
50%Unverified该系统使用vLLM驱动rollout(采样生成)过程
50%Unverified全部310B参数在ICI(芯片间互联)网络上的传输在2秒内完成
50%