小米开源MiMo-V2.6:全模态智能与公开训练的野心

小米开源全模态模型MiMo-V2.6,连训练代码与RL环境一并公开,剑指长周期智能体任务。
小米在Product Hunt发布了MiMo-V2.6,一个含Pro与Flash两个版本的开源全模态模型家族,支持文本、图像、音频、视频四种模态及100万token超长上下文,专为长周期智能体任务设计。区别于多数「开源模型」仅公开权重的惯例,MiMo-V2.6同步开放了技术报告、强化学习训练环境与完整后训练代码,将「如何造出这个模型」也一并交给社区。这一举措有助于缓解AI领域的可复现性问题,并为长周期智能体研究提供可共享的标准化训练基础设施。对小米而言,这也是一种以开放换生态影响力的长线战略,与其庞大的硬件与IoT应用场景形成潜在协同。
小米在Product Hunt上推出了MiMo-V2.6,这是一个面向长周期智能体任务的开源全模态模型家族。它的定位相当直接——用一句话概括就是「公开训练的开放全模态智能」。在闭源大模型仍占据主流话语权的当下,小米选择把模型、技术报告乃至训练代码一并开源,这本身就是一个值得深入拆解的动作。

什么是MiMo-V2.6
MiMo-V2.6由两个版本组成:Pro 和 Flash。两者都具备处理文本、图像、音频和视频的全模态能力,并支持高达100万(1M)token的上下文长度。这样的规格意味着模型能够在单次会话中消化超长文档、完整视频或复杂的多模态输入,为长周期智能体(long-horizon agent)任务提供支撑。
所谓「全模态」(omnimodal),指的是模型不只是能看图或听音这么简单的多模态能力,而是把文本、视觉、听觉等多种信息通道统一整合在同一套模型架构中处理。这与近年来行业追求的「统一模型」趋势一致——让一个模型尽可能覆盖更多信息形态,而非为每种模态单独训练专用模型。
Pro 与 Flash 的定位差异
从命名可以推测两个版本的侧重不同。Pro 通常代表能力更强、参数规模更大、适合复杂推理与高精度任务的旗舰版;Flash 则往往强调速度与效率,适合对延迟敏感或需要大规模部署的场景。这种「双版本」策略在开源模型生态中越来越常见,让开发者能根据成本与性能需求灵活选择。
「公开训练」意味着什么
MiMo-V2.6最引人注目的不是模型本身的参数或跑分,而是它「trained in public」(公开训练)的理念。小米不仅发布了模型权重,还一并公开了三样关键资产:
- 技术报告:详述模型架构与训练方法论
- 强化学习(RL)环境:支撑智能体训练的仿真与交互环境
- 训练代码:整个公开后训练(post-training)流程背后的代码
这在业界并不常见。多数所谓的「开源模型」仅仅开放了权重,却对训练数据、训练环境和完整流程讳莫如深。MiMo-V2.6把后训练环节的RL环境和代码都摆上台面,实际上是把「如何造出这个模型」也一并交给了社区。
为什么这一步很关键
对于研究者而言,RL环境和训练代码的价值可能超过模型权重本身。有了这些,开发者不仅能使用模型,还能复现、验证甚至改进训练过程。这对于当前AI领域普遍存在的「可复现性危机」是一剂良药——太多论文声称的效果无法被独立验证,而完整开源正是打破这层不透明的方式。
对于长周期智能体这类前沿方向,RL环境尤其重要。智能体需要在环境中反复试错学习,缺乏标准化、可共享的训练环境一直是该领域进展缓慢的瓶颈之一。小米把自己的RL环境开源,等于给整个社区提供了一块可复用的试验田。
强化学习(RL)在大语言模型训练中的应用,通常指「基于人类反馈的强化学习」(RLHF)或其变体——模型输出被某种奖励函数评分,再据此调整参数,使模型逐步学会更符合预期的行为。对于智能体任务,RL环境的作用尤为特殊:它不仅是训练发生的场所,更定义了「什么算成功」。环境设计的好坏直接决定了智能体能学到多高质量的策略。过去,各机构的RL训练环境几乎从不对外公开,这导致不同研究之间难以公平比较,也让后来者需要从零搭建基础设施。MiMo-V2.6将RL环境开源,意味着外部研究者可以在完全相同的「赛道」上验证结论,也可以直接在此基础上设计新的任务场景,而不必重新发明轮子。
智能体赛道的一次押注
MiMo-V2.6明确瞄准「long-horizon agent work」——长周期智能体任务。这类任务要求模型能够在漫长的交互过程中保持目标一致性、记忆连贯性,并进行多步规划。100万token的超长上下文正是为这类场景量身定制:智能体在执行复杂任务时会积累大量中间状态与历史信息,短上下文很快就会「遗忘」早期的关键信息。
全模态能力则让智能体不再局限于纯文本世界。一个能同时理解屏幕截图、听懂语音指令、分析视频内容的智能体,显然比只会读文字的助手更接近真实世界的应用需求。小米作为一家硬件与IoT生态庞大的公司,在这个方向上的布局有着天然的落地场景想象空间——从手机助手到智能家居,全模态智能体都有用武之地。
「长周期智能体任务」(long-horizon agent tasks)是当前AI研究中的一个核心难题。传统对话模型擅长单轮或短轮次交互,但面对需要跨越数十乃至数百步骤的复杂目标——例如自主完成软件开发流程、长时间浏览网页并整合信息、或在智能家居中协调多设备完成系列操作——模型往往因上下文截断、目标漂移或中间步骤失误而失败。100万token的上下文窗口在技术上缓解了「遗忘」问题,但更深层的挑战在于模型是否具备跨步骤的规划与自我纠错能力。这也是为何RL训练在该方向备受重视:通过在环境中反复试错,模型可以学习到比单纯监督微调更鲁棒的长程决策策略。
开源策略背后的考量
在Product Hunt上,MiMo-V2.6获得了81个投票,排名第11,被归类于「开源」与「人工智能」两个标签下。虽然社区讨论尚不热烈(仅1条评论),但完整开源的姿态本身传递出明确信号:小米希望通过开放来建立技术影响力与开发者生态。
对于一家消费电子巨头来说,选择把核心AI能力开源而非闭源变现,是一种以生态换影响力的长线策略。开源能快速吸引研究者与开发者参与,形成技术护城河之外的「社区护城河」。当越来越多人基于MiMo构建应用、贡献改进,模型本身的迭代速度和适用广度都会受益。
不过,开源模型的真正价值最终还是要用实际表现说话。目前公开的信息更多停留在能力宣称层面,模型在各类基准测试中的具体成绩、与同类开源全模态模型(如Qwen-VL系列等)的横向对比,仍有待社区在实际使用中检验。
小米此次选择的开源路径与Meta(LLaMA系列)、阿里(Qwen系列)的策略颇为相似,但也有所区别。Meta和阿里的开源重心在于模型权重与技术报告,而训练数据和完整后训练代码极少同步公开。MiMo-V2.6额外开放RL训练环境,使其在「开源深度」上更进一步。这种策略在商业逻辑上也有其合理性:小米的核心收入来自硬件与IoT生态,AI模型本身并非直接变现产品,因此开源的机会成本相对较低,而换来的开发者生态积累与品牌技术形象则是长期资产。与此同时,开放RL环境也有助于吸引学术界合作,加速模型在垂直场景下的能力拓展。
值得关注的方向
MiMo-V2.6的发布反映出开源AI竞争已经从「是否开源」进入「开源到什么程度」的新阶段。当权重开源成为标配,训练环境与代码的开放就成为衡量开源诚意的新标尺。
对开发者和研究者来说,几个点值得持续跟进:Pro与Flash的实际性能梯度、1M长上下文在真实智能体任务中的表现、以及RL环境的可用性与文档完善度。如果这些环节都能兑现承诺,MiMo-V2.6有望成为长周期智能体研究的一个重要开源基座。
相关推荐

离子推进器:赢得太空竞赛的慢速火箭
离子推进器以极低推力、极高效率成为太空深空探测与货运物流的关键技术。本文解析离子引擎的工作原理、氙气推进剂的选择、太阳能与核电推进的权衡,以及它为何可能成为建造星际文明的"慢速火箭"。

人类造过最快的东西:帕克太阳探测器的43万英里时速
人类建造过最快的物体不是旅行者号或火箭,而是NASA帕克太阳探测器,时速约43万英里。本文解析它如何借助金星引力辅助与太阳引力井加速,以及为何以光速衡量人类仍刚刚起步。

美光CEO警告:内存供应将在未来两年持续趋紧
美光CEO表示存储芯片供应将在未来两年比当前更为紧张,AI需求激增与产能扩张滞后是主因。本文分析内存供应趋紧的原因及其对市场和消费者的影响。