小米开源MiMo-V2.6,1.02万亿参数按MIT协议可直接商用

首页 / AI资讯 / 大模型

0:00
0:00
1x
定时

开源模型的竞争焦点,过去一年大多围绕参数规模和榜单排名展开。9月22日小米发布并开源MiMo-V2.6系列,把重心挪到了另一个位置:训练过程本身。这次放出的不只有权重,还有强化学习的任务环境、训练框架与技术报告,等于把模型能力的生产方式一并公开。

1.02万亿参数,每词元只激活420亿

MiMo-V2.6包含两个主要版本。旗舰MiMo-V2.6-Pro是稀疏混合专家模型,总参数1.02万亿,每词元仅激活420亿,路由专家总数384个,每次激活其中8个,上下文长度支持到100万词元。轻量版MiMo-V2.6-Flash总参数3090亿,激活参数150亿。

两个版本都是原生全模态模型,可处理文本、图像、视频与音频输入,输出为文本。配套的视觉编码器参数量为6.81亿,音频分词器为3.08亿。这种把多模态能力放进同一个主干的做法,与把各模态拆成独立小模型的路线不同,优势在于跨模态的任务可以共享同一套推理与工具调用能力。

权重已在Hugging Face按MIT协议发布,包含MiMo-V2.6-Pro-RL、MiMo-V2.6-Flash-RL以及一个MiMo-V2.6-Distill-Qwen-9B的蒸馏版本。MIT许可意味着可以自托管、微调并用于商业产品,无需额外申请。小米建议使用SGLang或vLLM部署,并给出了张量并行的配置建议。

定价策略延续上一代。Pro版未命中缓存的输入为每百万词元0.435美元,输出为0.87美元,缓存命中输入低至每百万词元0.0036美元,折扣超过99%。此外还有一个UltraSpeed模式,官方称输出速度最高可达标准版的20倍,定价也相应提高十倍。

榜单成绩:开源第一,与闭源旗舰并列

Artificial Analysis在4.3版智能指数上给Pro打了46.32分,这一成绩在开源权重模型中排名第一,领先智谱的GLM-5.3,并与xAI的Grok 4.7持平。作为对比,上一代MiMo-V2.5-Pro在同一指数上处于26分区间,两代之间的提升幅度相当可观。

评测机构测算的单任务成本约为0.13美元,跑完整个评测集的费用为206.66美元。这个数字是理解这次发布的关键:能力提升的同时,单次调用的经济性没有恶化,等于把帕累托前沿向外推了一段。

在具体任务上,Pro在Terminal Bench 2.1上达到89.9%,略高于Claude Opus 5的89.1%。在网络安全基准CyberGym的最高信息档位上,Pro得分为94.0,Flash为95.1,这是首次有模型突破此前83到85的聚集区间。不过在同类的漏洞利用合成测试上,Pro为47.9,与闭源前沿模型仍有约30分的差距。

轻量版反超旗舰的现象值得单独记一笔。Flash在CyberGym上比Pro高1.1分,却在需要多阶段漏洞利用合成的测试上大幅落后。这说明该基准的难度分布已经饱和,低成本模型也能靠模式匹配拿到高分,而真正区分能力的环节并未被这个指标覆盖。

六天直播训练,七千个任务环境

这次发布最特别的部分是训练过程被公开直播。小米用不到六天时间完成30次强化学习更新,累计约75万条轨迹,其中Pro的训练成本约262万美元,Flash约85万美元。每次更新处理1568个提示词,每个提示词采样16条轨迹,单步训练数据量约2.5万条轨迹,对应27亿到37亿训练词元。

训练方法上,小米采用的是完全异步的GRPO流程,配合分组式的智能体评分机制。评分环节分配了更多算力,通过对多条成功轨迹做相互比较,奖励更准确、更简短、更省词元的解法。此外还引入了多前缀多教师的在策略蒸馏,用来把不同来源的能力压进同一个学生模型。

比模型本身更具复用价值的,是同步放出的7000多个强化学习任务环境,覆盖软件工程、漏洞复现、知识密集型工作与网页开发,另有可组合的网络安全测试工具链。对研究团队来说,环境与评分器的开放程度往往比权重更影响复现难度,这次两项同时给出,门槛明显降低。

效果在留出的软件工程基准上可以直接看到:Pro从58.4提升到72.57,Flash从48.8提升到65.68。这些是训练过程中的实时曲线,而非事后挑选的结果,因此更能说明强化学习规模化的实际收益。

从3D建模到Lean证明,能力边界在往外扩

官方展示的应用场景超出常规编程任务,包括3D游戏搭建、Blender建模、机械臂闭环控制、前后端与演示文稿设计、视频与音乐制作以及科研辅助。这些任务的共同点是步骤长、需要调用外部工具、中途容易失败,正好对应强化学习训练所强调的长程执行能力。

其中一项数学工作值得一提。在一个项目里,Pro协助研究人员完成了一篇论文主定理的Lean 4形式化,最终成果超过6000行,被Lean内核接受且没有留下未完成的证明占位符,而模型并未接受过针对Lean的专门后训练。形式化证明是可机器校验的任务,这类结果比自然语言评测更难注水。

把训练环境、评分方法、训练框架与权重一并开源,对开源生态的影响可能超过榜单名次。过去的开源模型多停留在给出推理能力,训练侧的细节则被当作核心资产保留。小米这次把可复现的部分尽量公开,等于把竞争维度从发布一个更强的模型,推向谁能更快产出下一代模型。

素材来源:IT之家、界面新闻、智东西、Artificial Analysis 发布时间:2026-09-23