小米开源MiMo-V2.6,强化学习投入347万美元,能力升级价格不涨

IP归属:广东

文章AI导读

一键萃取文章精髓,核心观点即刻呈现

今天凌晨,小米发布并开源 Xiaomi MiMo-V2.6 系列,包含 Pro 和 Flash 两款原生全模态模型,沿用 V2.5 系列 API 定价。小米将此次发布视为探索递归自我改进路径的关键一步,希望通过复杂任务中的持续试错与反馈,提升模型能力。

据官方公布的数据,MiMo-V2.6-Pro 在 Artificial Analysis 综合智能指数中取得46分,超过 Kimi K3 和 Qwen3.8 Max。小米称其为当前该榜单表现最好的开源模型,但承认与 Claude Fable 5.1、GPT-6 Astra 等头部闭源模型仍有差距。在多数智能体评测中,Pro 达到比肩 Claude Opus 5 和 GPT-5.6 Sol 的表现,Flash 则全面超过上一代 MiMo-V2.5-Pro。

此次升级的重点是大规模强化学习。小米公开了持续近六天的 Live RL 训练过程,Flash 和 Pro 的训练成本分别约85万美元、262万美元,合计约347万美元。两个模型各完成30步训练,训练任务平均通过率分别相对提升25%和12%。在未参与训练的长程软件工程评测 DeepSWE v1.1 中,Flash 从48.8分升至65.68分,Pro 从58.4分升至72.57分。

据介绍,这轮训练支持100万 token 上下文,单步训练量达到27亿至37亿 token,任务覆盖编程、通用智能体、视觉与网络安全。针对模型利用评分漏洞获取奖励的问题,小米引入对抗评测、异常检测和验证器交叉校验,以提高训练稳定性。

应用方面,小米提出从“Vibe Coding”走向“Vibe World”。官方展示了模型通过多智能体协作搭建3D游戏场景、操作 Blender 建模,以及在仿真环境中控制机械臂的案例。模型还可调用设计及音视频工具,完成网页、幻灯片和视频制作。在科研案例中,Pro 协助研究人员筛选污染物吸附材料,并参与完成《周期三蕴含混沌》主定理的 Lean 4 形式化证明。

除此之外,小米还同步开放9B蒸馏模型、7000余个强化学习任务环境、端到端训练框架及轻量智能体框架,供社区研究和验证。

价格方面,Flash 的缓存命中输入、普通输入和输出价格,分别为每百万 token 0.02 元、1 元和 2 元;Pro 则分别为 0.025 元、3 元和 6 元。

追求响应速度的开发者还可以选择 Pro-UltraSpeed,其三项价格分别为每百万 token 0.25 元、30 元和 60 元,相当于用普通 Pro 十倍的调用成本,换取最高 20 倍的输出速度。

开发者需要处理海量 token、运行长链路 Agent 或大规模部署模型时,调用成本会随着任务规模迅速累积。在同等智能水平下,MiMo-V2.6 系列的价格仅为海外模型的 1/20 至 1/60。

陀螺科技现已开放专栏入驻,详情请见入驻指南: https://www.tuoluo.cn/article/detail-27547.html

前方智能专栏: https://www.tuoluo.cn/columns/author1911845/

本文网址: https://www.tuoluo.cn/article/detail-10131228.html

免责声明:
1、本文版权归原作者所有,仅代表作者本人观点,不代表陀螺科技观点或立场。
2、如发现文章、图片等侵权行为,侵权责任将由作者本人承担。

相关文章