成本减半效率翻倍:小米新一代全模态MiMo-V2.5发布
小米发布 MiMo-V2.5 系列大语言模型,并且即将面向全球开源。

这一系列,大语言模型包含 MiMo-V2.5 和 V2.5-Pro 两个版本,在全模态感知、长程任务独立处理以及 Token 消耗效率上实现了全方位跃升。
跨越长程任务壁垒
MiMo-V2.5-Pro 是小米迄今最强大的模型。在通用 Agent(智能体)能力、复杂软件工程以及长程任务等维度上,它已经具备与 Claude Opus 4.6、GPT-5.4 等全球顶尖模型正面较量的实力。

官方表示 MiMo-V2.5-Pro 专为高难度复杂任务目标设计。日常工作中,那些需要人类专家数天乃至数周才能搞定的工作,现在可以直接交接给它。它能独立跑完漫长的执行流程,全程保持极高质量的输出。
比如,北京大学《编译原理》课程中有一个经典项目,要求使用 Rust 语言从零实现一个完整的 SysY 编译器。
整个项目涵盖词法分析器、语法分析器、AST、Koopa IR 代码生成、RISC-V 汇编后端以及性能优化。
北大本科生完成这项作业通常需要几周时间,而 MiMo-V2.5-Pro 接下这个任务后,仅用 4.3 小时,调用 672 次工具,就在隐藏测试集中拿下了 233 分满分,展现出极高效的生产力价值。

它没有陷入反复试错的蛮力,直接像老练的程序员一样逐层搭建整个编译器。
先搭好完整的流水线骨架,接着逐层攻克核心模块。最终 Koopa IR 代码生成拿下 110 分满分,RISC-V 汇编后端拿到 103 分满分,性能优化也斩获 20 分满分。
首次编译通过率达到 59%,模型在运行任何测试前就已经构建了正确的架构。执行到第 512 轮时,一次代码重构让 lv9/riscv 模块回退了两个测试点,模型立刻自行诊断问题,快速恢复代码,继续向前推进任务。
仅仅输入一句“构建一个视频编辑器 Web 应用”的简单指令,它就开始了长达 11.5 小时的自主工作。经过 1868 次工具调用,它最终交付了一款完全可运行的 Web 应用。总计 8192 行代码里,完整包含了多轨道时间线、片段裁剪、交叉淡化、音频混合以及导出流程等复杂功能。
,时长00:24
原生全模态与效能跃迁
基础版 MiMo-V2.5 是一款为智能体场景原生的全模态大模型。
它能同时看、听、读,迅速将理解转化为具体行动。在 Claw-Eval 等权威评测中,它的智能体能力全面超越上一代 MiMo-V2-Pro,同时 API 调用成本降低了大约 50%。
基准测评数据反映了它在多模态感知能力上的大幅跃升,多模态感知全面超越 MiMo-V2-Omni。

其跨模态推理、视频理解和图表分析水准,在 VideoMME、CharXiv 以及 MMMU-Pro 等评测中表现优异,逼近甚至超越行业内顶级的闭源模型。
整个 MiMo-V2.5 系列都在 Token 消耗效率上做了深度优化,用更少的资源办更多的事成为这一代模型的底层逻辑。

在 ClawEval 榜单取得相同分数的情况下,MiMo-V2.5-Pro 比 Kimi K2.6 节省了 42% 的 Token,基础版 MiMo-V2.5 比 Muse Spark 节省了 50%。
应对不同场景,两个版本有着清晰的分工。Pro 版本专攻长周期、高难度的智能体任务,基础版则覆盖绝大多数通用场景。两者都具备 100 万上下文长度的支持能力。

基础版不仅具备涵盖图像、音频与视频的原生全模态能力,还拥有更快的平均推理速度,能够敏捷响应对时延要求苛刻的任务。
小米 MiMo-V2.5 和 MiMo-V2.5-Pro 模型即将在全球开源。
参考资料:
https://mimo.xiaomi.com/zh/