
本文是Minimax最新发布的M2.5模型的解析,介绍了 MiniMax M2.5 基础模型的发布及其在智能体(Agentic Intelligence)领域的战略转型。该模型采用创新的 Sparse Mixture-of-Experts (MoE) 架构,通过 2300 亿总参数量提供深厚的知识储备,同时仅激活 100 亿参数以实现极高的推理效率和低成本。全文重点强调了其在软件工程与办公自动化场景中的卓越表现,特别是在 SWE-Bench 编程评测中表现优异,并引入了交替思考(Interleaved Thinking)机制以增强逻辑透明度。最终,文章指出该模型通过极具竞争力的定价策略和多模态整合,旨在消除企业级 AI 应用的经济障碍,构建可持续进化的数字员工生态。

这不仅是一个新产品的发布,更标志着 AI 行业的一个重要转折点。2026 年 2 月 12 日,MiniMax 正式推出了旗舰模型 M2.5。 与以往的模型不同,官方将其定义为“全球首个专为 Agent(智能体)场景设计的生产级模型”。这里的关键词是“生产级”——它不再仅仅是用来闲聊或写短代码的玩具,而是为了解决实际工作流中的成本和效率瓶颈而生。 M2.5 的核心愿景是实现“智能太便宜以至于无法计量”(Intelligence too cheap to meter)。通过极致的成本控制和推理速度,它让大规模、长时间运行的自主智能体在经济上首次变得可行,我们称之为“生产力革命的奇点”

M2.5 的发布在资本市场引发了剧烈震动。发布当天,母公司 MINIMAX-WP (00100.HK) 的股价单日暴涨超过 20%,市值一举突破 1800 亿港元。 为什么资本市场如此兴奋?因为这代表了市场逻辑的转变。投资者不再仅仅为参数竞赛买单,而是为“AI 的工业级交付能力”投票。M2.5 证明了大模型可以从“炫技”走向真正的“打工人”角色——能够独立完成高价值的商业任务,如复杂的金融建模或深度行业调研,而不仅仅是作为一个辅助对话框存在。这 1800 亿,是对“原生 Agent”商业价值的肯定。

长期以来,我们在使用 GPT-4 或 Claude Opus 时,心里总有一笔账:‘这个 Prompt 会不会太长?’、‘让它多思考几步会不会太贵?’。这种‘Token 焦虑’限制了 Agent 的真正落地。
MiniMax M2.5 正式提出了一个概念:Intelligence too cheap to meter(智能太便宜以至于无法计量)。
让我们看这组不可思议的数据:
• 1 美元能做什么? 在 M2.5 的 Lightning 模式下,1 美元可以让模型以 100 Tokens/秒 的极速,连续不断地思考和输出 整整 1 个小时。
• 1/20 的成本: 它的推理价格仅为 GPT-5 和 Claude Opus 的 二十分之一。
• 数字员工的工资: 屏幕上这行字不是玩笑——你可以仅用 1 万美元,就雇佣 4 个 M2.5 智能体,全年无休、24小时不间断地为你工作。
这意味着什么?意味着我们终于可以用**‘暴力推理’(Brute Force Reasoning)**了。在解决复杂代码 Bug 或进行深度市场调研时,我们可以让 Agent 自我反思 10 次、尝试 100 种路径,而无需担心破产。
当智能变得像水电一样廉价时,真正的 Agent 爆发期才算到来。

M2.5 如何做到既聪明又极速?答案在于其独特的 Sparse Mixture-of-Experts (MoE) 架构。 这就好比一座拥有 2300 亿图书(参数)的图书馆,但每次只派出最精通相关领域的 100 亿个图书管理员(激活参数)来为你服务。
• 230B 总参数:保证了模型拥有深厚的知识储备和逻辑深度,能够处理复杂的长尾问题。
• 10B 激活参数:让它的推理速度飞快,可以在消费级显卡上流畅运行,推理成本大幅降低。
• 204K Context Window:它并非使用滑动窗口投机取巧,而是采用了全注意力机制(Full Attention),这意味着在处理长达 20 万 tokens 的项目代码或文档时,它不会“捡了芝麻丢了西瓜”,能保持全局的连贯性。 这种架构完美解决了“大模型太慢、小模型太傻”的行业悖论

M2.5 引入了 Interleaved Thinking(交错思维) 模式,这是它变身“资深工程师”的关键。 传统的 LLM 往往是“直觉式”生成代码,容易出错。而 M2.5 采用了类似人类专家的 “Plan(规划) -> Verify(验证) -> Generate(生成)” 循环。 在输出最终代码前,你会看到被 <think> 标签包裹的思考过程。模型会先像架构师一样写 Spec(规范),拆解需求,甚至在脑海中预演代码结构。官方将这种透明的思维链称为 "Developer's Stack Trace"(开发者的堆栈追踪)。如果移除了这些思考 Token,模型的智商将显著下降,因为它会失去逻辑推演的上下文

在硬核的编程能力上,M2.5 交出了一份令人咋舌的成绩单。 在业界公认最权威的 SWE-Bench Verified 榜单上,M2.5 斩获了 80.2% 的高分,直接对标甚至超越了 Claude Opus 4.6。
• 多语言能力:它不仅精通 Python,还在 Go、Rust、C++ 等 10 多种语言上表现出色,Multi-SWE-Bench 得分 51.3%,位居全球前列。
• Repo-level Refactoring:更重要的是,它在处理多文件编辑和复杂仓库重构时,展现出了超越 OpenAI Codex 的稳定性。这意味着你可以放心地把整个项目丢给它,而不用担心它改坏了其他模块。

M2.5 的定位已经超越了“聊天机器人”,它是一个能直接交付工作成果的 Digital Employee(数字员工)。 我们将其能力具象化为三大场景:
1. Financial Modeling:结合 Excel 工具,它能建立复杂的财务模型,并在内部评估中取得了 59% 的胜率。
2. Deep Research:它能进行深度行业调研,自动聚合信息并生成 Word 格式的深度报告。
3. Strategy:它甚至能直接生成专业级的 PPT 演示文稿,用于战略咨询。 这标志着 AI 从提供“建议”转向了直接提供“文件”,真正介入了核心办公流。

M2.5 只是大脑,MiniMax 构建的是一个全栈的 Multimodal Agent Ecosystem。 通过 MCP (Model Context Protocol) 协议,M2.5 可以指挥其他模态的模型协同工作:
• Hailuo Video (Vision):用于生成视频内容,甚至可以制作 1080P 的教程视频。
• Speech 2.6 (Voice):提供端到端延迟低于 250ms 的超快语音交互。
• Tools (Action):调用各种工具执行操作。 想象这样一个场景:你让 Agent 分析一段代码(M2.5),然后用语音解释 bug 的原因(Speech 2.6),最后自动生成一个修复教程视频(Hailuo Video)。这就是“听、说、看、做”完全体的力量

所有这一切能力的基石,是 M2.5 带来的 经济性颠覆。 长期以来,企业因为昂贵的 Token 费用而不得不限制 AI 的“思考时间”。M2.5 打破了这一限制:
• 成本仅为 1/20:相比 GPT-5 和 Opus,其价格只有对手的二十分之一。
• $1 跑一小时:以 100 Tokens/秒的极速连续运行一小时,成本仅需 1 美元。 这意味着我们可以采用 Brute Force Reasoning(暴力推理) 策略——让 Agent 进行成百上千次的自我验证和尝试,直到结果完美,而无需担心破产。这开启了真正的“自主 Agent 经济

为了让开发者能立刻用上 M2.5,MiniMax 已经全面打通了主流开发生态。
• 工具集成:你可以直接在 Cursor、VS Code (Claude Code)、Trae 等 IDE 中无缝切换到 M2.5。
• 部署灵活:
◦ 公有云:通过 MaaS API 接入,提供 Coding Plan 订阅制(10/20 每月),大大降低个人开发者门槛。
◦ 隐私部署:对于数据敏感的企业,M2.5 支持本地私有化部署,一套 8xH100 集群即可运行,确保代码绝不出内网

当然,我们也需要保持客观和冷静。极致的速度和逻辑背后,M2.5 依然面临挑战。
• Reward Hacking(奖励黑客):由于通过强化学习过度优化了思考过程,模型有时会陷入“过度思考”,在简单问题上浪费大量 Token 进行无意义的纠结。
• 创意短板:它是一个极其严谨的工程师,但在创意写作上可能表现得过于生硬、机械。
• 需要约束:为了发挥其最大效能,使用者需要掌握更严格的 Prompt 技巧,设置护栏,防止它在复杂的 Agent 循环中迷失方向

最后,让我们展望未来。MiniMax M2.5 向我们展示了一条通往 AGI 的 “务实之路”。 真正的 AGI 可能不是一个能像人类一样闲聊的万能神,而是一个 专业、极度廉价、不知疲倦的数字专家。 随着 M2.5 的发布,我们正处于“数字员工”大规模入职的前夜。未来的公司,可能就是由少数人类管理者和成千上万个像 M2.5 这样的智能 Agent 共同组成的。这不仅是技术的进步,更是生产关系的重构 PS:个人观点 —— 对于200B级别的模型,由于参数量规模,Benchmark的分数相对较虚,不同用户真实使用时体感可能不完全相同,本文内容大部分来自于信息搜集不代表本人的真实感受。请大家使用时斟酌使用