ai china

MiniMax M3 两度发布:服务先行,可审视的基础设施随后开放

6 条来源 3 条一手来源 已翻译 2026年8月8号

正文
访客在 MiniMax 橙色的 HumanX 2026 大会展台交谈,旁边的显示屏介绍 M2.7 模型。

2026 年 4 月,MiniMax 在旧金山 HumanX 2026 展示 M2.7;两个月后,M3 改变了模型架构与部署规模。MiniMax 官方照片。[6]

MiniMax M3 的两个产品发布日期都可以成立,技术论文夹在其间;这条先后顺序正好解释了这款产品。

2026 年 6 月 1 日,MiniMax 通过 MiniMax Code、Token Plan 和 API 开放 M3。发布稿称它为开放权重模型,并在结尾承诺十天内公布技术报告与相应权重。[1] MiniMax Sparse Attention 论文于 6 月 11 日发布。[4] 6 月 12 日,公开模型仓库完成首次提交,配置、代码、许可证和可下载的检查点(checkpoint)随之开放。[2]

截至 2026-08-08T11:39:48Z UTC,两次发布所对应的产品形态都已存在。客户可以购买托管模型,部署团队也可以检查并自行托管模型制品。两者代表的访问方式不同,M3 让其中差异格外容易量化。

服务先行的发布方式呈现了 MiniMax 的分发策略,后续公开的模型制品则显露出底层的工程押注:原生文本—图像—视频训练、百万 token 上下文窗口,以及一套稀疏注意力方法,目标是避免长上下文带来二次方增长的计算负担。这次到来的 M3 超出了“得分更高的 M2.7”这一层;模型、注意力算子、大型检查点、一份定制商业合同,以及一组官方偏好的推理服务系统,共同作为一个整体发布。

模型更新的核心在于注意力更新

M3 共有约 4280 亿个参数;公开材料显示,每个 token 的激活路径约调用 220 亿至 230 亿个参数。模型接收文本、图像和视频,MiniMax 表示,这些模态从训练伊始便共同进入模型,早于后期适配阶段。[2][5]

它的标志性变化是 MiniMax Sparse Attention,简称 MSA。标准全注意力需要让每个查询(query)与不断扩大的键(key)集合逐一比较,成本随序列长度急剧上升。MSA 先插入一条索引分支。这个轻量分支为分组查询注意力(Grouped-Query Attention,GQA)中的每一组,对键值缓存中的数据块打分;主分支随后只对入选块计算精确注意力,并始终保留局部块。[4]

这套设计把百万 token 窗口变成模型内部的一道检索问题。主分支能对索引选出的内容计算精确注意力;相关数据块若未获索引放行,主分支便无从找回。因此,上下文容量和可靠召回是两个不同指标。评估 M3 时,需要同时观察两方面:它能否接收一百万 token;当决定性证据极少、重复出现、互相矛盾,或与查询之间隔着数十万个干扰 token 时,块选择器会如何取舍。

速度主张需要连同测试设备与设置一起阅读。MiniMax 的 M3 发布稿称,在一百万 token 时,每 token 计算量为 M2 的 1/20,预填充(prefill)速度超过 9 倍,解码(decode)速度达到 15 倍。[1] MSA 论文报告了另一项实验:在一个 1090 亿参数的多模态模型上,注意力计算量降至原来的 1/28.4;H800 内核(kernel)测试测得的实际耗时加速为预填充 14.2 倍、解码 7.6 倍。[4] 这些数字分别对应不同的模型、基线和测量层级,需要各自解读。合起来看,它们表明 MiniMax 已取得架构与内核结合的结果;具体服务器、批大小、上下文分布或运行时变化后,倍数也需重新测量。

开放权重对应的制品依然庞大

公开检查点让外界有了具体的检查对象。Hugging Face 当前页面列出 59 个 safetensors 分片,按页面所列大小相加,共 854.18 GB;仓库标明的张量类型包括 BF16 和 F32。[2] 部署预算还需加上运行时状态、键值缓存、临时内存、冗余,以及另一种精度版本所需的存储空间。

混合专家(Mixture of Experts,MoE)采用按需激活:模型存有约 4280 亿个参数,每个 token 实际计算只调用约 230 亿个。其余专家仍在检查点中;整套参数须完整存储,并在路由选中时保持可访问。稀疏发生在计算环节,存储与调度面对的仍是完整模型。

MiniMax 的模型卡列出了 SGLang、vLLM、Transformers、KTransformers、Unsloth 等推理服务或量化路径。[2] NVIDIA 的部署说明从硬件侧呈现了同一幅图景:共有 128 个专家,每个 token 选择其中四个,支持 BF16 与 MXFP8 格式;高性能部署路线以 Blackwell、Dynamo、TensorRT-LLM、SGLang 和 vLLM 为中心。[5] 这些支持很有价值,也划清了受众范围。M3 的公开权重扩大了模型审计与适配的参与面;要为生产环境部署完整上下文服务,团队仍须有能力处理内存布局、并行、缓存行为与低精度执行。

许可证又增加了一层条件。M3 依据 MiniMax Community License 提供下载,与标准宽松型软件许可证有别。商业产品必须展示“Built with MiniMax M3.”字样。产品或服务的年收入不超过 2000 万美元时,须向 MiniMax 发送一次性通知;超过这一门槛,则须事先取得书面授权。许可证还列有禁止用途条款。[3]

因此,准确标签是:依据定制许可证开放权重。这次发布允许本地检查和广泛的非商业使用,也为商业使用划出一条通道,所有授权均附带条件。评估 M3 的团队需要把许可证审查与模型技术适用性分开处理。

基准表格中的数字均有适用条件

MiniMax 报告 SWE-Bench Pro 得分 59.0%Terminal-Bench 2.1 得分 66.0%。[1] 这些数字须连同发布页面的方法说明一起阅读,才能成为有用信号。

SWE-Bench Pro 在 MiniMax 基础设施上运行,以 Claude Code 作为脚手架。Terminal-Bench 使用 8-vCPU、16-GB 沙箱,超时限制为 两小时,采用 Terminus 2,最大输出长度为 128,000 token。一部分对比得分来自官方排行榜,另一些模型则通过 API 在 MiniMax 基础设施上运行。[1] 开发者只要改动智能体执行框架、工具使用策略、超时限制、提示词或仓库环境,评测本身也随之改变。

多模态比较同样有明确范围。在 Video-MME 测试中,MiniMax 以每秒一帧采样视频,允许 M3 最多接收 1,024 帧,每 30 秒插入字幕,并为 M3 与外部模型设置不同的输出 token 数和温度参数。页面明确注明,这项比较中的外部 API 上限为 640 帧。[1] 这些条件划定了结果的解释范围;表格同时测量了产品允许的使用范围与模型本身的行为。

发布稿里最生动的展示——一次接近 12 小时的论文复现实验、18 次提交23 张实验图——都由公司自行运行。[1] 它们呈现了 MiniMax 对 M3 的产品设想:任务积累大量工具调用轨迹并经历多轮修订之后,模型仍能继续发挥作用。这些案例的作用是邀请复现;独立证明还要以公开运行轨迹、环境快照和可重跑测试工具为基础。

服务先行是一项商业决策

6 月 1 日,MiniMax 有意把最便捷的 M3 通道设在托管端。MiniMax Code、Token Plan 和 API 已上线,权重与报告则仍列在后续发布计划中。API 对超过 512,000 token 的输入收取更高的长上下文费率,同时提供可切换的思考模式,以及标准和优先服务等级。[1] 检查点尚未公开时,商业端已经把极长上下文当作独立运行等级处理。

后续开放权重让这项服务的构成变得清晰,同时保留了托管服务的价值。客户可以先查看模型规模、注意力方法、检查点形态、支持的运行时和许可条款,再决定租用托管结果,还是自行持有整套部署设施。真实制品成为硬件与推理合作伙伴的优化对象;研究人员则能测试 MSA 的选择器是否保留各自工作负载依赖的证据。

三类证据会让这次发布更容易判断。第一,独立的长上下文曲线应分别报告 32K、128K、512K 与一百万 token 下的任务质量和检索失败,并把最大可接收输入长度与实测结果分开。第二,推理服务报告应公布硬件数量、精度、批大小、缓存策略、预填充与解码延迟,以及公开检查点的总成本。第三,MiniMax 应落实其开源 MiniMax Code 的既定计划;公开说明称,当前执行工具链建立在 OpenCode 和 Pi 之上。[1] 这样,评估者才能分辨模型行为与外围托管智能体各自带来的影响。

M3 先作为可用的产品到来,随后成为可供检查的制品。第一次发布证明 MiniMax 能迅速把一款新的前沿产品交到用户手中,第二次则使它的核心主张成为可证伪的命题:块选择、内核设计与系统协同设计结合起来,可以让百万 token 多模态工作进入实用范围。

这比再添一个上下文窗口徽章更有价值,同时也带来更大责任。权重公开后,关注点已从 M3 是否存在,转向整套系统离开 MiniMax 之手时,它的注意力取舍、部署账单、评测结果和许可证是否依然合理。

来源

  1. MiniMax,“MiniMax M3: Frontier Coding, 1M Context, Native Multimodality—All in One Model”(2026 年 6 月 1 日;官方发布、产品可用性、架构主张、API 打包、基准结果与评测设置)。
  2. MiniMaxAI,Hugging Face 上的 MiniMax-M3 模型仓库(公开模型卡、配置、检查点分片、支持的推理路径与制品元数据)。
  3. MiniMaxAI,M3 的“MiniMax Community License”(官方许可证文本;非商业授权、商业署名与通知/授权门槛、禁止用途)。
  4. Xunhao Lai 等,“MiniMax Sparse Attention”,arXiv:2606.13392(2026 年 6 月;索引分支设计、训练方法、计算分析、H800 内核测试与评测范围)。
  5. NVIDIA Technical Blog,“Deploy Long-Context Reasoning and Agentic Workflows with MiniMax M3 on NVIDIA Accelerated Infrastructure”(2026 年 6 月 12 日;模型规格与合作伙伴部署栈)。
  6. MiniMax,“MiniMax at HumanX 2026”(2026 年 4 月 15 日;官方活动报道,以及 MiniMax M2.7 时期大会展台照片的来源页面)。
Previous VibeFlow 将向量索引纳入对象存储生命周期 Next SoMBench 要 AI 读懂场面,场面仍由人预先编排

Recommended In ai china

Matched by subject and format