ai china

Qwen 的百万 token 窗口,只有一道 2,048 token 的锁孔

7 条来源 4 条一手来源 已翻译 2026年8月31号

正文
参观者聚集在上海举行的 2025 世界人工智能大会阿里巴巴展台周围。

2025 年 7 月,上海世界人工智能大会上的阿里巴巴展台。拥挤的实体现场恰好映照出百万 token 模型主张的另一面:招牌数字大小居于其次,系统如何决定查看哪些内容才是重点。Costfoto/NurPhoto,经 Getty Images 提供。[7]

Qwen3.8-Flash-Next 最醒目的发布数字,是一百万 token 的上下文窗口。更能揭示这套设计的数字则是 2,048。阿里巴巴这款开放权重模型每次执行稀疏注意力查询时,都会由一个学习所得的索引器,从此前内容中选取最多 2,048 个 token,组成至多 512 个每块四 token 的微块,序列尾部尚未完成的块也会加入。百万 token 窗口因此接受选择性访问,稠密注意力每次只处理入选的 token。[1][2]

这一区别构成了此次发布的真正贡献。索引器先接受训练以模仿稠密注意力,主干网络随后也在索引器给出的稀疏选择下继续训练,改动已经超出给传统 Transformer 外接检索过滤器的范围。在团队自己的测试中,这套学习所得的稀疏方案运行注意力内核时速度更快,准确率在部分长上下文检索任务上甚至高于稠密基线。同一组表格也显出“支持一百万 token”与“理解放进这一百万 token 中的任意内容”之间仍有很长距离。[2]

这项成果值得关注,还因为外界可以细致检查它。模型权重已在 Hugging Face 和中国的 ModelScope 公开,技术报告写明训练次序与消融实验,代码仓库也给出了 SGLang、vLLM、Transformers 等运行时的启动方式。[3][4] 解读范围同样需要收紧:目前几乎所有能力证据都来自 Qwen 自己的评测套件。

百万 token 窗口里的选择性视野

Qwen3.8-Flash-Next 采用三层 Gated DeltaNet 与一层 Qwen Sparse Attention 交替排列的方式。Gated DeltaNet 层持续把前缀压缩进固定大小的循环状态。QSA 层恢复对原文的直接检索,但会先让轻量索引器为压缩后的块评分,并挑出相关性最高的区域。模型由此拥有两类记忆:一份持续更新的摘要维持上下文连续性,另一条选择性通道则返回具体 token。[1][2]

发布的模型包含一个 1,250 亿参数的主网络,每个 token 激活约 60 亿参数;另有一张含 510 亿参数的 N-gram 嵌入表,放在加速器之外。原生上下文长度为 262,144 token,Qwen 用 YaRN 将其扩展到一百万;托管的 qwen3.8-flash 服务则默认开放一百万 token。[1][6] 这些细节决定了长窗口主张的实际含义,因为它由多种技术共同完成。稀疏注意力限制直接检索的计算量,循环层让大多数层免于维护稠密键值缓存,托管产品还会采用自己的服务配置。

每个 QSA 层的索引器使用四个查询头和一个共享键头。它每次压缩四个键,对这些微块排序,再把得分最高的微块还原成 token 位置,核心注意力随后只作用于这些位置。可用上下文不断增长时,2,048 token 的选择预算保持不变。这项经济取舍相当于延长存放文档的书架,同时让每次查询只重读入选部分。[2]

这也是一次语义上的押注。索引器一旦没有排到所需段落,直接注意力层便无法从未入选的块中取回它。循环式 Gated DeltaNet 状态仍有机会留下有用痕迹,但它经过压缩,容量也有限。因此,长上下文质量同时取决于 API 能容纳多少文字,以及学习所得的选择策略能否识别特定查询所需的证据。

索引器靠训练融入模型

技术报告中影响最深、也容易略过的一项发现是:完成稠密初始化后直接启用索引器,会造成明显的性能下降。Qwen 让稀疏注意力进入继续预训练,才把性能恢复过来。[2]

第一阶段是稠密蒸馏。索引器训练 1,000 步,每步使用八条长度为 256,000 token 的序列,其余模型参数保持固定。Qwen 估算,这段预热约使用 20 亿 token。教师信号把 token 级注意力汇总到块级,借此教会较小的索引器判断稠密注意力原本会看向哪里。[2]

接下来,模型跨过了更重要的一道界线。QSA 开始选择核心注意力实际使用的块,索引器与主干网络再共同训练 8,000 步。每步使用 96 条长度为 256,000 token 的序列,稀疏训练总量约为 2,000 亿 token。主干网络在这一阶段直接适应这条捷径,并同步调整内部表示。[2]

由此得到的工程启示很明确:QSA 是一套随模型共同训练的稀疏注意力方案。把它直接套在任意稠密模型上,性能损失应当纳入预期。它的选择行为、权重、训练课程、融合内核与主干网络共同组成一个整体。开放仓库从 Day 0 起支持多款引擎,价值在于这些引擎能够忠实执行整套方案;若给一个无关 checkpoint 临时加上相近的稀疏设计,已经超出这项支持的范围。[3]

基准胜出之中也带着警示

在覆盖知识、数学、推理、多语言表现与代码的八项通用基准上,QSA 版本平均得分为 76.8,Qwen 的全注意力基线为 75.9。八项测试中,QSA 在七项追平或领先。这组结果给出一项有用证据:稀疏化未必会损伤常规能力。[2]

长上下文表格更能说明问题。RULER 在 512,000 至一百万 token 区间取平均后,QSA 得分为 93.00,全注意力为 90.08。在八针 MRCR 上,QSA 把 512,000 token 的成绩从 30.66 提高到 40.53,一百万 token 的成绩则从 20.71 提高到 26.44。[2]

两种读法都应保留。上下文变得很长时,QSA 超过了团队的稠密基线,选择器带来的收益也越过了速度层面。结果与一种解释相符:联合训练让检索更集中于高价值区域。与此同时,MRCR 在一百万 token 下的绝对分数依然很低。QSA 在这套设置中更好地找到了基准要求的目标,却远未达到满分。上下文窗口即使在技术上可寻址,困难证据仍会漏失。

RULER 与 MRCR 都偏重检索。它们适合检查远处材料能否保留下来,却无法据此确认模型能可靠推理整个代码仓库、一整年的财务记录,或文本与图像混合而成的资料集合。Qwen 的公开发布博客还列出代码、办公、工具使用与多模态分数,但这些比较采用了不同的评测程序、提示词、评分者和竞品配置。[1] 因而,最清晰的主张只落在局部:在 Qwen 的配对消融中,训练所得的稀疏注意力保住了所测的短上下文能力,并提高了报告中的长上下文检索平均分。

三类速度主张,来自三项不同实验

技术报告测量的是 QSA 注意力模块的效率。上下文达到一百万 token 时,报告给出的预填充加速为 7.6×,解码加速为 4.9×,比较对象是分页式分组查询注意力。测试设置十分具体:预填充以批大小一处理最后一个 16,000 token 块;解码采用批大小四,并加入三个额外的多 token 预测步骤。测量范围包含 QSA 索引器与稀疏核心注意力。[2]

模型服务的全部成本并未纳入这项测试。专家混合路由、前馈层、加宽的残差流、N-gram 内存读取、视觉处理、token 化、请求队列、网络传输和智能体工具循环,都在内核比较之外。这些倍数能够证明,在公开设置下,注意力计算成本下降;将其解释成任意应用都能快 7.6 倍,便超出了证据范围。

Nvidia 给出了第二项实验。该公司在 GB300 NVL72 上开展的 Day 0 测试报告称,每块 GPU 每秒超过 16,000 token,每位用户每秒超过 200 token。这套平台用一个 NVLink 域连接 72 块 Blackwell Ultra GPU,聚合带宽达到每秒 130 TB。[5] 结果说明,这个 checkpoint 可以在机架级系统上高速运行。文章公开的负载细节不足以将这些数字与 Qwen 的一百万 token 内核测试等同起来,对较小集群的参考价值也有限。

托管版 QwenCloud 是第三个服务界面。模型以 qwen3.8-flash 名称开放,带有一百万 token 上下文窗口,并兼容多种 API 协议。[6] 这项信息证明模型已完成产品集成;任意一条百万 token 请求的延迟与检索质量,仍需另行测量。内核、机架和 API 指标回答的是不同问题,把三者合并成一个数字,会生成各项来源都没有提出的性能主张。

严肃评测应当保留什么

对开发团队而言,合格的测试需要越过“一百万 token 请求能否返回结果”这一层,分成三个部分。

首先,衡量证据能否在选择后存活。把必要证据放在真实文档的不同位置,加入具有迷惑性的干扰项,改变最终查询的措辞,再记录准确率如何随上下文增长而变化。能够找到精确重复字符串的选择器,面对改写表达或分散在多个块里的要求时,仍有遗漏风险。

其次,分开测量注意力速度与服务速度。按照应用实际采用的批大小和前缀缓存命中率,记录首 token 时间、token 间延迟、总完成时间、吞吐量与尾延迟。如果专家通信或内存流量吞掉了内核收益,预算就应按部署结果制定,架构图只能用于解释原因。

第三,测试官方支持的软件组合。Qwen 的代码仓库列出了具体引擎与启动配置;ModelScope 则为同一款发布模型提供中文第一手分发渠道。[3][4] 版本、精度、张量并行方式、上下文扩展设置与多模态输入,都应写入测试记录。

这项主张有清楚的证伪条件。如果彼此匹配的独立端到端测试表明,QSA 在真实语料上的检索优势消失,或索引器与系统开销在注意力内核之外抹去了速度收益,那么这项技术就应归入专项优化,尚不足以成为新的长上下文默认方案。如果配对优势继续存在,Qwen 证明的内容会比一枚巨大的上下文标签更重要:学习所得的稀疏通道,在其受训寻找的信息上可以胜过穷举式注意力。

这正是中国 AI 领域更持久的信号。竞争焦点正从发布越来越大的窗口,转向公开让这些窗口真正可用的技术,也开始提供足够细致的消融结果,供外界找出技术仍会失效的位置。

来源

  1. Qwen 团队,〈Qwen3.8-Flash-Next:全新架构,迈向极致成本效率〉(2026 年 8 月 26 日)——官方双语发布,涵盖模型配置、架构概览、报告的评测、上下文限制与托管服务定位。
  2. Qwen 团队,〈Qwen3.8-Next 架构设计:评测、效率与训练稳定性〉(2026 年 8 月 26 日)——技术报告,涵盖 QSA 训练、微块选择、全注意力消融、RULER 与 MRCR 结果,以及内核级测试设置。
  3. QwenLM,Qwen3.8-Flash-Next 官方 GitHub 代码仓库——发布记录、开放权重分发链接、支持的推理软件与部署命令。
  4. Qwen,ModelScope 上的 Qwen3.8-Flash-Next——中文第一手模型页面、发布时间、模型家族说明与国内分发渠道。
  5. Rajath Narasimha,Nvidia 技术博客,〈在 NVIDIA GB300 NVL72 上试用 Qwen3.8-Flash-Next 开展智能体编程〉(2026 年 8 月 26 日)——Day 0 支持、机架拓扑,以及供应商报告的完整模型吞吐量。
  6. QwenCloud,〈模型发布〉更新日志(2026 年 8 月 26 日条目)——托管版 qwen3.8-flash 的可用情况、默认一百万 token、模态与 API 兼容性。
  7. Vincent Chow,〈认识在通义实验室扩展阿里巴巴 AI 未来的年轻人才:Qwen 模型开发团队〉,《南华早报》(2025 年 10 月 28 日)——Qwen 团队背景,以及 2025 世界人工智能大会阿里巴巴展台 Costfoto/NurPhoto 照片的来源页面。
Previous 中国 AI IPO 热潮已经找到买家,稳定价格仍未落定

Recommended In ai china

Matched by subject and format