ai china

AI-China 评测笔记:读懂 QwQ-32B,要先看部署条件,再看榜单成绩

6 条来源 1 条一手来源 已翻译 2026年4月10号

正文
一张真实航拍照片里,杭州滨江的阿里巴巴园区楼群铺展开来。

题图拍摄的是阿里巴巴杭州滨江园区。本文关心阿里如何把 QwQ-32B 接入托管服务与本地部署方案,也关心硬件和吞吐限制如何影响实际运行,因此真实园区比脱离运行条件的推理榜单更贴合主题。

截至 2026-04-10 UTC,观察 QwQ-32B,只看评测图或模型名称都会漏掉更重要的信息。模型卡与阿里自己的文档共同说明:QwQ-32B 把前沿推理能力装进一款开放权重的 32.5B 稠密模型,也让它的部署边界清晰可见。提示词格式、采样参数、长上下文处理、GPU 显存容量、运行时选择,以及托管或本地部署,都会影响榜单表现能否在生产环境中重现。[1][2][3][4][5]

公开资料列出了 QwQ 的两种使用路线:开放权重与托管服务。在开放权重一侧,Hugging Face 模型卡将 QwQ-32B 列为一款经强化学习训练的推理模型,支持 131,072 token 上下文;与 DeepSeek-R1o1-mini 对比时,它取得了具有竞争力的成绩。[1][5] 在托管服务一侧,阿里云 Model Studio 说明 QwQ 基于 Qwen2.5 训练,数学、代码与通用评测成绩和完整版 DeepSeek-R1 相当。国际部署模式下,服务端点设在新加坡,数据也存储在当地。[2] 两页资料合在一起看,QwQ 同时是一款发布的模型和一套可供调用、部署的产品入口。

图片说明:题图采用 Wikimedia Commons 上阿里巴巴杭州滨江园区的真实照片。本文讨论的是 QwQ-32B 如何接入公司级基础设施并走向实际部署,这张园区照片比抽象的推理排行榜更切合主题。[6]

评测成绩附带一套推理契约

模型卡先写明了这套契约。[1]

QwQ-32B 的规模为 32.5B,完整上下文长度为 131,072 token;模型卡紧接着说明,调用方式会左右性能。[1] 提示词超过 8,192 token 时,使用者必须启用 YaRN。Qwen 团队还建议让模型以 \<think\>\n 开始输出,将 Temperature 设为 0.6TopP 设为 0.95TopK 设在 20 到 40 之间,并为数学题和多选题统一输出格式。[1] 这些说明决定了评测成绩应当如何解读。

因此,QwQ-32B 与 DeepSeek-R1 的对比分数衡量的是一整套配置:除了模型权重,还包括提示词模板与解码参数。[1][5] 评测者若更换模板、移除 thinking 前缀、调整采样参数,或在长上下文任务中省略 YaRN,所得结果更适合作为方向性参考,移植时需要重新校准。本文也因此把 QwQ 放在 Benchmark & Eval Notes 中讨论,重点考察评测条件。

阿里云的托管模型列表从另一侧印证了这一点。Model Studio 将 QwQ 列为托管推理选项,说明它基于 Qwen2.5、采用强化学习训练,并把“与 DeepSeek-R1 表现相当”的说法对应到 AIME 24/25LiveCodeBenchIFEvalLiveBench 等具体评测。[2] 阿里自己的托管页面同样说明,榜单结论对应的是一套经过评测、有明确条件的配置。

“本地部署”的硬件清单更能说明问题

第二组条件来自硬件,QwQ 的意义也由此变得更具体。[3]

阿里云 ECS 部署指南称,QwQ-32B 支持在消费级显卡上本地运行,是一款门槛相对较低的推理模型。[3] 同一份指南的硬件表随即列出具体要求:模型体量 123 GB,建议配备 64 GB RAM4 x 24 GB GPU 显存,参考实例规格为 ecs.gn7i-4x.16xlarge。[3] 推理服务使用 vLLM,示例版本为 v0.7.2;交互层使用 Open WebUI,GPU 驱动版本至少为 550。[3]

同它对标的巨型前沿模型相比,QwQ 的确轻了许多;阿里所谓的“本地部署”依然是一套多 GPU 方案,需要可观的显存,所需云实例也已属于正式的基础设施投入。它离业余玩家随手运行的模型仍有距离。[3]

榜单标题常常省略这些实际运行条件。QwQ-32B 相对 DeepSeek-R1 很紧凑,对普通团队仍然很重。它缩短了前沿推理与可部署稠密模型之间的距离,部署本身的难题依旧存在。[1][3][5]

性能表说明:32B 的成本仍然可观

阿里云 CAP 的性能比较进一步列出了实际运行条件。[4]

这份文档在 Ada 系列 GPU 上比较了 SGLangvLLM,测试对象包括 Qwen-QWQ-32B-AWQQwen-QWQ-32B 和一款更小的 Qwen2.5 指令模型。[4] 总体来看,多数测试中 SGLang 快于 vLLM;模型负载越高,双卡张量并行带来的收益越大。[4] 对 QwQ 而言,后面的具体数字更值得留意。

对于 Qwen-QWQ-32B-AWQ,文档将最大并发建议上限设为 5,单卡吞吐约 35 tokens/s,双卡吞吐约 50 tokens/s。[4] 完整版 Qwen-QWQ-32B 的建议上限同样为 5;单张 Ada 卡显存不足,无法运行该模型,文档只给出双卡约 20 tokens/s 的吞吐结果。[4]

这张表把部署条件换算成了可比较的指标。模型从宣传图走进实际推理服务后,评估时需要逐项确认:使用哪套提示词约定和运行时;完整版权重是否装得进显存,是否需要量化;可维持多少并发;最终吞吐还有多少。[1][3][4] QwQ 在评测中与 DeepSeek-R1 持平仍有意义,完整的成本判断还要加上这些数据。

为何它也是一条 AI-China 分发信号

QwQ-32B 为中国推理模型市场开出了一条新的中间路线。[1][2][3][4][5]

一端是体量庞大的前沿系统,性能强,部署也复杂;另一端是更小的指令模型,更容易部署,多步推理能力却较弱。QwQ 处在更有商业价值的中间位置:开放权重、稠密模型,在特定评测上足以宣称与高端推理模型表现相当。阿里云已经为它准备了托管服务、部署指南、GPU 实例与运行时,这些服务和工具也随之进入用户的技术与采购选择。[2][3][4]

所以,理解 QwQ 要从部署条件入手。对 AI-China 观察者而言,它既是一条榜单记录,也展示了推理模型竞争如何延伸到产品包装:托管 SKU 是否可用、部署方案是否完整、显存能否容纳模型、量化有哪些选择、运行时如何调优。QwQ 的分量来自这些公开而具体的运行条件。[2][3][4]

结论

理解 QwQ-32B,要先看部署边界,再看评测成绩。[1][2][3][4][5]

模型卡说明,提示词格式、采样参数和长上下文设置会直接影响表现。[1] Model Studio 将同一款模型纳入托管推理服务,并明确标出部署地区。[2] ECS 指南列出的“本地”条件包括 123 GB 模型体量和 4 x 24 GB 显存建议;CAP 报告则显示,完整版模型需要双 Ada 卡,吞吐仍约为 20 tokens/s。[3][4] 这些条件恰好解释了 QwQ 的重要性:它用更紧凑的稠密模型完成前沿式推理,让部署更现实,同时保留了明确的硬件与运行门槛。

来源

  1. Qwen Team,《Qwen/QwQ-32B》Hugging Face 模型卡(32.5B 参数、131,072 token 上下文、8,192 token 以上需启用 YaRN,以及 thoughtful output 与采样设置)。
  2. Alibaba Cloud,Model Studio《Model list》(QwQ reasoning model 描述、评测族,以及国际部署模式下新加坡端点与数据存储说明)。
  3. 阿里云 ECS,《在GPU实例上部署千问QwQ-32B推理模型》(123 GB 模型体量、64 GB RAM、4 x 24 GB 显存建议、ecs.gn7i-4x.16xlarge、vLLM 与 Open WebUI 部署路径)。
  4. 阿里云 CAP,《使用SGLang和vLLM部署Qwen系列模型的性能测试与评估》(Qwen-QWQ-32B-AWQ 与 Qwen-QWQ-32B 在 Ada GPU 上的单卡/双卡吞吐、并发建议,以及单卡显存限制)。
  5. Qwen Team,GitHub《QwQ》仓库页(官方发布背景,以及与 DeepSeek-R1、o1-mini 的对照信息)。
  6. Wikimedia Commons,《File:Alibaba Center in Binjiang Hangzhou2021.jpg》(本文题图来源页)。
Previous AI-China 公司档案:MiniMax 正把前沿模型经济性压成一套可输出的 Agent 工作场 Next BytePlus 的 SeedEdit 2.0 Pro 真正展示的是一张操作菜单:一篇带注释观看,重看身份锁定、文字改写与字节跳动的企业编辑入口

Recommended In ai china

Matched by subject and format