截至 2026-04-10 UTC,观察 QwQ-32B,只看评测图或模型名称都会漏掉更重要的信息。模型卡与阿里自己的文档共同说明:QwQ-32B 把前沿推理能力装进一款开放权重的 32.5B 稠密模型,也让它的部署边界清晰可见。提示词格式、采样参数、长上下文处理、GPU 显存容量、运行时选择,以及托管或本地部署,都会影响榜单表现能否在生产环境中重现。[1][2][3][4][5]
公开资料列出了 QwQ 的两种使用路线:开放权重与托管服务。在开放权重一侧,Hugging Face 模型卡将 QwQ-32B 列为一款经强化学习训练的推理模型,支持 131,072 token 上下文;与 DeepSeek-R1 和 o1-mini 对比时,它取得了具有竞争力的成绩。[1][5] 在托管服务一侧,阿里云 Model Studio 说明 QwQ 基于 Qwen2.5 训练,数学、代码与通用评测成绩和完整版 DeepSeek-R1 相当。国际部署模式下,服务端点设在新加坡,数据也存储在当地。[2] 两页资料合在一起看,QwQ 同时是一款发布的模型和一套可供调用、部署的产品入口。
图片说明:题图采用 Wikimedia Commons 上阿里巴巴杭州滨江园区的真实照片。本文讨论的是 QwQ-32B 如何接入公司级基础设施并走向实际部署,这张园区照片比抽象的推理排行榜更切合主题。[6]
评测成绩附带一套推理契约
模型卡先写明了这套契约。[1]
QwQ-32B 的规模为 32.5B,完整上下文长度为 131,072 token;模型卡紧接着说明,调用方式会左右性能。[1] 提示词超过 8,192 token 时,使用者必须启用 YaRN。Qwen 团队还建议让模型以 \<think\>\n 开始输出,将 Temperature 设为 0.6、TopP 设为 0.95、TopK 设在 20 到 40 之间,并为数学题和多选题统一输出格式。[1] 这些说明决定了评测成绩应当如何解读。
因此,QwQ-32B 与 DeepSeek-R1 的对比分数衡量的是一整套配置:除了模型权重,还包括提示词模板与解码参数。[1][5] 评测者若更换模板、移除 thinking 前缀、调整采样参数,或在长上下文任务中省略 YaRN,所得结果更适合作为方向性参考,移植时需要重新校准。本文也因此把 QwQ 放在 Benchmark & Eval Notes 中讨论,重点考察评测条件。
阿里云的托管模型列表从另一侧印证了这一点。Model Studio 将 QwQ 列为托管推理选项,说明它基于 Qwen2.5、采用强化学习训练,并把“与 DeepSeek-R1 表现相当”的说法对应到 AIME 24/25、LiveCodeBench、IFEval 和 LiveBench 等具体评测。[2] 阿里自己的托管页面同样说明,榜单结论对应的是一套经过评测、有明确条件的配置。
“本地部署”的硬件清单更能说明问题
第二组条件来自硬件,QwQ 的意义也由此变得更具体。[3]
阿里云 ECS 部署指南称,QwQ-32B 支持在消费级显卡上本地运行,是一款门槛相对较低的推理模型。[3] 同一份指南的硬件表随即列出具体要求:模型体量 123 GB,建议配备 64 GB RAM 和 4 x 24 GB GPU 显存,参考实例规格为 ecs.gn7i-4x.16xlarge。[3] 推理服务使用 vLLM,示例版本为 v0.7.2;交互层使用 Open WebUI,GPU 驱动版本至少为 550。[3]
同它对标的巨型前沿模型相比,QwQ 的确轻了许多;阿里所谓的“本地部署”依然是一套多 GPU 方案,需要可观的显存,所需云实例也已属于正式的基础设施投入。它离业余玩家随手运行的模型仍有距离。[3]
榜单标题常常省略这些实际运行条件。QwQ-32B 相对 DeepSeek-R1 很紧凑,对普通团队仍然很重。它缩短了前沿推理与可部署稠密模型之间的距离,部署本身的难题依旧存在。[1][3][5]
性能表说明:32B 的成本仍然可观
阿里云 CAP 的性能比较进一步列出了实际运行条件。[4]
这份文档在 Ada 系列 GPU 上比较了 SGLang 与 vLLM,测试对象包括 Qwen-QWQ-32B-AWQ、Qwen-QWQ-32B 和一款更小的 Qwen2.5 指令模型。[4] 总体来看,多数测试中 SGLang 快于 vLLM;模型负载越高,双卡张量并行带来的收益越大。[4] 对 QwQ 而言,后面的具体数字更值得留意。
对于 Qwen-QWQ-32B-AWQ,文档将最大并发建议上限设为 5,单卡吞吐约 35 tokens/s,双卡吞吐约 50 tokens/s。[4] 完整版 Qwen-QWQ-32B 的建议上限同样为 5;单张 Ada 卡显存不足,无法运行该模型,文档只给出双卡约 20 tokens/s 的吞吐结果。[4]
这张表把部署条件换算成了可比较的指标。模型从宣传图走进实际推理服务后,评估时需要逐项确认:使用哪套提示词约定和运行时;完整版权重是否装得进显存,是否需要量化;可维持多少并发;最终吞吐还有多少。[1][3][4] QwQ 在评测中与 DeepSeek-R1 持平仍有意义,完整的成本判断还要加上这些数据。
为何它也是一条 AI-China 分发信号
QwQ-32B 为中国推理模型市场开出了一条新的中间路线。[1][2][3][4][5]
一端是体量庞大的前沿系统,性能强,部署也复杂;另一端是更小的指令模型,更容易部署,多步推理能力却较弱。QwQ 处在更有商业价值的中间位置:开放权重、稠密模型,在特定评测上足以宣称与高端推理模型表现相当。阿里云已经为它准备了托管服务、部署指南、GPU 实例与运行时,这些服务和工具也随之进入用户的技术与采购选择。[2][3][4]
所以,理解 QwQ 要从部署条件入手。对 AI-China 观察者而言,它既是一条榜单记录,也展示了推理模型竞争如何延伸到产品包装:托管 SKU 是否可用、部署方案是否完整、显存能否容纳模型、量化有哪些选择、运行时如何调优。QwQ 的分量来自这些公开而具体的运行条件。[2][3][4]
结论
理解 QwQ-32B,要先看部署边界,再看评测成绩。[1][2][3][4][5]
模型卡说明,提示词格式、采样参数和长上下文设置会直接影响表现。[1] Model Studio 将同一款模型纳入托管推理服务,并明确标出部署地区。[2] ECS 指南列出的“本地”条件包括 123 GB 模型体量和 4 x 24 GB 显存建议;CAP 报告则显示,完整版模型需要双 Ada 卡,吞吐仍约为 20 tokens/s。[3][4] 这些条件恰好解释了 QwQ 的重要性:它用更紧凑的稠密模型完成前沿式推理,让部署更现实,同时保留了明确的硬件与运行门槛。
来源
- Qwen Team,《Qwen/QwQ-32B》Hugging Face 模型卡(32.5B 参数、131,072 token 上下文、8,192 token 以上需启用 YaRN,以及 thoughtful output 与采样设置)。
- Alibaba Cloud,Model Studio《Model list》(QwQ reasoning model 描述、评测族,以及国际部署模式下新加坡端点与数据存储说明)。
- 阿里云 ECS,《在GPU实例上部署千问QwQ-32B推理模型》(123 GB 模型体量、64 GB RAM、4 x 24 GB 显存建议、ecs.gn7i-4x.16xlarge、vLLM 与 Open WebUI 部署路径)。
- 阿里云 CAP,《使用SGLang和vLLM部署Qwen系列模型的性能测试与评估》(Qwen-QWQ-32B-AWQ 与 Qwen-QWQ-32B 在 Ada GPU 上的单卡/双卡吞吐、并发建议,以及单卡显存限制)。
- Qwen Team,GitHub《QwQ》仓库页(官方发布背景,以及与 DeepSeek-R1、o1-mini 的对照信息)。
- Wikimedia Commons,《File:Alibaba Center in Binjiang Hangzhou2021.jpg》(本文题图来源页)。