ai china

Qwen 正在成为实验室设备,采用版图仍有边界

5 条来源 5 条一手来源 已翻译 2026年8月14号

正文
广角照片:WAIC 2025 上,阿里巴巴蓝白色展台的开放源代码 AI 横幅下陈列着多款模型。

阿里巴巴在 WAIC 2025 上将 Qwen 展示为多种应用底层的开放模型基础。[5] 一项新的语料库研究则在科研论文的方法部分捕捉到较为隐微的采用信号。[1] 图片:阿里云。

一种模型成为科研基础设施,往往早于为它举行剪彩仪式。线索藏在论文的方法部分:哪个系统为记录分类、生成合成案例、抽取实体,又有哪个系统被设为所有新结果都要超越的比较基线。

2026 年 8 月 11 日提交的一篇预印本,从格外宽广的范围考察了这种安静的采用过程。Zackary Okun Dunivin 检索了截至 2026 年 6 月的逾 2100 万份全文科研记录,再用一套分类流程,将真正使用模型的论文与顺带提及模型的论文分开。在最终筛出的 157,446 篇使用 LLM 的论文中,GPT 仍是规模最大的家族,Qwen 的存在感也已经很难忽略。[1]

在 2026 年仅使用一个检测到的模型家族的论文中,Qwen 占 22.0%,是 Llama(8.6%)的 2.5 倍以上,也远高于 DeepSeek 的 3.0%。在使用多个模型家族的论文中,Qwen 出现在 62.1% 的论文里,紧随占 64.6% 的 GPT。研究更鲜明的发现落在地理差异上:调整研究子领域和发表时间之后,隶属中国机构的单家族论文选择中国开发开放权重模型的倾向,远高于未观察到中国关联的论文。[1]

这些结果无法证明中国模型是最好的科研工具,也无法证明开放权重会带来更好的科学,或某一国家的模型生态已经主导全球科研。它们呈现的信号,比发布时的跑分或下载计数更具体:Qwen 正从 AI 研究的对象转为研究内部使用的工具,这一转变在地理版图上的分布并不均匀。

这项指标来自方法部分,与人气调查所问的问题不同

研究从 Semantic Scholar Open Research Corpus 中 21,338,177 篇去重论文起步。模型名称词典先找出候选出现位置,分类器随后处理两个不同的问题:这个 token 确实是模型名称,还是恰好与普通词重合?作者是否真的训练、微调、评估或以其他方式使用了模型,还是只在讨论中提到了它?[1]

这一区分直接影响“采用”的含义。一篇 AI 政策论文可以提到十种模型,却没有把其中任何一种当作研究工具;一项基准研究可以运行二十种模型,因为比较本身就是研究主题;一篇医学论文则可以用一个模型编码临床笔记。把三者都计作同一种“采用”,会把参考文献统计误写成市场份额。

经过筛选,语料库收录了 2023 年 1 月至 2026 年 6 月间 2,276,136 次符合条件的模型使用记录。作者随后把论文分成两组。“单家族”论文只使用一个检测到的模型家族,可粗略代表应用研究中的模型选择;“多家族”论文使用两个或更多家族,更常见于基准测试或基础模型研究。论文也承认,这种切分的粒度很粗。Qwen 这样的家族标签之下,可以包含不同参数规模、版本、许可证、上下文窗口和部署条件。不过,这项切分至少能避免把基准测试中的第二十个基线模型,误认成研究者实际选来完成工作的工具。[1]

在范围更窄的单家族指标上,开放权重模型的使用占比于 2026 年上半年达到 44.0%。在这些开放权重选择中,Qwen 单独占据近一半;中国开发的模型家族合计占 60.5%。在多家族研究里,Qwen 与 GPT 接近持平所表达的含义有所不同:它已经进入研究者日益认为应当纳入的比较集合。[1]

一组信号由此指向科研工具的选择,另一组指向基线地位。Qwen 在两方面都在上升。

“开放”的优势来自一整套实用组合,抽象原则不足以解释全部变化

汇总数字很容易引出一个简洁故事:科学家需要开放性,于是转向了开放模型。逐个模型看,实际轨迹偏离了这项解释。倘若开放性单独驱动了转变,条件相近的开放权重模型家族理应同步上升。实际情况是 Qwen 快速攀升,Llama 在单家族论文中的份额从 2025 年峰值回落,Mistral 仍然很小。采用增长集中在少数中国开发的模型家族。[1]

研究者面对的选择,因而落在标签背后的实用组合上。Qwen 的官方发布覆盖多种规模的稠密模型与混合专家模型,公开可下载权重,也支持研究者熟悉的 Transformers 和常用推理服务工具。[2] DeepSeek 的 V3 官方仓库同样把权重连接到多种本地与集群运行环境,并记录了 Nvidia、AMD 和华为硬件上的部署路线。[3] 这些页面无法解释任何一位科学家选择模型的具体原因。页面列出的实际条件包括可检查的模型文件、本地运行、微调、固定版本,以及摆脱每次调用都依赖某个专有端点的能力。

Stanford HAI 与 DigiChina 在 2025 年 12 月发布的生态研究补上了产业背景。在报告笔下,中国开放权重模型的发展横跨多家路线各异的实验室,其时间与范围远超单次 DeepSeek 事件;这些实验室强调计算效率与灵活的下游部署,背后有不同商业策略和公共政策的支持。[4] 将这份报告与新的语料库结果并读,可以提出一项推断:只有当开放权重与足够的能力、语言覆盖、工具和分发渠道一同进入真实工作流程,模型的可得性才会转化为持久影响。论文测量的是整套组合产生的结果,没有拆分每项要素各自的贡献。

“开放权重”的外延也应止于权重,不能直接等同于“开放科学”。可下载的参数未必附带训练数据、完整的数据清理历史、全部训练代码,或复现模型所需的每一项决策。2026 年的研究对此保持了清楚的限定。它发现研究者正转向若干特定模型生态,这些生态里的模型公开了可下载权重;这项结果还不足以证明科学模型开发已经达到端到端透明。[1][4]

边界清晰可见,却没有筑成高墙

研究的地理分析聚焦 48,129 篇单家族论文,这些论文具有可用的模型访问类型、作者、机构隶属、日期和研究领域数据。控制子领域之后,与未观察到中国关联的论文相比,隶属中国机构的论文选择开放权重模型家族的 odds(优势)是其 2.23 倍。odds 与概率分属不同统计量,这项关联也无法识别因果关系。[1]

多类别统计模型揭示了更具体的差异。在 2026 年 6 月这一数据终点,拥有中国机构隶属关系的论文选择中国开发开放权重家族的调整后概率为 37.1%,未观察到中国关联的论文则为 9.2%,相差 27.9 个百分点。两组选择其他开放权重家族的概率接近得多。地理关联主要集中在中国模型上,并未体现为中国研究者对所有可下载权重模型的普遍偏好。[1]

这条边界没有把市场封闭起来。在未观察到中国关联的论文组中,调整后概率仍达 9.2%,已经具有实际分量;Qwen 出现在接近三分之二的多家族论文中,也清楚表明这并非仅限国内的现象。不过,这道差距显示模型生态仍会沿着机构网络传播。语言适配、本地可用性、采购规则、云服务访问、开发者熟悉度、价格和同行惯例,都可以影响选择。研究控制了子领域,却没有分别估计这些作用因素。[1]

其战略含义比“中国出口 AI”这句口号更细致。一个模型家族可以先在本土成为科研默认选项,文档、平台、协作者和机构信心会在这里彼此加强。此后,每一篇使用该模型完成的论文,都会增加示例、引用和评估惯例,也培养熟悉它的研究人员,帮助整套体系向更远处传播。这是一项与现有证据相容的路径依赖假说,研究尚未把它证成因果结果。

越新的数据行,完整度越低

论文中最有力的数字,也需要同样醒目的适用范围说明。

第一,“2026 年”指 1 月至 6 月,并非完整日历年。快速的发表与索引节奏会改变模型家族的构成。第二,家族级检测无法辨认两篇论文使用的是同一个检查点,还是同一模型谱系中差异极大的成员。第三,单家族与多家族的切分只是研究目的的代理指标,没有逐项人工编码每个实验。[1]

第四,这套流程用模型测量模型的使用情况。作者先标注小规模金标验证样本,DeepSeek-V4-Flash 再生成规模更大的银标签数据集,随后由 SciBERT 分类器处理整个语料库。报告的验证分数很高,但每项任务的金标集合只有 150 个文本片段。这样的规模说明分析经过了认真验证,提取误差仍会存在。[1]

机构隶属信息是最大的警示点。研究把 S2ORC 记录连接到 OpenAlex,但近期机构元数据并不完整。经过作者资料恢复,2026 年 Qwen 单家族论文中,只有 39.5% 能精确匹配到论文当年的国家归属。采用最近一次已知机构的敏感性检验中,主要优势比几乎没有变化,增强了结果的稳定性;对缺失最严重的最新队列,覆盖率却几乎没有增加。论文明确指出缺失并非随机,并谨慎处理组别构成随时间变化的问题。[1]

最后,这是一篇第一版预印本,尚未经过同行评议,不能视为共识结果。论文称复现所需的代码和数据可从关联仓库取得,但该链接指向的仓库在 2026 年 8 月 14 日检查时返回 404。在材料恢复之前,读者可以查阅论文详尽的 HTML 方法和补充材料,还无法从该链接重新运行文中所称的复现包。[1]

什么证据能让“实验室设备”从比喻变成事实

下一批证据需要深入到模型家族名称之下。更扎实的采用版图应记录确切检查点、任务角色、语言、硬件、本地或 API 运行方式,以及模型究竟生成了证据,还是只对证据做了转换。研究还应检验替换所选模型后结果能否复现,并考察本地权重在实践中是否真正改善隐私或可审计性。

地理结论还需要一个完整年度、更高的机构隶属覆盖率、可用的复现包,以及其他研究者对这套方法的独立复用。如果 Qwen 在中国关联机构之外的单家族份额仍保持高位,同时确切版本的报告质量有所改善,证据将更有力地支持这套科研工具链确已走出中国。如果采用仍集中在本土平台附近,或分散于彼此不兼容的版本,区域模型生态锁定将更有解释力。

截至 8 月 14 日,这项信号已经需要严肃对待。Qwen 的踪迹早已越过会议展台、排行榜和模型托管平台,进入了科研默认选项逐渐固化的位置:把原始材料转化为研究结果的流程内部。论文没有证明研究者选择它的原因,也没有证明这项选择改善了科学质量。它显示,这项选择如今已足够普遍,地理规律也足够清晰,可以成为测量对象。

来源

  1. Zackary Okun Dunivin,《谁在使用开放权重模型?中国与科学研究中 AI 地理版图的变迁》(2026 年 8 月 11 日提交)——语料库编制、模型使用分类、采用率估计、地理模型与局限。
  2. Qwen 团队,“Qwen3”——阿里云官方模型家族仓库、发布历史、模型变体与本地使用说明。
  3. DeepSeek-AI,“DeepSeek-V3”——官方模型仓库、权重、许可证,以及有文档记录的本地与集群部署路线。
  4. Caroline Meinhardt、Sabina Nong、Graham Webster、Tatsunori Hashimoto 与 Christopher Manning,《超越 DeepSeek:中国多元开放权重 AI 生态及其政策影响》。Stanford HAI 与 DigiChina,2025 年 12 月 16 日。
  5. 阿里云,“阿里巴巴在 WAIC 2025 发布智能座舱、企业合作与 AI 眼镜”(2025 年 7 月 28 日)——官方活动记录及封面照片来源。
Previous 吴文俊的多项式证明引擎有了机器核验的基础

Recommended In ai china

Matched by subject and format