ai china

悟道的万亿参数纪录,遮住了背后的一整套模型系统

7 条来源 2 条一手来源 已翻译 2026年9月10号

正文
在悟道 1.0 发布会上,唐杰站在讲台前发言,身后大屏幕梳理着人工智能发展的三个时代。

唐杰在 2021 年 3 月的悟道 1.0 发布会上演讲,三个月后,悟道 2.0 亮相。这张清华大学照片记录了该计划公开面世的起点;画面中的屏幕属于当时拍摄的舞台,并非为本文制作的分析图。[7]

视频模式

本文包含 1 个可跳转的视频片段。

  1. 1 唐杰在 ECML PKDD 2021 主题演讲中介绍悟道模型计划 YouTube 视频

悟道 2.0(Wu Dao 2.0)问世五年后,人们最容易记住的事实,依旧最难解释它的全貌:1.75 万亿参数。2021 年 6 月,北京智源人工智能研究院发布这一数字,称其刷新世界纪录,参数量达到 GPT-3 的十倍。同一份公告还描绘了一套范围更广的中英双语多模态“模型系统”,背后包括训练框架、中文语料库、应用,以及由 22 家合作机构组成的联盟。[2]

唐杰在 ECML PKDD 2021 上的主题演讲颇有价值,因为它把这件事的两副面貌都保留下来。演讲里有属于那个时期的盛大展示:机器写出的中文诗歌、文生图样例、虚拟学生,以及醒目的巨额参数。与此同时,底层的工程计划也逐层显现;到结尾,他格外直白地谈到推理缓慢、答案流畅却有事实错误,以及模型权重中的知识会随时间陈旧。[1]

这段 54 分钟的英语录像由会议官方频道发布。部分演示和幻灯片使用中文,论述则使用英语。观看时可以留意演讲尺度改变的时刻:开场演示让人看见一套系统表面上能做什么;中段解释完成这些任务所需的不同模型、数据和训练方法;末尾问答则揭开所有组件仍未解决的问题。下文所列时间点用作观看路标,不对应逐字稿。[1]

7:49–16:33 — 一组演示让一套系统看上去像一个模型

唐杰先展示输出,再谈基础设施。悟道会回答问题,按指定人物口吻写文章,创作中文诗歌,为图片配文,也能把文字提示变成图像。约在 10:25,一只小北极熊、一辆公交车和一只踢足球的老虎依次展示文生图;约在 13:58,话题从轻松的例子转向面向电商的个性化产品设计。到 14:58 左右,一项公开测试邀请访客分辨哪些诗歌和图片说明出自人类,哪些由模型生成。[1]

这套舞台呈现很有效,却也容易引出类别误判。观众很容易想象一个庞大的神经网络,从诗歌一路无缝转向图像。研究记录展示的实际形态,是一组协同工作的模型。以 CogView 为例,它是一款拥有 40 亿参数、接受文生图训练的 Transformer,有自己的网络设计和数据流程,也曾在评测中与其他图像生成系统对照。[6] 清华大学 2021 年的研究专题同样从多个分支介绍悟道,包括语言生成、多模态研究、通用语言建模和蛋白质预测,并未把它写成一个汇集所有能力的聊天模型。[7]

厘清这一区别无损于整个计划,反倒让它的成果更易辨认。“悟道”是一把覆盖模型组合及其周边基础设施的伞。主题演讲中丰富的例子,证明了研究协同覆盖的范围;它们无法证明每个样例都来自同一个模型检查点,也无法证明推理条件完全相同。

16:33–19:41 — 纪录数字也是一项基础设施主张

到了 16:33,唐杰终于把 1.75 万亿放上屏幕。他把这一成果与中英双语文本和图像数据、神威超级计算机、为这台机器编写的软件、分布式通信及 FastMoE 联系起来。官方发布通告给出的数据总量是 4.9 TB,其中包括 1.2 TB 中文文本、2.5 TB 中文图文数据,以及取自 The Pile 的 1.2 TB 英文文本。[2]

相关的 WuDaoCorpora 论文把数据层写得更具体。论文记录了一套由 8.22 亿个网页汇集而成的 3 TB 中文语料库,同时将这套完整语料与约 200 GB、面向研究开放的基础版加以区分。论文公布的基线实验,是在基础子集上训练一个 30 亿参数的 Transformer-XL;它比悟道 2.0 的整体主张窄得多。[3] “数据已经存在”“数据已经发布”“某个具名模型在这份数据上接受过评测”,是三项彼此独立的陈述。

FastMoE 划出了另一道界线。混合专家系统把专家分散在多台设备上,再将计算任务路由给它们,由此扩展总容量;对于每项输入,系统不会把所有存储参数当作一个稠密整体同时调用。FastMoE 论文主要处理算法与系统问题:怎样在普通 GPU 节点间安置专家、高效通信,同时保持基于 PyTorch 的训练系统易于使用。[4] 因此,万亿参数这个数字展示的是稀疏容量与分布式执行。单凭它,无法推导出每个 token 的计算量达到 GPT-3 的十倍,也无法推导出能力提高十倍。演讲和发布通告均未给出足以完成这种换算的统一评测范围。[1][2][4]

更经得起时间的解读落在物质基础上。语料库建设、稀疏路由、加速器拓扑、通信软件和模型目标共同发展,才托起悟道的头条数字。这个数字是整套技术栈露在外面的一道边缘。

19:41–35:09 — “通用”在于统一目标,组件差异依然存在

约在 19:41,演讲从规模转向 GLM,即通用语言模型(General Language Model)框架。唐杰将三类模型并置比较:自回归模型适合开放式续写,自编码模型适合理解任务,编码器—解码器模型用于条件生成。GLM 给出的方案是自回归空白填充:先遮住若干文本片段,再生成其中内容,并让同一方法适配理解、条件生成或无条件生成。[1]

后来经过同行评议的 GLM 论文进一步说明了方法细节和评测范围。它采用二维位置编码,让空白片段的长度和顺序都可以变化,再以规模与数据相当的模型为对照,覆盖上述三类任务。评测所支持的主张有明确范围:同一套预训练方法能够在通常偏向不同架构的各类任务上取得有竞争力的表现,并未宣称拥有 1.75 万亿参数的悟道模型检查点赢下每项任务。[5]

这种通用性比演示串片传达的印象细致得多。同一目标可以复用,实际部署的模型、模态、规模和下游微调仍各有区别。演讲本身也清楚展现了这种分层设计:从 GLM 谈到参数高效适配,随后又介绍一套独立的生成方法,用来给每个新句子与原始提示之间的连贯程度打分;图像样例则依托 CogView,单靠 GLM 无法生成。[1][5][6]

今天重看,这一段可以校正模型家族的宣传话语。共同的研究主干能够减少重复劳动,各个模型检查点依旧无法互换。架构、数据、模态、服务成本与评测设置,共同界定某种能力是否真正存在。

41:22–44:27 — 坦率谈到的局限,比参数纪录更经得起时间

最具前瞻性的部分出现在问答环节。有人问系统有哪些做不到的事,唐杰列出两项局限。第一,最大模型的成本很高,一次回答要等上几分钟,因此需要体量更小的蒸馏模型和效率更高的推理。第二,生成文字读来流畅,事实却会出错。接着有人追问如何更新写入权重的知识;唐杰提到终身学习研究,同时说明实际流程仍要定期取回数据,重建或组合模型。[1]

这些回答重新勾勒了整场演讲。演示环节观察输出是否像人类写出或画出的作品;问答环节追问输出能否以低成本抵达、内容是否真实、其中的知识能否改变。这些问题处在规模讨论的核心,远超扩展之后的收尾细节。基础模型能否成为可靠的基础设施,取决于它们。

发布通告曾设想,大模型像一座发电站,为应用网络输送智能。[2] 这个比喻略去了那只难以校准的电表。电力到了插座即可互换;模型输出则取决于版本、提示、语料库、路由和评测。除了接入能力,一项可用的智能服务还需要可追溯的来源和明确的质量范围。悟道自己的演讲已经交代缘由:最大模型的服务成本高,流畅生成无法保证事实准确,知识更新也尚未完成。[1]

录像留下了什么

参数纪录未给竞赛定下胜负;悟道 2.0 仍理应在中国 AI 史上占有一席之地。这场主题演讲记录下一个中国研究联盟如何同时拼合基础模型时代的多块版图:规模更大的中文语料库、稀疏分布式训练、通用语言目标、多模态生成、适配方法,以及规划中的开发者生态。[2][3][4][5][6]

它也保存了研究计划与产品之间的距离。统一的公开名称把许多模型和工具连成一个整体,技术讨论则让各自的界线清晰可见。今天重看,问题应从“悟道有多大?”移向“每项结果出自哪一层,在什么条件下产生,还有哪些问题没有解决?”纪录数字已经老去,这套阅读方法依然鲜活。

来源

  1. ECML PKDD,“ECMLPKDD2021: WuDao: Pretrain the World”,唐杰主题演讲官方视频,2021 年。
  2. 北京市科学技术委员会 / 北京智源人工智能研究院,“全球最大智能模型‘悟道 2.0’在京发布”,2021 年 6 月 2 日。
  3. Sha Yuan 等,“WuDaoCorpora: A Super Large-scale Chinese Corpora for Pre-training Language Models”,AI Open 2,2021 年。
  4. Jiaao He 等,“FastMoE: A Fast Mixture-of-Expert Training System”,arXiv:2103.13262,2021 年 3 月。
  5. Zhengxiao Du 等,“GLM: General Language Model Pretraining with Autoregressive Blank Infilling”,Proceedings of ACL,2022 年。
  6. Ming Ding 等,“CogView: Mastering Text-to-Image Generation via Transformers”,arXiv:2105.13290,2021 年 5 月。
  7. 清华大学,“A big new player in large-scale natural-language AI”,Research Feature 2021,第 13–14 页;唐杰发布会照片来源。
Previous 中国为 AI-ISP 编了号,公开记录却停在测试之前 Next 页面横转 90 度,CFMME 最强问答模型的应用题得分下降 13.67 分

Recommended In ai china

Matched by subject and format