ai china

VoxCPM2 让合成声音有了多种起点

7 条来源 4 条一手来源 已翻译 2026年9月22号

正在加载阅读与收藏统计…
正文
清华大学深圳国际研究生院信息楼,前景为喷泉、池塘和树木。

清华大学深圳国际研究生院信息楼,摄于 2019 年 6 月 20 日。该院人机语音交互实验室与 ModelBest 联合开发了初代 VoxCPM。摄影:Karenlee9612 / Wikimedia Commons,CC BY-SA 4.0;已调整尺寸。[1][7]

设想为一份语音导览安排旁白:入口处要亲切,纪念碑旁要克制,指引路线时又要明快。声音始终让人认得出来,表达方式却随内容变化,这与模仿某一段录音是两种要求。VoxCPM2 为它们设置了不同的输入方式。

这个项目源于 ModelBest 与清华大学深圳国际研究生院人机语音交互实验室的合作。清华大学 2025 年 9 月的报道记述了初代 VoxCPM 的发布。[1] 代码仓库将 VoxCPM2 的发布时间记为 2026 年 4 月,技术报告随后于 2026 年 6 月 5 日发表。[2][4] 本文梳理这一版本,以及截至 2026 年 9 月 22 日可查阅的文档。

主要规格颇具分量:20 亿参数、30 种语言、9 种汉语方言,以及 48 kHz 输出。[2] 更值得细看的变化在于,用户如何告诉模型要生成谁的声音,以及这个声音该怎样说话。

走进录音间的三种方式

模型卡区分了三种实际用法。声音设计用文字描述设想中的声音,省去参考录音。风格可调的声音克隆以参考片段确定声音,用户还可添加指令,指定表达风格。接续式声音克隆则以录音及其对应转写文本为基础,让模型沿着已有语音继续生成。[3]

放回前面的语音导览设想,这三种模式分别对应制作中的不同问题。挑选旁白声音时,可以用文字描述尝试不同人选的声音;拿到经授权使用的参考录音后,可以借助风格可调的声音克隆,试听更平静或更快的表达。如果现有片段里的演绎本身就是目标,接续模式则给出了另一种选择。这些是根据各项控制功能提出的用法设想,本文未提供听测结果。

输入参数把这些区别呈现得相当清楚。reference_wav_path 用来传入录音,参考录音的转写文本可以省去。较早的接续方式则将 prompt_wav_pathprompt_text 配合使用。对声音和风格的描述写在括号中,放在待朗读文字之前。[6]

参考式声音克隆由此省下了一项准备工作:准确转写参考录音。与此同时,录音的用途也划分得更细。模型是要把它作为说话者身份的参照,还是当作一段表演的开头,沿着原有表达继续说下去?同一段短录音可以承担这两种用途,使用者需要明确它与新生成语音之间的关系。

模型内部有哪些变化

技术报告将新的参考通道解释为输入开头一个带标记的片段。后续生成可以借助注意力访问这段参考音频,它与新生成的语音之间也可以隔着其他内容。作者用这种安排,将由参考音频确定的说话者条件与表达方式指令分开处理。接续模式仍然保留,两条通道也可以组合使用。[4]

这项改动延伸了初代模型的架构。2025 年 9 月的论文描述了一种分层设计:一个组件对语义和韵律结构建模,另一个残差组件处理更细的声学信息。局部扩散解码器生成连续的语音表示,整个系统联合训练,省去了对外部离散语音 tokenizer 的依赖。[5]

“Tokenizer-free”需要按这个范围理解。系统仍然使用文本 token,也保留了量化步骤:原始论文明确写到一个内部量化瓶颈。这里的说法范围更窄,专指省去了外部离散音频 tokenizer。[5] 对关注中国语音模型发布的读者而言,这一区分有助于看清模型设计中的具体取舍与宣传口号之间的差别。

VoxCPM2 也调整了音频编解码器:参考音频以 16 kHz 编码,输出以 48 kHz 解码。语言模型部分则延续了 VoxCPM1.5 引入的处理速率,每秒音频对应 6.25 个生成步。[4] 这些速率描述的是系统的不同部分。输出波形的采样点更密,并不要求语言模型逐个预测波形采样点。

从这一架构看,实际吸引力在于:更丰富的声音和更灵活的条件输入,可以共用一段相对紧凑的序列。这属于对架构的解读,不能据此保证某台笔记本电脑上的响应速度。

使用者仍需处理哪些问题

模型卡以 Apache 2.0 许可开放权重,并记录了流式生成功能。[3] 这两项内容都有实际用途:开发者可以检查、修改模型,应用可以分块接收音频。至于整套对话应用用起来是否响应灵敏,仅凭这两项还无法确定。

使用指南给出了明确限制。模型支持流式音频,但尚不支持一边逐个输入文本 token,一边生成音频。指南建议交互应用按句处理文本,也记载了长文本生成中的问题,包括语速加快、出现嗡鸣,以及生成无法停止。[6]

对于语音导览制作方,这要求试听覆盖完整段落,同时留意开头几句的表现。一项值得尝试的检查是固定参考录音和文稿,只修改风格指令,再请听众判断说话者听起来是否仍是同一个人。另一项检查是将若干段落拼接起来,听接缝处的节奏或说话者身份感有何变化。这些是建议开展的检查,本文未报告相关实验结果。

这次发布增加了一项重要选择

VoxCPM2 将这一系列从早期的中英双语版本扩展为多语言模型,并明确支持声音设计和风格可调的声音克隆。[2] 它的价值取决于这些控制功能能否在日常文稿、不同口音和剪辑要求下持续可靠地发挥作用。

这次发布也把制作中一组实用的分工呈现出来:参考录音用来确定声音,文字指令用来引导表达,成对的录音和转写文本则为接续生成设定起点。回到设想中的博物馆旁白,目标是在不同情境下都保有让人辨认得出的声音个性。VoxCPM2 让开发者更清楚地提出这些要求,也让评估者在试听时更清楚地辨别各项差异。

来源

  1. 清华大学,《VoxCPM 语音生成模型开源》,2025 年 9 月 25 日,转载《科技日报》报道——ModelBest 与清华大学深圳国际研究生院实验室的合作。
  2. OpenBMB,VoxCPM 中文 README,提交 f772e49——2026 年 4 月的发布记录、支持的语言与方言,以及同早期版本的比较。
  3. OpenBMB,VoxCPM2 官方模型卡——生成模式、模型获取方式、流式 API 与许可;访问日期:2026 年 9 月 22 日。
  4. Yixuan Zhou 等,《VoxCPM2 Technical Report》,2026 年 6 月 5 日,第 1 版——参考通道、序列组织、编解码器与模型配置,重点参见第 3.1–3.4 节。
  5. VoxCPM 团队,《VoxCPM: Tokenizer-Free TTS for Context-Aware Speech Generation and True-to-Life Voice Cloning》,2025 年 9 月 29 日,第 1 版——初代模型的分层设计、内部量化与连续语音生成。
  6. OpenBMB,VoxCPM 2.0 使用指南——参考与接续输入、风格指令、长文本限制,以及流式支持的范围;访问日期:2026 年 9 月 22 日。
  7. Karenlee9612,《Information Building at Tsinghua SIGS》,2019 年 6 月 20 日——校园照片原图与 CC BY-SA 4.0 授权信息,Wikimedia Commons。
Previous LongBench v2 追问:模型究竟读到了什么

Recommended In ai china

Matched by subject and format