ai china

YuBao:让中文语音 AI 在转写之前先匹配含义

5 条来源 2 条一手来源 已翻译 2026年9月21号

正在加载阅读与收藏统计…
正文
盘锦一次语言资源保护工作会议上,方言发音人与研究人员围坐在会议桌旁,桌上放着笔记本。

2019年6月,盘锦语言资源保护工作的参与者。档案照片来自辽宁师范大学,裁剪自该校发布的组图。照片记录了这类档案背后的语言资源保护工作,未展示 YuBao 的 AI 实验。[5]

语音助手能够给出工整的转写文本,却仍有听偏说话人本意的时候。当说话人使用某种汉语方言,其中的词语又难以与书面普通话一一对应时,这个问题尤其值得考察。

YuBao 用一道听力题切入这个问题:找出另一种方言中表达相同意思的录音。Kalvin Chang 与腾讯 AI 实验室的同事在2026年1月12日发布的预印本中,借助这项基准考察语音表征能否跨越方言差异,保留相通的含义。[1] 对中国语音 AI 领域而言,它提供了一种检验方法,让人看清助手开始组织答案之前,语音处理到了哪一步。

当一棵树有了另一个名字

语言学者项菊的一段田野调查经历,让这道难题变得具体。黄冈师范学院于2021年刊载了她对语言资源保护工作的回顾。在蕲春采集词汇时,一位发音人指认柳树,用的却是研究者熟悉的“杨树”一词。项菊先向家中一位年长亲属求证,随后又沿着河岸,指着实物询问路过的老人,得到的仍是同样的当地叫法。后来,她在武穴也遇到了这种用词习惯。[2]

项菊选择继续调查当地的用法。若转写系统忠实记下发音人说出的词,普通话读者仍有把它理解成另一种树的风险。这件事提示我们,文字记录是否准确、沟通是否传达了原意,值得分别考察。

项菊还记述了获取可靠录音所需的具体工作:招募发音人、寻找房间、布置设备,以及为避开附近幼儿园的噪声而调整录制时间。[2] 最后留下的一小段音频看起来简单,背后却经过了多次人工判断:由谁来说、该问什么、回答究竟指什么。

让模型去找另一段声音

YuBao 的公开代码仓库介绍,这项基准取材于中国语言资源保护工程的采集资料,使用了78个调查点的平行句,覆盖官话、粤语、闽语、客家话、湘语、吴语和赣语七大方言群。[3] 所谓平行句,是指不同地方的录音表达相应的信息,因此评估者事先知道哪些录音应当相互匹配。

这种方法已有可供借鉴的研究。Rao Ma 及其同事在发表于 NAACL 2025 的论文中,先用检索任务考察跨语言语音表征,再单独测试翻译能力。他们的 SeqSim 方法比较声学表征序列,在两个方向上寻找单个帧之间的强匹配。这样就能直接比较长度不同的录音,省去先把它们强行归为相同书面句子的步骤。[4]

设想同一个请求分别用两种方言录成音频。评估者拿其中一段作为查询,要求模型从另一地的录音中找出最相近的一段。检索成功,表示选中了一个已有答案;翻译生成则是另一项任务。 两者的差别,就像在发车信息牌上认出正确的目的地,与在陌生车站里为人临时指路。

YuBao 的实现方式是先对齐每一对调查点共有的句子 ID,再选择得分最高的目标录音,最后对各调查点配对的结果取平均。每次比较的候选范围约为50个句子,检索范围限于这组句子,与整个档案库的规模有别。[3] 理解任何一个百分比,都要把这个候选集的大小考虑在内。

小范围内值得期待的结果

在从闽语检索普通话的任务中,论文报告:仅用语音及其配对转写文本开展 ASR(自动语音识别)训练时,召回率为94.5%;加入语音翻译训练后,召回率为95.3%。这两项结果均来自作者的 Zipformer 模型,分别对应312,000步和320,000步训练后的检查点。两者的差距较小,具有一定参考价值,但训练时长也存在差异。[1]

评估使用的是老年男性朗读句子的录音。在仅进行 ASR 训练的设置下,模型从训练数据未覆盖的赣语录音中检索普通话,召回率达到77.1%。客家话列在基准声明的覆盖范围中,论文报告的检索表格却缺少对应的行和列。[1]

这组结果支持这样一种解读:模型在本次测试的句子集合内,找到了不同声音之间的对应关系。这种对应关系能在多大程度上帮助助手处理新请求,仍有待检验。从固定候选集中认出一条信息,任务就已完成;准确组织新的回答、持续对话,以及判断何时应该追问澄清,仍是另外的能力。

发音人范围的限制也值得关注。语言资源保护档案与消费产品各有其目标,所需的证据也各有侧重。前者可以着重保存记录详实的地方语言形式,后者则必须应对每一个拿起麦克风的人。

档案决定了测试的条件

辽宁师范大学对2019年6月15日盘锦方言发音人遴选工作的记述,展现了这类采集工作如何经过细致安排。研究人员询问候选人的出生地、居住地和家庭背景,按多个类别招募发音人,包括老年男性、青年男性、老年女性、青年女性,以及口头文化和地方普通话等组别。[5] 因此,语言资源保护工作的整体范围,与这次 AI 评估所用的较窄发音人样本,应当分别看待。

复现这项基准也需要一番准备。YuBao 仓库提供元数据和脚本,说明文档则要求研究者到档案平台获取原始视频,提取音频,再组装成基准数据集。[3] 一个可访问的代码仓库,与一套可立即用于评估的音频集,交付的内容有所不同。

下一轮值得开展的测试,应当有意增加难度:使用基准句库之外的新请求、含义容易混淆的表达、更多样的发音人,以及带有日常干扰的录音。随后将语音模型接入助手,衡量它给出的答案能否忠实回应请求。检索与对话的分数应分别记录,避免其中一项的进步被悄然当作另一项的提升。

YuBao 让这个中间环节的问题值得认真追问。在赞赏中文语音助手说得如何之前,先检验它能否在声音和地方用词都发生变化时,依然认出相同的意思。

资料来源

  1. Kalvin Chang、Yiwen Shao、Jiahong Li 与 Dong Yu,《Towards Comprehensive Semantic Speech Embeddings for Chinese Dialects》,arXiv v1,2026年1月12日;评估所用发音人群体及表 V–VI。
  2. 黄冈师范学院,项菊教授获表彰的报道,2021年4月22日,附有她对语言资源保护田野工作的亲历记述;中文来源。
  3. Kalvin Chang 及贡献者,YuBao 代码仓库;基准覆盖范围、检索实现及数据组装说明,访问日期为2026年9月21日。
  4. Rao Ma 等,《Cross-Lingual Transfer Learning for Speech Translation》,NAACL 2025;语音检索、SeqSim 及单独开展的翻译实验。
  5. 侯台风,辽宁师范大学,盘锦方言发音人遴选工作报道,2019年6月18日;中文亲历记述及档案照片。
Previous 荀子模型的小小编辑任务:加上标点,保留原文 Next VisuLogic 分数攀升,遗漏的视觉细节更显重要

Recommended In ai china

Matched by subject and format