ai china

腾讯优图的翻译器必须读懂一门语言,单看姿势远远不够

7 条来源 4 条一手来源 已翻译 2026年7月30号

正文
在腾讯优图实验室 2019 年的手语翻译演示中,一名身穿白衬衫的男子面对摄像头打手语。

CGTN 2019 年报道中的真实画面:优图原型在受控演示界面中读取一名手语者的表达。这个环境值得留意,因为视频随后承认,白墙要求限制了系统在展台以外的使用。[1][5][6]

视频模式

本文包含 1 个可跳转的视频片段。

  1. 1 CGTN 关于腾讯优图实验室实时中国手语转文字原型的报道 YouTube 视频

这则 56 秒报道开场宣称,腾讯优图实验室的 AI 手语平台已经“准备好服务”聋人及重听人士。最能揭示问题的一句话出现在约半程处,旁白开始解释演示所受的限制:手语者需要站在白墙前。影片先摆出承诺,随后交代测试条件。把两句话放在一起看,一段轻快的技术展示便成了一堂实用的课:面向公共服务的翻译系统,究竟要拿出怎样的证据。[1]

这段视频拍摄于 2019 年 5 月。当时,优图与深圳市信息无障碍研究会展示了一套原型:普通摄像头采集手语动作,后端计算机将其转成中文文字。发布方设想的使用地点包括政务服务柜台、机场和火车站。CGTN 的配套文字报道比视频开场克制得多,文中写明,系统尚未上市,仍待改进,下一步将进入初步试用。[2][5] 这一区别需要保留下来:画面记录的是早期能力演示,不能作为服务已经投入现场使用的证据。

今天再看这段视频仍有价值,因为底层问题从来没有缩减成手形分类。连续手语包含动作、时序、空间关系、面部表情、地域差异和句子上下文。真正有用的问题随之改变:“屏幕上出现文字了吗?”之后还要继续追问:“这些文字得以出现,依赖哪些受控条件;一旦失去这些条件,又会发生什么?”

0:00 — 测试条件尚未出现,“准备就绪”已经到场

开头的镜头把一名手语者置于产品界面内。一个矩形框跟踪他的上半身,中文文字在画面一侧逐渐累积。这组画面传达出颇具吸引力的系统构想:舍弃手套或专用传感器,改用服务柜台原本就能配备的摄像头。[1][2] 硬件门槛降低,意义十分具体,也容易让余下的难题显得比实际更小。

约 0:14,画面转入展会展台。第二名手语者面对摄像头,屏幕实时生成文字。背景素净,身体居中且没有遮挡,机位保持固定,也没有人从手语者与镜头之间穿过。视频没有给出准确率、延迟分布、未见手语者测试,也没有与人工手语翻译员进行比较。这段演示依然成立,它所能证明的范围也由这些条件清楚划定:在画面可见的环境里,原型能够把一段预先准备的连续手语映射成看起来合理的文字。

CGTN 的配套特写为活动影像补上了状态标签:技术尚处早期阶段,未进入商业市场,计划在公共场所试用。[5] 沿着这条信息观看,既能防止把原型误认成已经部署的解决方案,也能防止因为它仍是原型便抹去其价值。受控展台的意义正在于,研究的能力边界由此显露出来。

0:14 — 摄像头读取的是序列,单个姿势远远不够

发布前后的中文技术报道解释了那个看似简单的矩形框背后发生的工作。优图以二维卷积处理相对静态的手部与身体信息,再以三维卷积捕捉连续帧之间细小而快速的变化。随后,LSTM 先在词语层面纳入邻近信息,再结合句子上下文。其目标是识别完整句子,让手语者保持自然连贯的表达,不用人为停顿,也不用做特殊的开始和结束手势。[2]

这段序列才是技术问题的核心。两个静态姿势可以看起来相近,方向、持续时间、过渡动作或上下文一变,意思便会随之改变。在线系统还得在后半句尚未发生时开始工作。后来一篇由腾讯相关团队发表的 ECCV 论文研究了相近问题,研究对象与这款具体产品有别。论文用相似的方式描述连续手语识别:空间与时间信息需要一同学习,手语速度因人而异,在线识别器面对的是局部观察,无法等到完整录制的句子全部出现后再工作。[3] 原型与后续论文的区别需要讲清,两者面对的共同难题也同样值得看见。

因此,展台里出现的文字,是一连串判断的终点:一个单元在哪里结束,哪段动作归入其中,相邻单元如何改变读法,又要在证据积累到什么程度时输出一个词。若把这项任务称作“手势识别”,整条判断链便会隐去;称作“语言识别”,时间与语法问题才会留在视野里。

0:29 — 白墙是全片最重要的画面

约 0:29,视频明确说出白色背景这一要求。这是整段影像最有分量的时刻,因为它给出了可以验证和推翻的条件。火车站里没有这样一面白墙,那里有不断变化的光线、带图案的衣物、行李、局部遮挡、参差的拍摄角度和穿过画面的人群;手语者的身高、速度、动作幅度与语言经验也各不相同。同一台摄像头从展台移到站厅,用户界面还没变化,输入数据已经变了。

后来的研究进一步表明,背景控制绝非装饰层面的麻烦。一篇 2024 年预印本介绍了面向复杂环境的中国连续手语数据集。论文指出,许多公共数据集采自实验室或电视画面,背景相对单一,与日常环境相去甚远。研究提出的数据集包含 5,988 段连续视频,覆盖 70 多种复杂背景。[7] 这项研究没有评估优图 2019 年的系统,却准确点出了视频已经暴露的环境迁移问题。

可信的公共场所试用应按环境分别报告结果,不能只给一个汇总分数。测试需要区分熟悉与未见的手语者、日光与昏暗照明、素净与杂乱背景、正面拍摄与存在偏差的机位,以及连贯手语与自然打断。延迟和失败率也应公开,其中包括系统选择不输出、以免给出自信却错误文字的频率。这些都是根据展台与公共服务柜台之间的落差推导出的评估要求,并非对优图曾经开展或没有开展哪些测试作出断言。

0:43 — 词汇数量划不出一门语言的边界

报道在最后几秒转向规模:旁白提到,一个中国手语数据库收录了 900 个短语,系统能识别近 1,000 个常用表达。[1] 同期中文报道的说法略有不同,写的是近 1,000 个日常句子和 900 个常用词。[2] 两组数字没有必要勉强合成一个整齐的统计值,更合适的读法,是把它们视为发布时期对有限语料库的不同描述。无论哪组数字,都没有说明覆盖了哪些领域、不同手语者的样本分布是否均匀,以及系统离开排练过的服务对话后表现如何变化。

在中国,覆盖范围尤其难用一个数字概括。2026 年一项 CHI 研究访谈了 13 名中国聋人网络内容创作者。研究将中国手语描述为一组地域变体,没有把它写成一门已在全国广泛采用的标准化语言;论文同时强调,手语拥有自己的词汇、语法和句法,意义由面部表情、身体动作、手势位置等视觉空间特征共同传递。[4] 一千个被编入目录的单元,单凭数量无法证明系统理解了这些关系。

识别一段序列,与选择忠实的中文表达,也处于不同层次。同一项 CHI 研究记录了聋人创作者如何混合使用手语、字幕、口语、图片、例子和叙事,以跨越语言与文化。参与者的实践展示了一种创造意义的翻译过程,远超机械替换词语。[4] 优图界面里的文字框遮住了这一解释层。一句中文出现在屏幕上以后,观看者看不到还存在怎样的译法,哪一种地域表达经过了规范化处理,也无法知道熟练的聋人读者是否会认为译文自然。

缺席的参与者,正是接收翻译的人

2019 年的发布包含一步值得期待的机构合作:优图与深圳市信息无障碍研究会组成联合项目组,计划通过接触聋人和手语使用者扩充数据、改进算法。[2] 相比脱离手语社群自行设计词表,这一步更加扎实。不过,公开材料没有提供现场试用结果、参与者层面的错误数据,也没有说明当系统输出偏离原意时,谁能加以纠正。

这条缺失的反馈回路关系到实质风险,不能仅归入次要的易用性问题。在政务柜台,一次错误翻译会改变申请内容、目的地、截止日期或同意事项。打手语的人需要一条清楚的操作途径,用来检查系统推断、拒绝错误结果、改用另一种表达,并请求人工手语翻译员。接收文字的工作人员也需要知道,眼前内容是高置信度译文、局部假设,还是系统选择暂不作答。输出是否便于纠正,比画面是否流畅更有分量。

CHI 研究者主张,未来的手语技术应当走出固定“翻译器”模式,扩展到更广泛的交流实践;系统可以给出多个翻译建议,支持协作修订,也应为手语自身的持续发展留下空间。他们还呼吁与聋人社群和领域专家合作,通用的用户认可不足以充当充分证据。[4] 把这套主张放回 2019 年原型,聋人手语者应参与界定目标语言、可接受错误、纠正流程、试用情形与发布门槛,参与范围也应超出向数据集贡献样本。[4]

一场令人信服的公共服务试用应展示什么

视频本身没有执行完整评估,却提示了一套实用的证据方案。第一,以来自不同地域和语言背景、系统从未见过的手语者为对象,评估连续且未经排练的手语。第二,将手语者测试与目标场所中的真实环境条件交叉组合。第三,在单元识别之外评估完整译句的意义,同时公开延迟、系统暂不作答的情况,以及会造成实际后果的错误类别。第四,由聋人参与者判断交互能否保留原意,并给出可接受的纠错途径。最后,保留人工支持,同时衡量系统能否缩短获得服务的时间,又不会增加请求人工协助的难度。

这些要求比“摄像头能否生成文字”严格,因为目标场所本就比展台复杂。与此同时,覆盖较窄的系统也能发挥作用。一套原型可以在经过明确披露的日常问题范围内运行,柜台空间按需求设计,每次译文都立刻获得确认,遇到困难便转交人工手语翻译员。坦诚的限制能让服务更安全;冠以“通用”之名,也无法令实际覆盖随之变得通用。

再看一次视频,留意整个故事有多少内容容纳在两种背景之间。洁净白墙证明了硬件的真正简化:摄像头输入,文字输出。设想中的机场或公共服务大厅,则把白墙压下的一切重新展开——视觉噪声、语言差异、事件后果、纠错和问责。从这件 2019 年技术遗存里,读到的长久启示是,一段清晰可读的展台演示,会让可靠翻译尚需走过的距离格外醒目;它距离 AI 已经“解决”手语翻译仍然很远。

资料来源

  1. CGTN,“AI interpreter for people with hearing loss: Translating Chinese sign language to words in real time”,YouTube 官方视频,2019 年 5 月 24 日。
  2. 机器之心,《践行科技向善,腾讯优图发布 AI 手语翻译机》,腾讯云开发者社区转载的同期中文技术报道,2019 年 5 月 22 日。
  3. Ka Leong Cheng、Zhaoyang Yang、Qifeng Chen 与 Yu-Wing Tai,“Fully Convolutional Networks for Continuous Sign Language Recognition”,ECCV 2020
  4. Xinru Tang 与 Anne Marie Piper,“Reimagining Sign Language Technologies: Analyzing Translation Work of Chinese Deaf Online Content Creators”,CHI 2026
  5. CGTN,“Tech for Good: New tech translates sign language”,介绍原型状态、限制与试用计划的文字特写,2019 年 5 月 23 日发布,2019 年 5 月 24 日更新。
  6. CGTN,2019 年优图手语演示的视频页面与存档海报图,本文题图取自此处。
  7. Qidan Zhu 等,“A Chinese Continuous Sign Language Dataset Based on Complex Environments”,arXiv 预印本,2024 年。
Previous Kimi K3 开放权重;推荐部署从 64 个加速器起步

Recommended In ai china

Matched by subject and format