ai china

觅影的 96.93% 精确到小数点后两位,证据边界却很模糊

7 条来源 3 条一手来源 已翻译 2026年9月12号

正文
医护人员在两台显示器旁进行胃镜检查,左侧屏幕显示腾讯觅影的分析画面,右侧为常规内镜影像。

2019 年 3 月,一篇关于德清一家医院的实地报道刊出这张照片:腾讯觅影的分析屏幕与常规胃镜显示器并排放置。照片记录的是临床诊室里的产品,区别于实验室示意图和生成图像。[7]

视频模式

本文包含 1 个可跳转的视频片段。

  1. 1 CGTN 2019 年展示腾讯觅影医疗影像界面的报道 YouTube 视频

2019 年 5 月,CGTN 一段 65 秒报道临近结束时,结肠图示和一幅标有中文“非腺瘤性息肉”字样的内镜画面上出现一句字幕:“该技术的诊断准确率可达 96.93%。”画面指向结直肠模块,CGTN 的配套文字报道也称,觅影可以帮助医生定位息肉并量化其风险。然而,片尾字幕与旁白都没有交代 96.93% 衡量的是定位还是分类,统计单位是单帧、病灶、一次检查还是患者,也没有附上测试人群。配套报道还引述公司说法,把这套技术与医生作比较,却没有给出医生群体或作为比较依据的评测资料。[1][2]

腾讯更早发布的一则消息给出了一处引人注意的对应,尽管两份材料均未明确关联这两个数字。2018 年 7 月,腾讯称其实时结直肠息肉定位准确率在一项“大样本、多来源、多中心”测试中达到 96.93%。消息另外给出结直肠腺癌鉴别准确率 97.20%,并称系统每秒处理十幅图像。[3] 到 CGTN 的画面上,相同的小数被放在一个含义更宽的标签之下:腾讯消息写的是定位准确率,视频字幕写的是诊断准确率。

措辞的改变,正是这段短片值得细看的地方。录像保留了一款中国医疗 AI 产品的早期面貌:它作为视觉辅助进入临床工作,判断权仍由医生掌握。与此同时,统一界面、数项癌症筛查应用,再加上一个精确到小数点后两位的百分比,也会让观众产生产品能力范围更广的印象;与数字相比,公开的评测细节要粗略得多。下文评注据此考察产品如何公开呈现;临床验证仍须查阅研究证据。

0:00–0:15 — 一个品牌之下的多项任务

报道从临床画面开始,随后转入一套蓝色的未来感界面。器官轮廓和医学影像,让“腾讯觅影”看上去像一套筛查高风险癌症的单一系统。短片与配套报道的内容却横跨消化道影像、宫颈筛查、诊断、预测和病灶定位。[1][2] 这些动词各有所指;不同应用使用的影像、标签、参照标准,以及出错后的后果,也各不相同。

任何指标出现之前,这一区别已经十分重要。系统可以在内镜视频帧中标记区域,可以给一幅已经选定的图像分类,也可以估计疾病风险或辅助最终诊断。每一项都是不同的预测问题。两个任务即使共用一套蓝色产品界面,其中一项测出的百分比也不能直接套用到另一项任务。

屏幕也在塑造观众的理解。它给差异很大的模块安排了共同的视觉语言:一侧是图像,另一侧是机器输出,中间穿插彩色标记和置信值。这种一致性可为操作者提供便利,却也容易让观众忽略评测范围。界面统一,仍无法说明各模块共享同一个模型、同一份数据集或同一等级的证据。

0:15–0:40 — “初步”是片中最重要的词

产品经理 Liu Juncan 介绍说,计算机会分析医学影像,帮助医生诊断和预测疾病。在消化道示例中,系统实时定位疑似病灶,供医生作出初步判断。报道所描述的角色是辅助医生,最终决定仍由医生作出。[1]

2019 年 3 月,一篇来自德清多家医院的独立实地报道把这种协作关系落到了诊室里。报道所刊照片中,觅影分析屏幕紧邻普通胃镜显示器,与本文头图呈现的是同一种并排布置。报道写道,觅影发现疑似息肉时会发出提示,随后由医生决定是否处置;其中也记录了实际限制。同一次部署中,工作人员提到肺结节提示会出现假阳性,当地数据上的准确率尚未与病理结果对照核验;谈到内镜时,他们强调结果仍受操作者技术影响。[7]

这种理解比“AI 诊断癌症”更有助于把握产品:它在现有操作流程中增加了第二条视觉通道。其价值既取决于标记框是否对准病灶,也取决于提示能否及时出现、医生能否理解提示、干扰性标记是否处于可接受范围,以及人机协作是否比单靠医生更可靠地发现有临床意义的病变。

报道随后称,试点医院会把医生反馈传给腾讯,用于优化算法。[1] 这段话属于公司对迭代开发的说明,仍需独立证据核验流程是否完全如报道所述;同样不足以证明每一版修订后的系统都会继承早期得分。反馈一旦改变模型、训练数据、阈值或界面,与结果对应的软件版本便成为这项主张的一部分。

0:40–1:05 — 数字换了动词

最后一组画面从宫颈筛查研究和医院试点移回结肠图示与内镜影像,随后打出 96.93% 的说法。[1] CGTN 的配套报道明确点出结直肠背景:觅影可以帮助定位息肉并量化风险,随后转述技术公司的说法,称这项技术可达 96.93%。[2] 因而,字幕虽然没有明说,仍能辨明相关任务类别。

指标本身仍有疑问。腾讯 2018 年的消息把完全相同的数字用于实时结直肠息肉定位,另以 97.20% 表示结直肠腺癌鉴别结果。[3] 视频则将 96.93% 称为“诊断准确率”。CGTN 没有说明这个数字取自早先的消息,因此,小数相同显示公开表述发生了变化,却不足以证明一条完整的来源链。

篇幅更长的腾讯消息仍不足以让人重建评测结果。文中称测试采用“大样本、多来源、多中心”数据,却没有定义“多来源”;这则发布消息没有说明分母,未界定怎样才算定位正确,也没有报告不确定性、说明训练与测试数据是否按患者隔离,或给出盲法外部对照。[3] 数字写到“96.93”,公开资料却远没有交代到同样精度。

本文不据此判定该数字虚假,讨论的范围在于它允许得出哪些结论。定位准确率可以按静态图像、视频帧、病灶或一次检查计算。同一次内镜操作中的近重复帧采用不同的划分方式,测试中加入阴性病例,或测试从筛选过的图像转向连续临床视频,结果都会显著变化。缺少统计单位和评测方案时,96.93% 无法换算成一名患者得到正确诊断的概率。

后来的一项研究,把一个百分比拆成多层评测

2021 年一篇同行评议论文,对一套相关的结肠息肉定位系统作了更完整的评测。论文没有证明所用模型与 2019 年画面中的模型检查点完全相同,因此,这些数字不能回头充当视频的验证结果。团队使用来自 20 个中心的 71,000 多幅图像训练和测试系统,随后又在 47 段完整、未经改动的结肠镜视频上单独评测,并在上海长海医院开展单中心前瞻性研究。四名作者的署名单位包括腾讯医疗,文中也披露了腾讯的经费、原型软件、计算机和 GPU 支持;研究明确披露了腾讯支持,其性质与独立复现有别。[4]

评测层次改变,性能数字也随之变化。静态图像测试集上的敏感度为 95.0%,特异度为 99.1%。完整视频评测中,逐帧敏感度为 92.2%,特异度为 93.6%。前瞻性使用时,计算机辅助检测(CADe)的敏感度为 98.4%,即检出 188 枚息肉中的 185 枚;每次退镜平均出现 2.2 次假阳性提示。[4]

前瞻性比较采用单臂、自身对照的观察性设计,没有设置随机的辅助组与非辅助组。AI 显示器放在结肠镜医生身后,由一名观察员记录每枚息肉最先被医生还是 CADe 发现。按这一比较方式,医生与 CADe 合并计算时,每次结肠镜检查检出 0.90 枚息肉,医生单独检出的数字为 0.82;腺瘤则分别为 0.32 和 0.30。若看至少检出一枚息肉或腺瘤的检查占比,相应增幅没有达到统计显著性:息肉从 45.9% 升至 48.3%,腺瘤从 22.0% 升至 23.9%。[4]

这些数字回答的是不同问题。图像测试关注选定的视频帧能否被识别;完整视频引入运动、液体、褶皱、反光,以及长时间没有病灶的片段;前瞻性研究则观察模型与医生在一次操作中的发现合并后会发生什么。论文记录的假阳性来源包括褶皱、光线反射、粪水或气泡,以及正常解剖结构。亚组分析显示,肠道准备不足或退镜少于六分钟时,息肉与腺瘤数量的增加均未达到统计显著性;仅凭这项关联无法确立因果关系。作者呼吁开展多中心随机试验。[4]

这种分层报告不如单一准确率容易记住,却包含更多信息。它列出失效模式,把模型表现放回工作流程,并区分技术层面的检出与整次检查的结局。CGTN 短片中含义未明的标签也由此显出分量:追问“96.93% 是在什么统计单位和方案下得出?”直接关系到数字的含义,因为答案决定这个数字描述的是一帧图像、一个标记区域、一处病灶、一次检查,还是一名患者。

监管把动词重新写清:先标记,再评估

2023 年 6 月,中国国家药品监督管理局宣布批准腾讯医疗的结肠息肉电子内窥镜检测软件上市。监管机构的英文通告把功能限定得很清楚:软件在结肠镜图像中显示并标记疑似息肉区域,医生再结合这些图像和患者情况作出评估。[5]

视频发布四年后,这段表述重新写明了执行者和动作:产品负责标记,医生负责评估。获批本身不足以证明每次使用都能改善患者结局;2023 年软件与 2019 年演示版本之间也不能直接画等号。不过,获批适用范围补上了片尾字幕缺少的内容,包括预期使用者、输入、操作和决策范围。

两种措辞的差别颇有启发。“诊断准确率”让一个数字代替整套诊疗过程;“为医生标出疑似区域”描述的是一件工具。后一种说法少了电影感,却更容易评估。

观看视频时,怎样审视准确率主张

2025 年发布的 STARD-AI 报告指南,面向采用 AI 的诊断准确性研究。它要求作者明确呈现预期用途、输入数据、参与者和数据集的选择、参照标准、分析方法、工作流程整合、预期最终用户及其所需专业能力,还有研究局限。[6] 用这套思路看短片,可以按下暂停键,逐一追问六个问题:

  1. 模型执行的具体任务是什么?
  2. 统计单位是图像、视频帧、病灶、一次检查,还是患者?
  3. 参照答案由谁或什么方法给出?
  4. 测试数据是否按患者、医院、设备、时间和软件版本与训练数据分开?
  5. 比较的是单独模型、单独医生,还是接受辅助的医生?
  6. 终点衡量的是屏幕上的标记框,还是医疗质量的改善?

短片与配套报道只回答了其中一部分。它们展示了预期的人机互动,点明结直肠应用,也提到医院试点,却没有公开片尾数字背后的评测方案。[1][2] 腾讯 2018 年的消息给出了定位这一标签,许多重要设计细节依旧缺失。[3] 2021 年论文给出本文所涉材料中最详尽的同行评议证据,同时也揭示了一分钟演示自然会剪掉的研究设计局限和失效模式。[4]

录像留下了什么

CGTN 的报道依然有价值,因为它记录了尚处于试点和上市前阶段的腾讯觅影,时间比本文所述的 2023 年获批早四年。CGTN 片中的初步判断和医生反馈循环,加上德清报道记录的并排显示器与实时提示,展现了一家公司如何尝试把计算机视觉嵌入既有医疗操作。这些是基准测试表格难以记录的产品设计事实。[1][2][5][7]

整套视频报道还留下了一次更微妙的证据压缩。画面和配套文字保留了结直肠任务,字幕却用宽泛的“诊断准确率”模糊了定位与诊断的差异。同一个小数在腾讯更早的定位消息里出现,但 CGTN 的两份材料都没有说明字幕源于那项测试,三份材料也都没有给出解释数字所需的评测方案。精确的小数留了下来,评测边界却消失了。[1][2][3]

补回这条边界,故事随之改变。这个数字不足以把觅影写成一台“医学判断正确率达到 96.93%”的机器;觅影是一组医学影像工具,公开材料展示了其中的结肠息肉辅助功能,也提出一项精确到小数点后两位、却缺少复现所需的统计单位和评测方案的主张。后来针对相关系统的研究把图像、视频和临床工作流程分开评测,没有让一个百分比代表全部表现。[4] 演示依然有其证据价值。更持久的启示,是让终点指标、统计单位和软件版本始终与数字相连。

来源

  1. CGTN,《医疗保健的未来:用 AI 筛查高风险癌症》,官方视频,2019 年 5 月 23 日。
  2. Pan Zhaoyi,CGTN,《尖端技术如何改变中国医疗行业?》,2019 年 5 月 22 日发布,5 月 23 日更新。
  3. Guo Yuhui,腾讯“互联网+”,《腾讯觅影发布国内首个结直肠肿瘤实时筛查AI系统》,刊载于腾讯医疗,2018 年 7 月 8 日。
  4. Sheng-Bing Zhao 等,“Establishment and validation of a computer-assisted colonic polyp localization system based on deep learning”,World Journal of Gastroenterology 27,第 31 期,2021 年。
  5. CCFDIE,“Computer-aided Detection Software for Electronic Endoscope for Colon Polyps Approved for Marketing”,中国国家药品监督管理局,2023 年 6 月 1 日。
  6. Viknesh Sounderajah 等,“The STARD-AI reporting guideline for diagnostic accuracy studies using artificial intelligence”,Nature Medicine 31,2025 年。
  7. Fu Mengwen,钛媒体,经凤凰科技刊载,《探访德清县医共体:医疗AI如何下基层?》,2019 年 3 月 21 日;本文头图来源。
Previous 港科大 7G 路线图里,沉默也是智能体的决策

Recommended In ai china

Matched by subject and format