ai china

中国为 AI-ISP 编了号,公开记录却停在测试之前

10 条来源 7 条一手来源 已翻译 2026年9月9号

正文
紫色陶瓷封装中裸露的 CMOS 图像传感器裸片微距照片,四周连接着金色键合线。

Phiarc 拍摄的一枚裸露 OmniVision OV7120 CMOS 传感器;此处的 CC BY-SA 4.0 版本由 Wikimedia Commons 原图缩放而来。这款较早、以模拟电路为主的灰度器件与现代 AI-ISP 产品分属不同世代;这件实物提醒人们,每一幅经过处理的图像都始于传感器,并在进入人眼之前穿过一整套电子系统。[9]

相机的起点早于照片。光先穿过滤光层,在感光点阵列上转成电荷;信号随后经过模拟增益和数字转换,留下马赛克排列的 RAW 测量值,距离人们熟悉的彩色图像仍有一段处理过程。图像信号处理器(image signal processor,ISP)把这些材料处理成可用的 RGB 帧。训练得到的模型一旦进入这条链路,AI 的作用便从解读成片向上游延伸,开始参与决定第一幅可见图像的样貌。

2026 年 8 月 27 日,中国官方标准平台发布了 GB/Z 223-2026《人工智能 智能图像信号处理系统技术规范》。公开记录将其列为现行的国家标准化指导性技术文件,归口于 TC28 人工智能分技术委员会。文件共有 11 家主要起草单位,其中包括清华大学、中国电子技术标准化研究院和浙江芯劢微电子股份有限公司。深圳云天励飞技术股份有限公司、浙江大华技术股份有限公司、杭州海康威视数字技术股份有限公司和浪潮电子信息产业股份有限公司也在名单中。[1]

这项变化值得持续观察。AI-ISP 此前已经出现在研究论文、相机营销材料、产品规格表和固件中,如今又有了国家文件编号,以及一支横跨科研、标准化、图像与边缘芯片、相机和服务器领域的起草队伍。这份名单显示标准制定已有跨层参与;它无法证明各方就同一种架构达成一致、已经实施该文件,或让各自产品能够互操作。[1]

前缀与编号同样重要。中国标准主管机构把 GB/Z 定义为面向快速创新领域的指导性技术文件,适用范围包括具有应用前景、仍处于发展阶段的技术。这类文件补充国家标准体系,可供参考使用和试行采用。[2] 因此,GB/Z 223-2026 属于指导性文件,不能充当强制性产品证书。公开目录列出了标题、日期、状态、分类和起草单位,却没有条文内容、阈值、参考实现或符合性结果。若断言它强制规定了某种神经网络流水线、安全控制、基准或接口,便超出了该页面当前可见证据的范围。[1][2]

图像出现之前,先有一套配置

传统 ISP 由一连串范围明确的变换组成。它先校正黑电平和坏点,再从类似 Bayer 的马赛克中重建完整色彩、降低传感器噪声、校正光源下的白平衡,并映射相机自身的色彩。随后,它压缩动态范围、应用显示曲线并锐化细节,最后把 RGB 帧交给编码器、屏幕、存储系统或视觉模型。各家做法不尽相同,若干环节存在调整顺序或合并处理的情况,但核心事实始终一致:相机输出是加工后的产物,传感器读数只是起点。[5][7]

学习型 ISP 可以取代整条 RAW-to-RGB 映射,也可以把神经网络模块插入选定阶段。[5][6][7][10] 不同选择对应不同的依赖清单。端到端模型处理高分辨率张量,需要足够的内存带宽和加速器时间。混合流水线要求固定功能模块与学习模块之间交接清晰,其输出还要在曝光、运动、温度和画面变化中控制在安全范围内。

整条硬件链远比“传感器加模型”更长,其中包括镜头和光圈、彩色滤光阵列、传感器与模拟前端、ISP 或神经处理单元、内存、模型格式与量化方式、相机固件、视频编码器,以及接收输出的检测器或录像设备。传感器修订版、镜头透射率、模拟增益策略、裁切、位深或曝光时序只要有一项改变,模型接收的数据分布就有偏移风险。量化方式或加速器内核发生变化后,同一个模型检查点也未必还能产生完全相同的帧,或维持相同延迟。[5][7][10]

因此,验证时真正有用的单位是一套标明版本的相机配置,只写算法名称远远不够。中国新文件的起草名单横跨链条中的多个环节,与这一判断相符。[1] 这仍属于本文的分析,公开资料尚未显示 GB/Z 223-2026 提出了这项要求。

产品证据已经分布在光学、芯片和固件之中

海思 Hi3519DV500 的产品页面显示,有多少处理环节已经能够集成在单个器件中。这款相机系统级芯片最多接入 4 个传感器,支持 8、10、12 或 14 位 RGB Bayer 输入;神经网络可用于动态范围压缩、Bayer 降噪、3D 降噪或去马赛克;芯片集成最高 2.5 TOPS 的 INT8 推理能力,同时提供 H.265/H.264、JPEG 编码和 Linux SDK。海思标出的典型功耗是:4K30 编码叠加 2 TOPS 推理负载时为 2.5 瓦。[10] 这些数据来自厂商的一手规格,不能替代独立基准或 GB/Z 223-2026 符合性结果。它们更适合说明物理集成方式:RAW 输入、固定功能与学习型图像处理、AI 计算、编码、安全功能和软件支持可以共处一块芯片。测试若只标注“AI 模型”,执行路径中的大部分信息仍会缺失。

大华在 2024 年 9 月发布 WizColor,展示了厂商如何把这套链条包装成产品。公司称这款相机结合了 AI-ISP 芯片、大像素传感器和 F1.0 光圈,并宣称视觉模型处理效率提高 40%、功耗降低 30%、细节还原能力提高 50%、运动模糊减少 80%。[3] 这些百分比均为厂商主张。页面没有公布用于比较的设备、分辨率与帧率、功耗统计范围、测试画面集合、评分定义,以及复现结果所需的置信区间。它们只反映产品定位;用于跨产品比较的基准还需要完整的测试条件。

海康威视带版本的固件记录更能说明实际运行。《Network Camera V5.9.12 Release Note—E15》写明,该版本为列明的 2 MP、4 MP 和 6 MP 相机系列加入 AI-ISP 智能降噪,默认开启,运行帧率为 12.5 帧/秒。[4] 这一行记录没有衡量画质,却明确了产品系列、固件版本、默认状态、功能和运行界限,更接近集成商可以实际验证的凭据。

两家公司都在 GB/Z 223-2026 的起草名单中。[1] 这一事实只说明二者参与了起草;大华的性能主张与海康威视固件的验证和认证仍需独立证据。把芯片、产品、固件和研究资料合在一起看,共同技术词汇的必要性便很清楚:“AI-ISP”可以指芯片、模型、降噪模式、端到端渲染器,也可以指相机的一整项功能。[3][4][5][6][7][10] 采购方必须先弄清规范指向哪一类事物,随后才有比较两组性能主张的基础。

训练数据对也是供应链的一环

学习型成像依赖一类尤其难处理的数据。模型往往需要同一画面的 RAW 传感器采样与高质量目标图像,然而两台相机的视点、曝光、光学系统、时序和响应都无法完全一致。摇动的树叶、移动的人、反光和手持抖动一旦进入画面,细微的对齐误差就会变成错误监督:传感器从未观测到的细节,也会被训练损失误算成模型的失败。[7]

2025 年 Mobile AI 学习型 ISP 挑战赛让这种依赖变得具体。其 Fujifilm UltraISP 数据把 Sony IMX586 Quad Bayer 手机传感器的 RAW 帧与 102 MP 的 Fujifilm GFX100 拍摄的参考图像配对。组织者在 Adreno 和 Mali 移动 GPU 上评测 Full HD 推理,并报告大多数参赛模型的运行时间低于 30 毫秒。[5] 这项可行性证据只覆盖指定的数据集、分辨率和硬件类别。监控视频、其他传感器、不同神经加速器或散热受限的机身仍需各自测试延迟。

另一项 2025 年研究直接处理配对难题,使用彼此不配对的 RAW 与目标 RGB 图像集训练模型。研究分别设置内容、颜色和纹理三类目标函数,并在 Zurich RAW-to-RGB 与 Fujifilm UltraISP 数据集上评测轻量级骨干网络。[7] 这种方法可以降低精确对应数据的制作成本,也让验收问题更加尖锐:当训练数据中没有逐像素对齐的目标图像来说明画面应有的样貌,测试该如何区分恢复出来的悦目纹理与模型虚构的纹理?

在供应链中,训练语料更接近经过校准的部件,把它当作普通照片集合会遗漏关键属性。有效的清单应写明传感器和镜头、位深、黑电平、曝光与增益、照明、运动、相关情况下的温度、目标相机设置、对齐流程、许可和排除项。一份没有相机卡配套的模型卡,交代不了最重要的兼容范围。

同一份输出会同时服务人和检测器

传统相机调校通常以人眼观看为中心,追求自然的色彩、干净的暗部、克制的光晕和层次清楚的高光。AI 相机又多了一类使用者:RGB 帧可以在人观看之前直接进入目标检测、分割、跟踪、识别或其他控制回路。

研究者已经开始为第二类使用者优化 ISP。2026 年论文 Task-Aware Image Signal Processor 提出一套紧凑的 RAW-to-RGB 方案,为预训练视觉模型预测轻量调制算子。实验涵盖日间与夜间条件下的检测和分割基准,目标是在控制参数量与推理时间的同时提高下游准确率。[6] 这项研究结果限于特定数据集、模型和训练设置,不能说明中国已部署相机的表现,GB/Z 223-2026 也未公开相应测试方案。

研究仍然揭示了一种长期存在的设计张力。人眼觉得最舒服的画面,未必保留了检测器寻找微小或低对比度目标时最有用的特征。面向任务的渲染所采用的颜色或局部对比度,也未必符合人眼偏好。若生产方没有说明使用者和评价指标,“更好的图像”便是一个不完整的说法。

可信的验收方案因而需要两条测试线。面向人的一条应覆盖色差、纹理、时序稳定性、重影、光晕、噪声、运动模糊,以及在声明条件下由专家或用户作出的评价。面向机器的一条应冻结下游模型版本,在相同 RAW 画面上报告任务指标。只测最终检测器容易遮住难看或不稳定的视频;只测视觉观感也容易遮住任务信号的损失。

成像之前的模型也是一道安全边界

模型所处的位置更靠上游,故障的含义也随之改变。下游检测器若漏掉一个人,操作员仍有机会在录像帧里看到这个人。遭到破坏的成像模型若在 RGB 帧生成前移除这个人,操作员与下游检测器都有接收同一份虚假证据的风险。[8]

浙江大学研究人员在 2025 年 USENIX Security 论文 Neural Invisibility Cloak 中演示了这种威胁模型。他们利用数据投毒与生成式训练,在 4 类代表性任务所用的 2 个 AI-ISP 模块中植入后门,随后在真实图像与视频实验中测试带物理触发图案的服装及其贴片变体。遭植入后门的模型能够向人类观察者和下游识别系统同时隐藏触发区域。[8]

这项发现的适用范围必须说清。研究的前提是模型或训练过程已经遭到破坏。它没有表明 GB/Z 起草单位的产品含有这类后门,也没有表明常规 AI-ISP 增强会自行抹去人物。它证明的是:学习型处理一旦位于所有人共享证据的上游,模型完整性失守便足以污染共同证据。

本文建议把常见的软件供应链控制放进相机内部。模型制品应配有哈希与签名,训练和转换来源应有记录,模型更新须受权限管控,量化过程须可复现,并允许回滚至已知版本。相机还应保留基于传统 ISP 的安全模式和 RAW 测试片段,供调查人员比较输入与输出。这些属于建议性控制措施,GB/Z 223-2026 的现有公开记录未显示它们是文件要求。安全研究也说明,仅做常态视觉回归仍有缺口:该攻击经过设计,在常规输入下保持正常输出质量,并在遇到触发条件时响应。[8]

公开测试方案必须区分三类真实性

当下,GB/Z 223-2026 的价值在于提供国家参考坐标,互操作性仍缺少公开证据。有用的公开测试方案应避免把三个不同问题合并成一项画质分数:帧是否忠实于采集到的现场?它是否为声明的机器任务保留了有用证据?它是否来自操作员原定运行的模型和执行链路?

第一个问题关乎图像如何生成。实验室应固定 RAW 捕获数据,在声明的照明、曝光、增益、运动和天气条件下比较输出,测试内容还应覆盖不同肤色、反光材料与少见画面;除色差和纹理外,还要报告时序不稳定性、重影、光晕、噪声与模糊。相机清单则应把结果与光学系统、传感器修订版、模拟参数、传统 ISP 阶段、模型哈希、量化方式、加速器、固件、编码器、分辨率和帧率绑定。缺少这种绑定,优秀结果便有被悄然套用到从未测试配置的风险。

第二个问题关乎证据的连续性。同一批 RAW 画面应交给具名的下游检测器或分割器处理,并冻结其版本,以免视觉改进遮住任务退化。结果应按画面类型和使用者分别列出,一个总平均数会掩盖差异。夜间流水线若能帮助人看清车牌,却抹掉检测器依赖的边缘,仍可具有实用价值,前提是这项取舍清晰可见,产品也注明了预期使用者。

第三个问题关乎完整性。实验室应验证实际运行的模型制品,演练更新与回滚流程,测试异常输入和类似触发条件的输入,并保留足量 RAW 材料或经过密码学绑定的参考材料,便于调查有争议的输出。在重视隐私的部署中,持续保留 RAW 数据有时难以实施,有时也不适宜。因此,采样政策、访问控制、保留期限与证据保管链都应纳入设计;这些现实约束不能成为彻底放弃上游参照的理由。

这些分析标准来自工程资料和研究记录,公开材料并未显示其属于新文件条款。进展会体现在厂商公布按配置区分的结果,让其他实验室能够复测,并明确说明哪些变更会让结果失效。一组更明亮的夜间图像可以展示效果,却无法确认产生效果的传感器、模型、固件、运行时和完整性条件。

中国的 AI 竞争常被描述成模型或加速器之争。新的 AI-ISP 编号把视线引向一处较少被谈论的边界:传感器读数转化为共享视觉证据的过程。一旦 AI 进入这一步,画质、机器感知和模型完整性便在图像生成之前相互牵连。由不同团队分别鉴定、假定各项输出只在成片之后汇合的做法,已经失去依据。供应链必须说明图像如何生成。

来源

  1. 全国标准信息公共服务平台,“GB/Z 223-2026:人工智能 智能图像信号处理系统技术规范”(2026 年 8 月 27 日发布;官方状态、分类、委员会与起草单位;中文)。
  2. 国家市场监督管理总局,“《国家标准化指导性技术文件管理规定》发布实施”(2025 年 4 月 15 日;官方说明 GB/Z 文件的作用、类型与加速制定程序;中文)。
  3. 大华技术,“As Bright As Daylight: Dahua Launches WizColor Technology for Better Visual Experience Even at Night”(2024 年 9 月 24 日;厂商提供的 AI-ISP、传感器、光圈、效率、功耗、细节与运动模糊主张)。
  4. 海康威视,Network Camera V5.9.12 Release Note—E15(2025 年 9 月 19 日;厂商提供的固件记录,涉及 AI-ISP 支持、默认启用、适用相机系列和 12.5 帧/秒运行帧率)。
  5. Ignatov 等,“Learned Smartphone ISP on Mobile GPUs, Mobile AI 2025 Challenge: Report”,CVPR Workshops 2025(配对的传感器与参考数据、移动 GPU 评测设置,以及限定条件下的 Full HD 运行时间结果)。
  6. Chen 等,“Task-Aware Image Signal Processor for Advanced Visual Perception”,CVPR 2026(紧凑的 RAW-to-RGB 调制框架,以及限定条件下的检测与分割评测)。
  7. Arhire 与 Timofte,“Learned Lightweight Smartphone ISP with Unpaired Data”,CVPR Workshops 2025(训练数据配对难题、非配对训练目标、数据集与轻量化部署设计)。
  8. Zhu 等,“Neural Invisibility Cloak: Concealing Adversary in Images via Compromised AI-driven Image Signal Processing”,USENIX Security 2025(作者项目页,提供论文、代码、威胁模型、实验与防御措施)。
  9. Phiarc,“Pier2.3 OV7120 CMOS image sensor closeup”,Wikimedia Commons(2023 年 1 月 27 日;原始照片与 CC BY-SA 4.0 许可)。
  10. 海思,“Hi3519DV500:4K30 AI-ISP 相机芯片”(厂商提供的传感器输入、神经 ISP、推理、编码、安全、SDK 和限定功耗规格;中文)。
Previous Momenta R7 随凯迪拉克车型量产上市,114 个定点项目面临授权收入考验 Next 悟道的万亿参数纪录,遮住了背后的一整套模型系统

Recommended In ai china

Matched by subject and format