截至 2026-06-10T16:03:44Z UTC,大模型行业普遍强调“安全很重要”。阿里云 Confidential AI 材料给出的 AI-China 信号更进一步:模型安全正被写入运行时控制。加密模型制品、远程证明、KMS 持有的解密密钥、TEE 保护下的 CPU 与 GPU 执行,以及平台团队可以照着操作的云端部署步骤,共同划出了这条运行时边界。[1][2]
中国市场里的强模型已经足够多,真正稀缺的是稳定、常态化、可审计的安全控制。企业可以从多种渠道调用 Qwen、DeepSeek、GLM、Hunyuan、InternLM 及其他模型,部署难题随之转向数据和权重。敏感提示词、客户数据、微调权重与专有模型文件经过云端推理链路时,能否始终对云运营方、失陷的宿主机以及权限过宽的管理通道保持不可读?阿里巴巴以 Confidential AI 回答这个问题,并把控制环节写进基础设施。[1][3][4]
图片说明:封面采用真实的数据中心照片,舍弃了幻灯片、图表、架构图、截图、生成图像与象征性 AI 插画。Confidential AI 处理的是运行时安全;模型制品、密钥释放、远程证明以及 CPU/GPU 执行,都要在可操作的基础设施中发生。[1][2][5]
环境自证后,密钥才会释放
阿里巴巴的安全大语言模型推理指南给出了最清楚的操作流程。指南介绍的阿里云异构机密计算实例 gn8v-tee 以 CPU TDX 机密计算为基础,再把 GPU 纳入 TEE 保护范围,同时保护 CPU-GPU 数据传输和 GPU 侧计算。[1] 这套环境接入 KMS,并与运行在 ACK 中的 Trustee 远程证明服务配合。流程很直接:先加密模型并以密文上传,目标推理环境通过验证后才能解密。[1]
这套流程改变了防护对象。这里的模型已经超出存放在访问受控存储桶(bucket)中的普通文件:它是一份模型制品,要等运行时证据链成立,才会呈现可用形态。阿里巴巴指南写明,远程证明服务先验证模型部署与推理环境,确认环境可信后再注入模型解密密钥,随后挂载加密模型。[1] 对平台团队而言,密钥发放条件比“不要暴露模型”更明确,也能直接写入工程控制。
示例把各项组件对应到具体配置。阿里巴巴列出准备好的加密试用模型,包括 Qwen3-32B 与 Qwen2.5-3B-Instruct,并注明对象存储位于 cn-beijing。指南还记录了两种模型加密方案:Gocryptfs 采用 AES256-GCM,兼容开源 Gocryptfs 标准;Sam 则是阿里云的可信 AI 模型加密格式,用于保护模型机密性与授权信息的完整性。[1] 模型打包、密钥处理、OSS 所在地域、证明策略、KMS 设置与推理挂载,由此成为实施时需要逐项检查的风险点。
OpenAnolis 把概念拆成可部署组件
开源项目也沿着同一方向推进。OpenAnolis confidential-ai 希望让敏感 AI 任务继续使用云端算力,同时借助可信硬件与远程证明,保护用户私有数据、训练集和生成式模型资产免遭暴露。[2] 项目当前标注的稳定版为 v1.1.0,日期是 2025-08-01。组件表列得很清楚:Trustiflux 管理机密容器的资源安全与远程证明,Trustee 验证 TEE 环境并分发机密信息(secret),TNG 是基于远程证明的可信网关。[2]
这些组件透露了真正的现场信号:专有云上的一个复选框概括不了整套安全设计,实际控制已拆成与平台团队职责逐一对应的组件。有的组件验证机密环境,有的控制机密信息;网关保护流量,同时省去逐一改写所有现有应用的工作。Docker 部署方案适合在单台 TDX 实例上完成端到端验证与开发模拟;RPM 部署采用软件包管理,要求使用 Alibaba Cloud Linux 3,面向生产环境。[2]
放在中国 AI 市场中,这组信号尤其清楚。报道往往追踪模型家族、应用发布与价格下调,Confidential AI 则把视线移向少有喧哗的基础设施:一组软硬件约束,决定企业能否带着敏感数据从试点进入云端托管推理。宣称基准测试成绩最高的实验室未必占优;更有竞争力的,是能让密钥、加密模型、运行时证明与加速器访问严密配合的云和操作系统(OS)技术栈。
蚂蚁案例解释金融 AI 为何需要使用中保护
蚂蚁集团与 Intel 的案例研究给出了企业采用这项技术的理由。蚂蚁在阿里云 ECS g8i 实例上构建机密 PaaS 产品矩阵,采用第 4 代 Intel Xeon 处理器与 Intel TDX。Intel 将 TDX 描述为一种基于硬件的 TEE,有助于在数据使用过程中保护客户数据与蚂蚁的 AI 模型。[3] 同一案例还提到,蚂蚁正在探索让客户使用自身数据微调 LLM,同时要在云端微调和推理期间保障专有数据与客户数据的机密性。[3]
这正是企业采用时的瓶颈。银行、保险机构、医疗运营方或工业企业会考虑把通用任务交给云端 AI;工作流一旦包含客户记录、专有提示词、微调权重、反欺诈逻辑、理赔记录或内部流程文档,审慎程度就会明显上升。数据在存储和传输时的加密已经是基础要求,更棘手的是使用中数据的防护:模型输入与权重必须交给 CPU、GPU、内核、运行时以及云运营方的基础设施处理。
案例还补充了一项措辞克制的性能信息:蚂蚁使用 Intel AMX 加速训练与推理中的矩阵运算,并从通用 VM 迁移到机密 VM;后者运行基于 Occlum 的安全操作系统,配有针对 TEE 的访问控制。[3] 机密性需要付出成本,因此工程上要同时衡量隔离、证明、性能与兼容性。隔离性与可证明性要足以承接敏感工作负载,加速能力和 VM 兼容性也要达到实用水平,机密 AI 才能从实验项目进入生产选型。
PAI 把安全纳入企业 AI 平台
阿里巴巴云栖大会的 PAI 文章把机密计算与更广的平台策略联系起来。文章在企业能力部分指出,越来越多企业客户在云上微调并使用大模型,模型与数据安全随之更加突出。随后,文章称 PAI 覆盖训练、微调与推理全流程,保障数据合规与安全,并与阿里云基础软件团队和 Anolis 社区合作,建设贯通硬件与软件的 Confidential AI 解决方案。[4]
结合安全推理指南来看,这段话可以与具体技术环节相互印证。PAI 是上层产品入口;机密计算指南记录了底层操作,包括准备加密模型、上传 OSS、用 Trustee 完成远程证明、通过 KMS 释放密钥、部署 ACK,以及在 TEE 保护下运行推理。[1][4] 同一篇 PAI 文章还介绍了 BladeLLM 与 PAI-EAS 推理服务升级,宣称能够降低首个 token 延迟和 token 输出延迟、提高吞吐、覆盖全球地域并支持大规模推理集群。[4] 性能主张与企业安全相邻出现,显示阿里巴巴希望模型服务既有足够性能,又便于治理,从而进入企业的生产采购。
Confidential AI 处理的范围很具体。模型质量仍需评估,提示词注入(prompt injection)仍需防护;微调数据集是否合法、是否具代表性、是否安全,也要另行审查。系统还要配套访问控制、日志记录、事件响应、输出过滤、模型评估与供应商风险审查。Confidential AI 所收窄的,是一类关键暴露:模型文件、提示词、训练数据与推理数据在计算过程中进入可读状态的途径。[1][2][3]
观察点
第一项观察点是 GPU 覆盖。阿里巴巴的 gn8v-tee 指南明确把保护范围从 CPU 侧机密 VM 延伸到 GPU 计算,这正是它的价值所在。[1] 对大模型推理来说,这一区分具有决定性。如果文档进一步列清支持的 GPU 类别、驱动栈、运行时与模型服务框架,并附上可重复的部署示例,Confidential AI 会更具实用价值。
第二项观察点是证明策略是否清楚。“可信”必须落实为可检查的条件。买方需要知道系统检查哪些度量值、谁负责运营 Trustee、KMS 策略管到哪里、密钥如何轮换,以及证明失败后系统如何阻止模型释放。[1][2] 这些控制越接近普通平台设置,机密推理就越有机会从专项工程逐步成为敏感工作负载的默认选项。
第三项观察点是与 PAI 和模型市场的整合。如果 Confidential AI 长期只是一份独立的基础设施方案,主要用户会是把安全放在首位的平台团队。如果它进入 PAI、Model Studio 或企业推理产品,就能成为一项可选的部署方式,也有机会影响采购选择:调用同一个模型时,企业可以选用更严密的运行时控制。
阿里巴巴 Confidential AI 所释放的信号,落在信任边界的迁移上,与新模型家族无关。在中国 AI 技术栈里,模型供给拥挤,推理服务竞争激烈,企业客户对风险敏感。云厂商如果能够证明模型应在何时解密、提示词在哪里处理、哪一种运行时有权读取敏感数据,就占据了 AI 部署链中一处低调却持久的控制节点。[1][2][3][4][5]
来源
- 阿里云帮助中心,《基于异构机密计算实例构建安全大语言模型推理环境》(涵盖
gn8v-tee、加密 Qwen 模型、Trustee 证明、KMS 管理的密钥、ACK 部署与 TEE 推理流程的 Confidential AI 指南)。 - OpenAnolis,
confidential-ai中文 README(项目范围、v1.1.0稳定版本、Trustiflux、Trustee、TNG 组件、Docker 部署、RPM 部署、TDX 要求与 Apache 2.0 许可)。 - Intel, "Ant Group Develops Confidential Computing for SaaS"(关于阿里云 ECS
g8i、Intel TDX、蚂蚁机密 PaaS/SaaS、金融 AI 应用、客户数据微调与使用中保护的客户案例)。 - 阿里云开发者社区,《云栖实录 | GenAI 时代 AI Infra 工程技术趋势与平台演进》(2024 年 9 月 27 日云栖大会文章,内容包括 PAI、企业安全、Confidential AI 与 PAI-EAS/BladeLLM)。
- Wikimedia Commons, "Datacenter Server Racks"(真实数据中心机柜照片;QA 拒绝以幻灯片为主的会议图后,本文改用它作为沉浸式封面图)。