通过可信虚拟机实现机密推理¶
日期: 2025年6月18日
论文链接: 阅读论文

引言¶
Anthropic 正在研发基于密码学保障的机密推理技术,确保用户敏感数据仅在可验证安全的服务器内被解密处理。
每天数百万用户将敏感信息托付给 Claude,包括专有代码和机密商业策略。Anthropic 正在研发新技术,使用户的信任获得"密码学层面的保障"。
这份与 Pattern Labs 合作发布的新报告阐述了机密推理(Confidential Inference)的机制——一套用于处理加密数据的工具集,能够证明此类数据仅在可自证可信的服务器内可读。
采用机密推理的两大核心动机¶
| 动机 | 说明 |
|---|---|
| 模型权重安全 | 机密推理是保护前沿模型免受日益强大的威胁行为者攻击的整体安全方案的一环,相关威胁描述见 RAND 的《保护 AI 模型权重》报告 |
| 用户数据安全 | 机密推理能证明用户的敏感数据被妥善保护 |
本文及其配套报告解释了机密推理的原理和潜在用户收益,并探讨了系统的安全考量。作者强调这只是早期研究的"草案","现在预测它将演化为何种具体设计或功能还为时过早"。
推理服务架构¶
核心原则:敏感数据应始终保持加密状态,仅在实际处理的那一刻才解密。
系统采用成熟的机密计算方法,构建信任链以证明软件安全性,并利用该证明来强制执行哪些软件有权使用加密密钥的规则。
需要对明文操作的两个关键环节¶
| 组件 | 职责 |
|---|---|
| API 服务器 | 接收提示词(prompt),将其转换为 token,执行 Claude API 请求背后的大部分逻辑 |
| 推理服务器 | 在硬件加速器上运行 Claude 的"大脑",从提示词生成补全 token |
对于模型权重而言,仅推理服务器接触敏感数据。
可信加载器(Trusted Loader)设计¶
由于并非所有加速器都完整支持机密计算,团队探索了一种在可信环境中运行的小型安全"模型加载与调用器"方案。
该加载器执行以下操作:
- 接收加密数据,解密后发送给加速器
- 向加速器发起计算调用,并将加密后的结果返回给调用方
只有"可信"加载器能访问解密后的数据。系统的其余部分是"非可信"的,但可以向加载器发送请求。
实现细节¶
将系统分为可信与非可信两部分,非可信侧可以频繁变更而不影响整体安全性。
推理服务器的绝大部分运行在"非可信"侧——该侧代码可能频繁变动,但"其变化不会影响整个系统的安全性"。一个小型可信加载器运行在由 hypervisor 隔离的独立虚拟机上。加载器将自身呈现为一个"虚拟加速器",与模型架构细节无关。该虚拟加速器只接受由其安全持续集成服务器签名的程序,确保任何运行的代码都"经过多名工程师审核"。
最终效果是:只要加载器正确运行,"无论系统其余部分做什么",机密性要求都能得到满足。
可信执行环境¶
加载器运行在具备加密内存、禁用调试功能和代码运行证明等特性的机密计算环境中。
报告描述了加载器运行的机密计算环境所需具备的特性:
| 特性 | 说明 | 现状 |
|---|---|---|
| 内存加密 | 通过硬件将内存与其他工作负载隔离 | 可防御部分物理攻击和恶意 hypervisor;但与加速器共享加密主机内存的功能"目前尚未成熟" |
| 禁用调试功能 | 关闭可能暴露数据的调试接口 | 已可通过成熟的机密计算实践实现 |
| 代码运行的密码学证明 | 证明正在运行的是预期的正确代码 | 已可通过成熟的机密计算实践实现 |
内存加密(特性 1)可防御部分物理攻击和恶意 hypervisor,但与加速器共享加密主机内存的功能"目前尚未成熟"。在此期间,团队将依赖云计算提供商来保障物理数据中心和 hypervisor 软件的安全。
特性 2 和 3 可通过广泛支持的机密计算实践来实现,使用可信平台模块(TPM)作为信任根。TPM 对每个启动阶段进行度量,并生成代表最终结果的哈希值。该哈希构成一份证明(attestation),表明加载器服务器按预期隔离运行、执行的是经签名和审核的代码,且已禁用相关调试功能。密钥服务器验证此证明,仅在接收方证明自身安全时才释放解密密钥。
一个环境是否"可信"最终取决于密钥服务器。团队还在探索由其他方验证可信代码并管理独立密钥服务器的模式,这"能让我们为每份数据提供更强的机密性保障"。
未来方向¶
随着前沿模型能力增长,安全加载器层可能需要更多防护措施。
随着前沿模型变得更强大,安全加载器层可能需要额外的保护措施,包括:
| 方向 | 说明 |
|---|---|
| 出口带宽限制 | 在持有明文模型权重的服务器上增加额外的出口带宽限制层 |
| 安全分类器签名 | 要求经过安全分类器签名后才能执行推理 |
团队希望公开这一模型能"激发关于哪些额外特性值得探索的讨论"。
结论¶
该研究通过端到端加密处理流程,在保护模型权重安全的同时确保用户数据仅在硬件安全可控环境中被解密。
这项研究推进了保护模型权重和用户数据安全的持续努力。使用该模型保护用户请求,可确保客户数据仅在具有增强硬件安全控制的环境中被解密:
| 阶段 | 数据状态 |
|---|---|
| 请求发送 | 在到达 Anthropic 服务器之前即已加密 |
| API 服务器 | 解密、处理、重新加密后传递 |
| 推理服务器 | 以加密形式处理请求;仅在发送给可信加载器时才解密 |
| 生成补全 | 加密后离开加载器,经 API 服务器回传给调用方 |
模型权重方面:"可以加密存储,在加载器中解密,且永远不会从加载器中泄露出去。"
硬件设计者(如尚未这样做的厂商)应考虑将机密计算纳入芯片设计。如果硬件信任根直接附加到加速器上,"这类系统的信任边界可以显著缩小"。
完整报告:阅读完整报告
加入我们¶
对此研究感兴趣的读者,欢迎在招聘页面的"Security"和"AI Research and Engineering"板块申请相关职位。