开发安全可信 AI 智能体的框架¶
Anthropic 发布了构建安全可信 AI 智能体的系统性框架,围绕人类控制、透明度、价值对齐、隐私保护、安全防护五大核心原则,为智能体从"对话助手"迈向"自主执行者"提供了设计指导。
从 AI 助手到 AI 智能体¶
AI 助手回应特定的提示,而 AI 智能体则是在给定目标后自主追求任务的完成。智能体如同虚拟协作者,能独立处理复杂项目。
智能体"主导自身的流程和工具使用,以最少的人类输入维持对任务完成方式的控制。"例如:
- 婚礼策划:研究场地和供应商、比较价格和可用性、创建时间表和预算
- 董事会演示:搜索关联的 Google Drive、从电子表格中提取指标、生成报告
当前智能体应用实例:
| 产品/企业 | 应用场景 |
|---|---|
| Claude Code | 面向软件工程师的自主编码智能体 |
| Trellix | 网络安全公司,使用 Claude 进行安全事件分类和调查 |
| Block | 金融服务公司,通过智能体让非技术人员访问数据 |
了解更多:AI 智能体视频介绍
可信智能体的核心原则¶
该框架旨在帮助建立新兴标准、为不同场景提供可适配的指导,并为构建一个智能体与人类价值观一致的生态系统做出贡献。

原则一:在赋予自主性的同时保持人类控制¶
智能体设计的核心矛盾在于:如何平衡智能体的自主性与人类的监督能力。 智能体需要独立性才能产生价值,但在高风险决策前,人类应保留控制权。例如:一个费用管理智能体发现订阅超支,应在取消订阅前获得批准。
以 Claude Code 为例的具体实践:
| 权限级别 | 说明 |
|---|---|
| 随时中断 | 人类可随时停止 Claude 并重新引导其方法 |
| 默认只读 | 默认仅有只读权限 |
| 无需审批的操作 | 分析和审查信息无需人工批准 |
| 需要审批的操作 | 修改代码或系统前必须请求批准 |
| 持久授权 | 用户可为受信任的例行任务授予持久权限 |
"自主性与监督之间的正确平衡因场景不同而差异巨大。"
原则二:智能体行为的透明度¶
人类需要对智能体的问题解决过程有可见性。举例:一个被要求"降低客户流失率"的智能体联系设施部门询问办公室布局——如果没有解释会显得莫名其妙,但通过透明机制,智能体可以解释其逻辑:嘈杂开放式办公区的销售代表客户流失率高出 40%。

Claude Code 的待办清单——用户可实时查看进度
关键挑战:"信息太少会导致人类无法评估智能体是否在正确轨道上实现目标;信息太多则会用无关细节淹没他们。"
原则三:使智能体与人类价值观和期望对齐¶
智能体并不总是按照人类的意图行事。 例如:被要求"整理我的文件"的智能体可能会删除它认为重复的内容并重组文件夹结构。
Anthropic 的智能体错位研究表明:"当 AI 系统自主追求目标时,它们有时会采取对系统来说看似合理、但实际上违背人类真正意图的行动。"
"构建可靠的智能体价值对齐度量方法仍然充满挑战。"
原则四:在长期交互中保护隐私¶
智能体跨任务保留信息会产生隐私问题。例如:一个在组织规划期间了解到某部门机密决策的智能体,可能在协助另一个部门时"无意中引用这些信息"。
模型上下文协议(MCP)——Anthropic 开源的协议,允许 Claude 连接其他服务——提供的隐私控制机制:
| 控制手段 | 说明 |
|---|---|
| 连接器访问控制 | 允许或禁止对特定工具("连接器")的访问 |
| 临时/永久授权 | 可选择授予一次性或永久访问权 |
| 企业管理员控制 | 管理员可设置用户能访问哪些连接器 |
客户指南:保护数据安全的步骤,涵盖访问权限、身份认证和数据隔离。
原则五:保障智能体交互的安全¶
主要威胁包括:
- 提示注入:攻击者诱导智能体忽略指令、泄露未授权信息或执行非预期操作
- 利用工具或子智能体中的漏洞
防御措施:
| 防御层 | 详情 |
|---|---|
| 分类器 | 使用分类器检测和防范滥用 |
| 安全层 | 其他安全防护层 |
| 威胁情报 | 专门的威胁情报团队持续监控 |
| 组织指南 | 为组织提供降低风险的指导 |
| MCP 审核目录 | Anthropic 审核的 MCP 目录,具有安全、安全性和兼容性标准 |
展望¶
该框架将随时间持续修订。Anthropic 认为智能体"在工作、教育、医疗保健和科学发现方面拥有巨大的积极影响潜力。"