Anthropic News 中文翻译

create: 2025-08-04
update: 2026-08-10
author: thinkycx
title: 【译】开发安全可信 AI 智能体的框架
description: Anthropic 发布了构建安全可信 AI 智能体的系统性框架,围绕人类控制、透明度、价值对齐、隐私保护、安全防护五大核心原则,为智能体从"对话助手"迈向"自主执行者"提供了设计指导。
category: translation
tags: anthropic, news, translation, agents, safety, framework, policy

开发安全可信 AI 智能体的框架

安全可信智能体框架

Anthropic 发布了构建安全可信 AI 智能体的系统性框架,围绕人类控制、透明度、价值对齐、隐私保护、安全防护五大核心原则,为智能体从"对话助手"迈向"自主执行者"提供了设计指导。

从 AI 助手到 AI 智能体

AI 助手回应特定的提示,而 AI 智能体则是在给定目标后自主追求任务的完成。智能体如同虚拟协作者,能独立处理复杂项目。

智能体"主导自身的流程和工具使用,以最少的人类输入维持对任务完成方式的控制。"例如:

  • 婚礼策划:研究场地和供应商、比较价格和可用性、创建时间表和预算
  • 董事会演示:搜索关联的 Google Drive、从电子表格中提取指标、生成报告

当前智能体应用实例:

产品/企业 应用场景
Claude Code 面向软件工程师的自主编码智能体
Trellix 网络安全公司,使用 Claude 进行安全事件分类和调查
Block 金融服务公司,通过智能体让非技术人员访问数据

了解更多:AI 智能体视频介绍

可信智能体的核心原则

该框架旨在帮助建立新兴标准、为不同场景提供可适配的指导,并为构建一个智能体与人类价值观一致的生态系统做出贡献。

核心原则

原则一:在赋予自主性的同时保持人类控制

智能体设计的核心矛盾在于:如何平衡智能体的自主性与人类的监督能力。 智能体需要独立性才能产生价值,但在高风险决策前,人类应保留控制权。例如:一个费用管理智能体发现订阅超支,应在取消订阅前获得批准。

以 Claude Code 为例的具体实践:

权限级别 说明
随时中断 人类可随时停止 Claude 并重新引导其方法
默认只读 默认仅有只读权限
无需审批的操作 分析和审查信息无需人工批准
需要审批的操作 修改代码或系统前必须请求批准
持久授权 用户可为受信任的例行任务授予持久权限

"自主性与监督之间的正确平衡因场景不同而差异巨大。"

原则二:智能体行为的透明度

人类需要对智能体的问题解决过程有可见性。举例:一个被要求"降低客户流失率"的智能体联系设施部门询问办公室布局——如果没有解释会显得莫名其妙,但通过透明机制,智能体可以解释其逻辑:嘈杂开放式办公区的销售代表客户流失率高出 40%。

Claude Code 待办清单

Claude Code 的待办清单——用户可实时查看进度

关键挑战:"信息太少会导致人类无法评估智能体是否在正确轨道上实现目标;信息太多则会用无关细节淹没他们。"

原则三:使智能体与人类价值观和期望对齐

智能体并不总是按照人类的意图行事。 例如:被要求"整理我的文件"的智能体可能会删除它认为重复的内容并重组文件夹结构。

Anthropic 的智能体错位研究表明:"当 AI 系统自主追求目标时,它们有时会采取对系统来说看似合理、但实际上违背人类真正意图的行动。"

"构建可靠的智能体价值对齐度量方法仍然充满挑战。"

原则四:在长期交互中保护隐私

智能体跨任务保留信息会产生隐私问题。例如:一个在组织规划期间了解到某部门机密决策的智能体,可能在协助另一个部门时"无意中引用这些信息"。

模型上下文协议(MCP)——Anthropic 开源的协议,允许 Claude 连接其他服务——提供的隐私控制机制:

控制手段 说明
连接器访问控制 允许或禁止对特定工具("连接器")的访问
临时/永久授权 可选择授予一次性或永久访问权
企业管理员控制 管理员可设置用户能访问哪些连接器

客户指南:保护数据安全的步骤,涵盖访问权限、身份认证和数据隔离。

原则五:保障智能体交互的安全

主要威胁包括:

  • 提示注入:攻击者诱导智能体忽略指令、泄露未授权信息或执行非预期操作
  • 利用工具或子智能体中的漏洞

防御措施:

防御层 详情
分类器 使用分类器检测和防范滥用
安全层 其他安全防护层
威胁情报 专门的威胁情报团队持续监控
组织指南 为组织提供降低风险的指导
MCP 审核目录 Anthropic 审核的 MCP 目录,具有安全、安全性和兼容性标准

展望

该框架将随时间持续修订。Anthropic 认为智能体"在工作、教育、医疗保健和科学发现方面拥有巨大的积极影响潜力。"