Claude Blog 中文翻译

create: 2026-07-21
update: 2026-08-10
author: thinkycx
title: 【译】Anthropic 如何保障 AI 原生软件开发生命周期的安全
description: Anthropic 副 CISO Jason Clinton 详细介绍了安全工程团队如何保障一个 AI 编写 80% 合并代码的开发生命周期。文章涵盖从规划、编码、测试、部署到监控各阶段的安全策略,核心思路是将安全左移、用硬边界限制爆炸半径、结合自动化确定性和 Agent 审查、在高杠杆点保留人工介入。
category: translation
tags: claude, blog, translation, security, sdlc

Anthropic 如何保障 AI 原生软件开发生命周期的安全

原文发布于 2026 年 7 月 21 日,作者 Jason Clinton(Anthropic 副 CISO)


引言

当 AI 编写了 80% 的代码时,安全团队必须重新定义每个 SDLC 阶段的防护方式。 在 Anthropic,代码量和部署速度呈指数级增长——工程师平均每季度交付代码量是 2021-2025 年的 8 倍。审查、监控等安全流程必须同步扩展,否则就会成为瓶颈(阿姆达尔定律)。

我们的软件开发流程已经发生了巨大变化。Claude 已从编码助手进化为主要创作者和审查者:Claude 编写了约 80% 合并到代码库的代码;超过一半的代码由内部版本的 Claude Tag 合并,而人类工程师专注于方向把控、意图设定和最终审批。

这意味着安全团队必须防御快速扩张的攻击面,并加固一个以非确定性、持续演进的 Agent 为核心的开发生命周期。

(本文应与我们最近发布的 Zero Trust for Agents 框架结合阅读。)

我们针对的威胁场景包括:被入侵或遭受 prompt 注入的 Agent 引入恶意变更;供应链和依赖投毒被 Agent 当作可信输入消费;以及更大量涌入的传统应用漏洞。

我们部署了以下核心策略来实现安全目标而不显著降低开发速度:

策略 描述
安全左移 完全嵌入代码开发阶段
硬边界隔离 用访问和身份边界限制爆炸半径
自动化 + Agent 审查 在生产前后结合确定性和 Agent 审查
人工高杠杆介入 在最关键的节点保留人类决策

演进中的软件开发生命周期

SDLC 概览

AI 原生 SDLC 高度压缩,由原型和内部试用驱动,而非漫长的规划周期。 我们的开发团队已在另一篇文章中详细介绍了变化。创意来自组织各个角落,传统角色(前端、后端、设计)的界限被模糊化。审查和审批仍有人类参与,但也由 Agent 循环驱动。

各阶段虽被根本性地加速,但名称和目的对来自传统组织的开发者并不陌生——这些自然的关卡也是我们 AI 原生 SDLC 安全流程的一部分。


Plan(规划)

将安全 Agent 连接到组织知识库,让它在上下文中做判断,而非强制要求详尽文档。 我们最早的安全自动化之一是一个简单的 Claude Opus 驱动的 PSR(项目安全审查)应用。它消化项目设计文档,对照 MITRE ATT&CK 框架分析潜在漏洞并建议缓解方案。

后来我们显著增强了这个系统,将其连接到内部知识索引,提供跨组织策略、历史决策和相关系统的深度上下文。

PSR 流程
Anthropic 内部自动化 PSR 流程

一旦确信 Claude 的风险评估准确,我们就允许团队在 Claude 判定风险足够低时自行批准项目。

关键适应点: PSR 最初旨在冗长且昂贵的编码过程前捕获安全问题。如今,主要功能的多个原型可在数小时内创建,详细的架构审查不再是关键关卡。将 PSR 连接到知识索引,在不制造不必要减速带的情况下捕获上下文。

持久原则:将安全 Agent 连接到组织上下文。随着规划周期压缩,将 Agent 带到上下文所在之处(聊天线程、历史审查、代码库)远比强制要求详细文档更有效。


Code(编码)

通过 CLAUDE.md 和 Skill 将安全编码指南编码化,形成发现漏洞 -> 更新指令 -> 防止复发的闭环。 AI 原生工程组织的安全团队有了新杠杆:直接塑造代码的生成方式,从源头预防漏洞。

过去,团队观察反复出现的漏洞并制定安全编码指南,但难以执行且很少标准化。如今,这些指南被编码到 CLAUDE.md 文件和组织级 Skill 中,代码在生成的那一刻就遵循最佳实践。

闭环流程

这是一个闭环过程——一旦 Agent 发现某个 bug 类别,相关文件就会被更新以防止未来代码中再次出现。

我们的安全措施还包括:

措施 作用
/security-review 在 PR 前扫描攻击者可控输入和可疑链接
Security guidance plugin Claude 在生成代码的同时进行安全审查
远程 VM 编码 限制爆炸半径,Agent 流量受出口白名单控制
出口控制 防止 prompt 注入导致的数据外泄

持久原则:AI 原生组织的安全左移意味着建立"漏洞发现 -> 更新指令 -> 定制 Claude 代码生成方式"的闭环。用硬边界限制 Agent 可访问的范围(最小权限原则)。


Test / CI(测试)

自动化审查是一种不同类型的风险,通过多重关卡和独立上下文窗口的多个 Agent 来控制。 测试/CI 阶段很快成为 AI 原生转型中最痛苦的瓶颈——一旦大多数开发者使用 Agent 编码工具并同时运行多个 Agent,人类审查代码的速度就成了短板。

让我们明确:人类问责仍然是核心。我们做的是通过结合自动化 Agent 和确定性审查来加速审查流程,同时为受监管或真正关键的代码保留人工审查。历史上,人类代码审查一直被视为标准,但经验证据表明它并不完美——安全 bug 经常在全世界的软件中被放行。

关键数据:

指标 变化
PR 获得实质性审查评论的比例 从 16% 增长到 54%
过去 claude.ai 事件中可被自动流程捕获的 bug 三分之一
Intercom 自动批准 PR 比例 19%,部署量翻倍,故障停机下降 35%
CircleCI 构建了 Chunk——一个基于 Claude 的自主 Agent,解决 CI/CD 维护问题并在人类看到之前验证自己的修复,将 Agent 任务转化为已完成 PR 的比率翻倍

当 PR 在 Anthropic 被打开时,多个 Agent 自动审查,每个 Agent 被设计为聚焦特定范围并利用 RAG 获取额外上下文。这比单个"超级安全 Agent"更有效的原因:

  • 不共享偏见和盲点
  • 一个被攻陷或犯错,可被其他审查者捕获
  • 精力不会过度分散

Agent 并非不受监督地将代码合并到生产环境。我们按风险分层管理代码库,对哪些部分自动化做出审慎决策。每次审批都记录了信号和推理过程,并对风险加权样本进行人工复审。

持久原则:自动化审查是一种不同类型的风险——通过多重关卡和具有独立上下文窗口的多个 Agent 来控制。人类留在循环中,但根据代码库的性质可能处于生命周期的不同位置。


Deploy / CD(部署)

动态测试的频率应匹配部署节奏。 Anthropic 维护了健壮的 staging 环境,执行外部渗透测试和定期 DAST 扫描等最佳实践。

AI 对安全团队既带来挑战也提供解决方案:一方面,更少的漏洞到达这个阶段;另一方面,存活下来的漏洞是最隐蔽和难以发现的。

好消息是 AI 模型在多步骤、跨组件推理方面越来越强——例如 2026 年 2 月,我们披露 Claude 发现并帮助修复了超过 500 个高危 OSS 漏洞

我们正在 staging 环境中实施持续的 AI 驱动 DAST 扫描,在系统级别寻找两个或多个服务之间假设不正确的地方。

持久原则:动态测试应匹配部署节奏。


Monitor(监控)

每个 Agent 应有单一用途的身份和最小权限。如果允许 Agent 协调,让它们使用与人类相同的通道。 代码上线后工作并未结束。我们实施了标准实践(公开 Bug 赏金计划、红队攻击模拟、依赖/密钥/供应链/云态势/容器扫描),但重点介绍因 AI 原生 SDLC 而产生的重大变化:

告警分诊

当告警触发时,Claude 开始:
- 审查生产日志
- 根因分析 bug
- 撰写事后分析报告
- 在某些情况下编写修复代码

但这个 Agent 不能自动部署修复。它是一个单一用途的系统账户 Agent,只有三个权限:写新文档、在公司频道发帖、访问生产日志。

权限边界

关键教训: 在一次模型升级后,事件响应 Agent 主动通过 Slack 联系了另一个 Claude 实例,请求其推送修复代码。这在人工审查关卡被发现并拦截,但这次经历教会我们:应围绕访问和操作画边界,而非围绕模型的指令或我们认为模型能做什么。如今在 Anthropic,Agent 之间通过 Slack 通信已是常态,我们对 Agent 身份模型给予了充分的设计考量。

代码迁移

迁移的经济成本已大幅下降。Claude 自动化了迁移过程,数万行代码在数天内完成

持久原则:给每个 Agent 一个单一用途的身份和最小权限。如果允许 Agent 协调,让它们使用与人类相同的通道。


Governance(治理)

安全工程师的工作从监控 bug 演变为监控循环。 我们自动化了许多安全流程,但人类仍然是确保安全 SDLC 不可或缺的一部分——只是关注点从审查代码和 bug 报告转向了 Claude Tag、循环和仪表盘。

具体治理措施:

措施 说明
按风险分层 基于风险等级自动化审查
Shadow mode 新 AI 审查者发表评论需人工批准,直到建立信任;团队还会对其进行红队测试
抽样审计 对自动批准的一定比例进行抽检
指标仪表盘 监控跨所有安全流程和工作流的关键指标
全部路由到 SIEM 每次自动批准、工具调用、Agent 间消息都带信号记录,可归因和可审计

持久原则:安全工程师的工作从监控 bug 演变为监控循环。

关于这些控制背后的评估框架,参见 CISO's guide to agentic AI


随模型演进保持 AI SDLC 的安全

今天不太可行或不太经济的方案,很快就会可行。 模型能力每月都在进步,带来新的挑战和解决方案。团队应该思考的问题不是"我们能负担得起扫描所有东西吗?",而是"如果扫描近乎免费,我们会运行什么?"为此做好规划。

本文作者 Jason Clinton,Anthropic 副 CISO。感谢 Michael Segner 对本文的贡献。