前沿AI开发透明度框架:Anthropic的政策提案¶

Anthropic 提出了一个适用于联邦、州或国际层面的"定向透明度框架",仅适用于最大规模的AI系统和开发者,要求公开披露安全实践,同时保持私营部门的灵活性。
为什么前沿AI需要更高的透明度¶
前沿AI开发需要更高的透明度,以确保公共安全以及开发公司的问责。Anthropic CEO 此前在《纽约时报》的评论文章中阐述了对监管和透明度的看法。AI正在快速发展,虽然各方利益相关者正致力于开发安全标准和评估方法——这一过程可能需要数月甚至数年——但目前需要采取过渡性措施。
Anthropic 提出了一项定向透明度框架,可适用于联邦、州或国际层面,仅针对最大规模的AI系统和开发者,提出明确的安全实践披露要求。
这一方案避免了过于规范化的做法,承认AI科学仍在持续演进,监管必须保持轻量和灵活。
"它不应阻碍AI创新,也不应减缓我们实现AI益处的能力——包括拯救生命的药物发现。"
文章指出,由于技术变革导致评估方法"在几个月内就会过时",政府强加的僵化标准将适得其反。参见 Stanford HAI 的研究。
AI透明度框架的六项核心原则¶
1. 仅适用于最大规模的模型开发者¶
AI透明度要求应仅适用于构建最强大模型的最大型前沿模型开发者。前沿模型通过以下多项指标的组合来界定:
- 计算能力
- 计算成本
- 评估性能
- 年收入
- 研发投入
框架应包含对较小开发者的适当豁免。Anthropic 欢迎创业社区就阈值设定提供意见。
| 指标 | 建议阈值 |
|---|---|
| 年收入 | 约 1亿美元 |
| 研发或资本支出 | 约每年 10亿美元 |
这些范围阈值应定期审查。
2. 建立安全开发框架¶
要求相关前沿模型开发者建立安全开发框架(Secure Development Framework),阐明如何评估和减轻不合理的风险。风险类别必须包括:
- 化学危害
- 生物危害
- 放射性危害
- 核危害
- 模型自主性失控造成的危害
3. 公开安全开发框架¶
安全开发框架应在AI公司维护的面向公众的网站上公开披露,对敏感信息可进行合理的编辑保护。披露应附带合规自我认证声明。
4. 发布系统卡片(System Card)¶
系统卡片或其他文档应概述:
- 测试和评估程序
- 结果
- 所需的缓解措施(可适当编辑)
系统卡片应在部署时公开披露,如果模型进行了实质性修改则应更新。
5. 通过禁止虚假陈述来保护举报人¶
明确规定,实验室就其框架合规性撒谎属于违法行为。这创造了一个明确的法律违规点,启用现有的举报人保护机制,并确保执法聚焦于蓄意违规的实验室。
6. 透明度标准¶
可行的框架应具有最低标准,在增强安全性和公共安全的同时适应不断发展的AI开发。标准应从灵活、轻量的要求开始,随着行业最佳实践共识的形成而调整。
行业对比:类似的安全框架¶
安全开发框架类似于 Anthropic 自己的负责任扩展政策(Responsible Scaling Policy),以及其他公司的类似框架:
| 公司 | 框架名称 |
|---|---|
| Anthropic | 负责任扩展政策 |
| Google DeepMind | 前沿安全框架 |
| OpenAI | 准备框架 |
| Microsoft | 前沿治理框架 |
将安全开发框架透明度要求写入法律,将标准化行业最佳实践而不使其僵化,并确保自愿披露不会在模型变得更强大时被撤回。
结论¶
"我们提出的透明度框架提供了一个务实的第一步:"在保持私营部门灵活性的同时,为安全实践提供公众可见性。
文章警告,如果没有安全的开发,"一次灾难性的失败可能使进展倒退数十年。"