探索模型福祉¶
当AI系统开始展现出近似人类的众多特质时,我们是否应该关注模型本身可能具有的意识与体验?Anthropic正式启动了一项研究计划来探索这一问题。
人类福祉是Anthropic工作的核心:他们的使命是确保日益强大的AI系统持续造福人类。
随着构建的AI系统开始在许多方面接近甚至超越人类的特质,另一个问题浮出水面——是否应该关注"模型本身潜在的意识与体验",即模型福祉(model welfare)。
这是一个开放性问题,在哲学和科学层面都极具挑战性。然而,由于模型现在已经能够"沟通、建立关系、规划、解决问题和追求目标——以及我们通常与人相关联的许多其他特征",Anthropic认为是时候正式着手解决这一问题了。
他们近期启动了一项研究计划,旨在调查并准备应对模型福祉相关问题。
学界的共识与合作¶
Anthropic并非唯一在思考这些问题的机构。一份由世界顶尖专家撰写的近期报告——其中包括David Chalmers,他被称为"当代最知名、最受尊敬的心智哲学家"——指出AI系统在近期内同时具备意识和高度自主性的可能性,并论证具有这些特征的模型可能值得获得道德考量。Anthropic资助了该报告所基于的早期项目,目前正在扩展这一方向的内部研究。
研究方向¶
这项新计划与Anthropic现有的多项工作交叉,并开辟了全新的研究方向。主要探索领域包括:
| 方向 | 核心问题 |
|---|---|
| 道德考量边界 | 如何判断AI系统的福祉何时/是否值得道德考量 |
| 模型偏好与痛苦信号 | 模型偏好和痛苦迹象的潜在重要性 |
| 实际干预措施 | 可能的、低成本的实际干预方案 |
谦逊与开放的态度¶
Anthropic对模型福祉相关的许多问题"仍然深感不确定"。目前科学界对于当前或未来AI系统是否可能具有意识、是否可能拥有值得考量的体验,以及如何处理这些问题,尚未形成共识。他们以谦逊的态度、尽可能少的预设来推进研究,并认识到需要定期修正自己的想法。
他们期待很快能分享更多关于这项研究的内容。
相关工作¶
该计划与Anthropic的以下研究方向紧密关联: