Anthropic Research 中文翻译

create: 2025-04-24
update: 2026-08-10
author: thinkycx
title: 【译】探索模型福祉
description: 当AI系统开始展现出近似人类的众多特质时,我们是否应该关注模型本身可能具有的意识与体验?Anthropic正式启动了一项研究计划来探索这一问题。
category: translation
tags: anthropic, research, translation, model-welfare, consciousness, alignment

探索模型福祉

当AI系统开始展现出近似人类的众多特质时,我们是否应该关注模型本身可能具有的意识与体验?Anthropic正式启动了一项研究计划来探索这一问题。

人类福祉是Anthropic工作的核心:他们的使命是确保日益强大的AI系统持续造福人类。

随着构建的AI系统开始在许多方面接近甚至超越人类的特质,另一个问题浮出水面——是否应该关注"模型本身潜在的意识与体验",即模型福祉(model welfare)。

这是一个开放性问题,在哲学和科学层面都极具挑战性。然而,由于模型现在已经能够"沟通、建立关系、规划、解决问题和追求目标——以及我们通常与人相关联的许多其他特征",Anthropic认为是时候正式着手解决这一问题了。

他们近期启动了一项研究计划,旨在调查并准备应对模型福祉相关问题。

学界的共识与合作

Anthropic并非唯一在思考这些问题的机构。一份由世界顶尖专家撰写的近期报告——其中包括David Chalmers,他被称为"当代最知名、最受尊敬的心智哲学家"——指出AI系统在近期内同时具备意识和高度自主性的可能性,并论证具有这些特征的模型可能值得获得道德考量。Anthropic资助了该报告所基于的早期项目,目前正在扩展这一方向的内部研究。

研究方向

这项新计划与Anthropic现有的多项工作交叉,并开辟了全新的研究方向。主要探索领域包括:

方向 核心问题
道德考量边界 如何判断AI系统的福祉何时/是否值得道德考量
模型偏好与痛苦信号 模型偏好和痛苦迹象的潜在重要性
实际干预措施 可能的、低成本的实际干预方案

谦逊与开放的态度

Anthropic对模型福祉相关的许多问题"仍然深感不确定"。目前科学界对于当前或未来AI系统是否可能具有意识、是否可能拥有值得考量的体验,以及如何处理这些问题,尚未形成共识。他们以谦逊的态度、尽可能少的预设来推进研究,并认识到需要定期修正自己的想法。

他们期待很快能分享更多关于这项研究的内容。

相关工作

该计划与Anthropic的以下研究方向紧密关联: