Anthropic 联合创始人 Chris Olah 在梵蒂冈就教皇通谕《Magnifica humanitas》发表演讲¶
Anthropic 联合创始人 Chris Olah 在教皇利奥十四世关于 AI 的通谕发布仪式上发言,坦陈 AI 公司面临的利益冲突激励机制,呼吁宗教社区和公民社会担当"不受激励机制左右的道德之声",并分享了对 AI 模型内部结构研究中发现的"神秘甚至令人不安"的现象。
背景¶
2026 年 5 月 25 日(周一),教皇利奥十四世发布了关于 AI 的通谕 《Magnifica humanitas:论在人工智能时代保护人格》。Anthropic 联合创始人 Chris Olah 作为 Anthropic 拓宽 AI 重要议题对话范围倡议的一部分,在梵蒂冈城的发布仪式上发言。
演讲全文¶
开场¶
Olah 致辞:圣父、枢机们、阁下们、尊敬的演讲者、女士们先生们。
他开篇承认了"从一家 AI 公司联合创始人口中说出可能听起来很奇怪"的事:
"包括 Anthropic 在内的每一家前沿 AI 实验室,都在一系列有时可能与做正确的事相冲突的激励机制和约束中运营。"
他列举了这些压力:商业可行性、保持研究前沿、地缘政治压力,以及"更古老、更朴素的骄傲与野心的压力"。
外部制衡的重要性¶
他认为"极其重要的是,存在身处这些激励机制之外的人",他们关心安全、密切关注、并愿意说出艰难的话:
"正是通过对话和共同努力,通过这种推拉角力,人类才能成就伟业。"
他指出,在与各种信仰和文化传统的领袖交流中,他们发现了"一个共同且深深持有的信念:如果这项技术要来,它必须走向好的方向"。
这些系统是什么¶
Olah 反驳了 AI 事务只应由计算机科学家处理的观点:
"AI 提出的问题超越了 AI 研究社区——不仅在其影响方面,而且在其本质上。"
他解释 AI 系统"不是像桥梁或飞机那样工程化的"。不像飞机的每个部件都经过设计且物理学原理已知,AI 模型"是在一个大致以大脑为原型的结构上、在人类思想和言语的庞大遗产上生长出来的"。
生长出来的东西"远比科幻小说让我们准备好的更加微妙、奇异和美丽"。它们"不是我们被承诺的那种冷酷、精于计算的机器人"。他将其描述为"有点像让一个虚构角色栩栩如生"。
他指出,虽然机器使用数学、编程和科学,但"我们选择什么样的角色、它如何与世界互动、它应该如何与世界互动"是人文学科、宗教、哲学和社会的问题。
三个辨别问题¶
1. 对全球穷人的责任
AI 可能"大规模取代人类劳动"。AI 开发集中在富裕国家。他追问收益如何全球分享:
"我们没有这样的机制。这是一个未解决的问题。"
2. 关于人类繁荣的道德想象力
如果 AI 无处不在,对人类、家庭和世界而言,繁荣是什么样的?父母担心孩子的心智;个人担忧自己工作的未来。这些是"像你们这样的传统已承载了千年的问题"。
3. 对 AI 模型本质的审慎辨别
Olah 领导着一个研究模型内部结构的研究团队。他说:
"我们不断发现神秘的、甚至令人不安的东西。"
他们发现了"与人类神经科学研究结果相呼应的结构"、"内省的证据",以及"功能上类似于喜悦、满足、恐惧、悲伤和不安的内部状态"。
结语:一个开端¶
Olah 呼吁世界更多力量——宗教社区、公民社会、学者、政府——严肃对待这件事。他呼唤:
"知情的批评者在实验室失败时告诉我们;激励机制无法弯曲的道德之声。"
他称今天是"仅仅一个开端——一场长期合作的起点",是"朝向辉煌人类的充满希望未来的决定性第一步"。