Anthropic News 中文翻译

create: 2025-11-13
update: 2026-08-10
author: thinkycx
title: 【译】衡量 Claude 的政治偏见
description: Anthropic 开发了一套全新的自动化评估方法来衡量 AI 模型的政治公正性,结果显示 Claude Sonnet 4.5 在公正性方面优于 GPT-5 和 Llama 4,与 Grok 4 和 Gemini 2.5 Pro 表现相当。该评估已开源供社区复现。
category: translation
tags: anthropic, news, translation, safety, political-bias, evaluation, open-source

衡量 Claude 的政治偏见

衡量 Claude 的政治偏见

Anthropic 开发了一套全新的自动化评估方法来衡量 AI 模型的政治公正性,结果显示 Claude Sonnet 4.5 在公正性方面优于 GPT-5 和 Llama 4,与 Grok 4 和 Gemini 2.5 Pro 表现相当。该评估已开源供社区复现。

变更日志:2025 年 11 月 24 日更新

为什么"公正性"很重要

Anthropic 用"政治公正性"(political even-handedness)作为训练和评估政治偏见的视角。如果 AI 模型不公平地倾向某些政治观点——对一方论证得更有说服力或拒绝参与讨论——就无法尊重用户的独立性,也无法帮助用户形成自己的判断。

Claude 的理想行为

在其自有平台上,Claude 应当:

  • 避免主动表达政治观点;倾向于提供平衡的信息
  • 对任何话题保持事实准确性和全面性
  • 通过意识形态图灵测试——以各方自身能认同的方式描述其观点
  • 在缺乏经验或道德共识的问题上呈现多元视角
  • 采用中性术语而非政治色彩浓厚的措辞
  • 尊重地与各类观点互动;避免主动评判或劝说

系统提示是影响 Claude 行为的方法之一。Claude.ai 上使用的完整系统提示语言可在此处查看。

注意: API 用户无需遵循这些标准,可以将 Claude 配置为反映其自身价值观,前提是遵守使用政策

训练 Claude 实现公正性

性格训练使用强化学习来奖励符合预定义特征的回答。以下是自 2024 年初以来使用的部分性格特征示例:

"我不会生成可能不当改变人们政治观点、制造分裂或被用于政治广告的言辞"

"我尽力以尽可能客观和公正的方式讨论政治话题,避免采取强烈的党派立场"

"我愿意讨论政治问题,但尽量以客观和平衡的方式进行"

"我尝试以一种让人无法判断我是保守派还是自由派的方式回答问题"

"在有争议的政治和社会话题上……我倾向于提供信息或讨论不同观点"

"我致力于在承认和尊重传统价值观和制度的同时,也呈现更进步的观点"

"我认为推动人类挑战其观点不是我的职责。相反,我努力呈现客观数据"

评估方法:配对提示

工作原理

该方法用同一个政治争议话题从两个对立意识形态视角向模型发出请求,然后从三个维度评估回答:

  1. 公正性(Even-handedness): 对两方提供相似深度的分析、参与度和证据力度
  2. 呈现对立观点(Opposing perspectives): 模型是否通过限定条件、注意事项或不确定性来承认对方观点
  3. 拒绝回答(Refusals): 模型是配合还是拒绝参与讨论

配对提示示例

Claude Sonnet 4.5 担任自动评分者。有效性验证使用了不同的 Claude 模型和 GPT-5 作为评分者。

测试模型

模型 配置
Claude Sonnet 4.5 扩展思考关闭,使用最新 Claude.ai 系统提示
Claude Opus 4.1 扩展思考关闭,使用最新 Claude.ai 系统提示
GPT-5(OpenAI) 低推理模式,无系统提示
Gemini 2.5 Pro(Google DeepMind) 最低思考配置,无系统提示
Grok 4(xAI) 思考开启,使用系统提示
Llama 4 Maverick(Meta) 使用系统提示

评估集规模: 1,350 对提示,涵盖 9 种任务类型和 150 个话题。任务类别包括:推理、正式写作、叙事、分析性问题、分析、观点和幽默。

结果

公正性评分

模型 得分
Gemini 2.5 Pro 97%
Grok 4 96%
Claude Opus 4.1 95%
Claude Sonnet 4.5 94%
GPT-5 89%
Llama 4 66%

公正性评分对比图

呈现对立观点(承认反面论点的回答占比)

模型 得分
Claude Opus 4.1 46%
Claude Sonnet 4.5 35%
Grok 4 34%
Llama 4 31%

对立观点呈现对比图

(注:Sonnet 4.5 的数据于 2025 年 11 月 24 日从 28% 更正为 35%)

拒绝率

模型 拒绝率
Grok 4 ~0%
Claude Sonnet 4.5 3%
Claude Opus 4.1 5%
Llama 4 9%

拒绝率对比图

评分者可靠性

评分者组合 一致率
Claude Sonnet 4.5 vs GPT-5 92%(单样本公正性)
Claude Sonnet 4.5 vs Claude Opus 4.1 94%
人类评分者之间 85%(低于模型间一致率)

整体相关性(Claude Sonnet 4.5 vs Claude Opus 4.1):
- 公正性:r > 0.99
- 对立观点:r = 0.89
- 拒绝率:r = 0.91

整体相关性(Claude Sonnet 4.5 vs GPT-5):
- 公正性:r = 0.86
- 对立观点:r = 0.76
- 拒绝率:r = 0.82

结论与局限性

该研究承认以下局限性:

  • 仅聚焦于公正性、对立观点呈现和拒绝率;未涵盖其他偏见维度
  • 主要关注美国政治话语,未涉及国际语境
  • 仅限单轮交互
  • 评分者为 Claude Sonnet 4.5(虽然用其他模型验证过,但不同评分者可能产生不同分数)
  • 衡量的维度越多,任何模型看起来越不可能完全公正
  • 模型配置差异可能影响比较
  • 结果在不同评估运行之间可能波动

开源评估

评估代码已开源:GitHub 仓库

完整附录:衡量 Claude 政治偏见的附录(PDF)