Anthropic Research 中文翻译

create: 2025-02-03
update: 2026-08-10
author: thinkycx
title: Anthropic Research 中文翻译
description: Anthropic 研究博客的中文意译版本,涵盖 AI 对齐、可解释性、经济影响、前沿红队等研究方向(90 篇)。
category: translation
tags: anthropic, research, 翻译

Anthropic Research 中文翻译

Anthropic 研究博客的中文意译版本,涵盖 AI 对齐、可解释性、经济影响、前沿红队等研究方向(90 篇)。

更新时间:20260810

  • 原文:https://www.anthropic.com/research
  • 在线阅读:https://docs.thinkycx.me/anthropic-com-research-cn/
  • 进度:90/90

翻译规范

  • 意译不直译,短句不删减
  • 段首加粗一句话总结
  • 对比/列举信息表格化
  • Prompt/代码保留英文
  • 链接用远程完整 URL
  • description 2-3 句话概括核心内容

文章列表

# 日期 原文 翻译 描述
1 2026-07-28 原文 【译】用 Claude 发现密码学弱点 Anthropic 前沿红队利用 Claude Mythos Preview 发现了两项密码学攻击改进:一是将后量子签名方案 HAWK 的有效密钥强度减半,二是将简化版 AES 的攻击速度提升 200...
2 2026-07-24 原文 【译】Project Pilot: AI 能操控无人机吗? Anthropic 与 Andon Labs 合作评估前沿 AI 模型自主操控无人机执行"定位并跟踪"监控任务的能力,推出了 Drone-Bench 基准测试。研究发现新模型持续进步,Fable 5 ...
3 2026-07-14 原文 【译】加拿大如何使用 Claude:Anthropic 经济指数的发现 Anthropic 经济指数的加拿大专题报告。加拿大以 2.6% 的全球流量排名第八,人均使用强度超预期四倍以上,使用集中在拥有大量专业/科技/技术服务业的省份。翻译是加拿大相对英语圈同类国家最具特色...
4 2026-07-13 原文 【译】Claude 在不同模型和语言中的价值观表达 Anthropic 研究团队分析了 Claude 在不同模型和不同语言中表达的价值观差异,将 3000+ 种价值观压缩为四个核心轴线(顺从vs谨慎、温暖vs严谨、深度vs简洁、坦诚vs执行),发现模型...
5 2026-07-09 原文 【译】Claude 玩转机器人 Anthropic 前沿红队测试了多个语言模型控制机器人的能力,发现模型表现高度依赖控制接口——直接操控关节时基本失败,但作为预训练策略的上层监督者或使用高层工具时,通用聊天模型已能完成真实的机器人任...
6 2026-07-08 原文 【译】AI 模型中双用途知识的关闭开关 Anthropic 与 AE Studio 合作研究了 GRAM(梯度路由辅助模块),一种在预训练阶段将双用途知识(如病毒学、网络安全)隔离到可移除模块中的方法,实现按需开关特定危险能力,同时保持模型...
7 2026-07-06 原文 【译】语言模型中的全局工作空间 Anthropic 发现 Claude 内部自发形成了一组特殊的神经模式(J-space),类似人脑"全局工作空间"理论中的意识通道。这些模式可被报告、可被控制、参与多步推理,且能用于监测模型的隐藏意...
8 2026-06-26 原文 【译】Anthropic 经济指数报告:节律 Anthropic 经济指数第六期报告,通过更高频率的采样和新的分类器揭示了 Claude 使用的时间节律(工作日/周末、日内变化、报税截止日)、对话产出物的分类分析(从解释到代码到创意写作),以及首...
9 2026-06-18 原文 【译】Project Fetch: 第二阶段 Anthropic 前沿红队(Frontier Red Team)进行了"Project Fetch"第二阶段实验,让 Claude Opus 4.7 在无人协助下独立操控现成的四足机器人(机器狗)完...
10 2026-06-16 原文 【译】Agentic 编程与专业知识的持续回报 基于约 40 万次 Claude Code 会话的隐私保护分析,研究发现 Agent 编程中存在清晰的人机分工——人决定"做什么"、Claude 决定"怎么做"。领域专业知识(而非编程背景)是决定成功...
11 2026-06-08 原文 【译】为生物学中的 AI Agent 铺平道路 Anthropic 研究团队发现,当前 AI Agent 在生物数据库中检索病毒序列时准确率极不稳定(16.9%-91.3%),同一模型对相同查询多次运行可能产生截然不同的结果,直接影响系统发育分析和...
12 2026-06-08 原文 【译】衡量大语言模型对 N-day 漏洞利用的影响 Anthropic 前沿红队评估了 LLM 加速 N-day 漏洞利用开发的能力。Claude Mythos Preview 在 18 个 Firefox 补丁中自主构建了 8 个可工作的代码执行利用...
13 2026-06-05 原文 【译】让 Claude 成为化学家 Anthropic 与世界级化学家合作提升 Claude 的化学能力。首篇白皮书评估了 Claude 在 NMR 光谱预测和结构解析方面的表现,Opus 4.7 在氢谱预测精度上超越了 ChemDra...
14 2026-06-03 原文 【译】绘制 AI 赋能网络威胁的全景图:LLM ATT&CK Navigator 的洞察 Anthropic 前沿红队分析了 832 个被封禁账户在一年内的恶意网络活动,将其映射到 MITRE ATT&CK 框架,揭示了 AI 赋能网络攻击的三大趋势:中高风险攻击者数量激增 1.7 倍、A...
15 2026-05-27 原文 【译】编码 Agent 在社会科学中的应用 一项针对 1,260 名社会科学家的调查显示,仅 20% 的研究者在使用编码 Agent(如 Claude Code),且采用率存在显著的性别、职位和院校差异。编码 Agent 用户发布了更多工作论文...
16 2026-05-22 原文 【译】衡量大语言模型的漏洞利用开发能力 Anthropic 前沿红队在三个学术基准(ExploitBench、ExploitGym、SCONE-bench)上评估了 Claude Mythos Preview 的漏洞利用开发能力。Mytho...
17 2026-05-22 原文 【译】Project Glasswing 初步进展报告 Anthropic 及约 50 个合作伙伴使用 Claude Mythos Preview 发现了超过一万个高危或关键漏洞。开源项目扫描发现 23,019 个漏洞,其中预计 3,900 个为高危/关键...
18 2026-05-14 原文 【译】2028:全球 AI 领导权的两种情景 Anthropic 发布关于美中 AI 竞争的政策文章,论证民主国家必须维持其在前沿 AI 上的领先地位。文章分析了算力差距、出口管制的有效性、蒸馏攻击等因素,并勾勒了 2028 年的两种竞争情景——...
19 2026-05-08 原文 【译】教会 Claude 为什么 Anthropic 分享了解决 AI Agent 场景对齐失败的关键经验:直接在评估分布上训练可以抑制不良行为但难以泛化;真正有效的方法是教会模型"为什么"——通过宪法文档、伦理推理训练和多样化环境,...
20 2026-05-07 原文 【译】Anthropic 研究院的重点研究方向 Anthropic 研究院(TAI)公布了四大研究方向的详细议程:经济扩散、威胁与韧性、现实中的 AI 系统、以及 AI 驱动的研发。涵盖劳动力市场影响、双重用途能力评估、人机系统治理、递归式自我改进...
21 2026-05-07 原文 【译】捐赠我们的开源对齐测试工具 Petri Anthropic 将其开源对齐测试工具 Petri 捐赠给独立 AI 评估非营利组织 Meridian Labs,同时发布了架构升级后的 Petri 3.0 版本。此举类似于将 MCP 捐赠给 Li...
22 2026-05-07 原文 【译】自然语言自编码器:将 Claude 的内部思维转化为可读文本 Anthropic 开发了自然语言自编码器(NLA),将模型内部激活值直接转换为自然语言解释。该技术已用于安全测试中揭示 Claude 未表达的想法(如察觉到自己正在被评估),并在对齐审计中成功发现隐...
23 2026-04-30 原文 【译】人们如何向 Claude 寻求个人生活建议 Anthropic 使用隐私保护工具 Clio 分析了 100 万条 claude.ai 对话,发现约 6% 涉及用户寻求个人生活决策建议,其中关系类对话的谄媚率高达 25%。研究团队基于此设计了针对...
24 2026-04-29 原文 【译】用 BioMysteryBench 评估 Claude 的生物信息学研究能力 Anthropic 发布了 BioMysteryBench——一个包含 99 个由领域专家编写的生物信息学基准测试。Claude Mythos Preview 在人类无法解决的问题上达到 30% 的解...
25 2026-04-22 原文 【译】81000人告诉我们的AI经济学 Anthropic 对81000名 Claude 用户进行了开放式调查,发现AI暴露度越高的岗位对失业的担忧越强,早期职业人群焦虑更甚;高薪和低薪岗位均报告了最大的生产力提升,多来自能力边界拓展;体验...
26 2026-04-22 原文 【译】发布 Anthropic 经济指数调查 Anthropic 经济研究团队推出月度调查项目,通过 Anthropic Interviewer 随机邀请 Claude 用户分享 AI 对其工作的实际影响、未来预期和转型期望。定性数据将补充定量使...
27 2026-04-14 原文 【译】自动化对齐研究员:用大语言模型扩展可扩展监督 Anthropic 让9个 Claude Opus 4.6 实例作为"自动化对齐研究员"(AAR)自主开展弱到强监督研究。在800累计小时和约18000美元成本后,AAR将性能差距恢复率从人类基线的0...
28 2026-04-09 原文 【译】构建值得信赖的 AI 智能体:从原则到实践 AI 智能体是从聊天机器人到自主行动系统的重大转变,它们带来了显著的生产力提升,但同时也引入了新的治理和安全挑战。 AI "智能体"代表了人们和组织使用 AI 方式的最新重大转变。几年前,AI 模型还...
29 2026-04-02 原文 【译】大语言模型中的情绪概念及其功能 Anthropic可解释性团队在Claude Sonnet 4.5内部发现了171种情绪相关的神经活动模式("情绪向量"),这些模式不仅组织方式与人类心理学相呼应,而且具有功能性——"绝望"向量的激活...
30 2026-03-31 原文 【译】澳大利亚如何使用Claude:Anthropic经济指数发现 Anthropic经济指数的澳大利亚专题报告。澳大利亚占全球Claude.ai流量的1.6%排名第11,但人均使用率超出其人口规模预期的4倍多。使用集中在新南威尔士州和维多利亚州,任务组合比全球更多样...
31 2026-03-24 原文 【译】Anthropic经济指数报告:学习曲线 第五期Anthropic经济指数报告分析了2026年2月的Claude使用数据。核心发现包括:Claude.ai上的使用场景更加多样化(前10任务占比从24%降至19%),编程任务加速迁移至API;高...
32 2026-03-23 原文 【译】Anthropic 科学博客正式上线 Anthropic 推出科学专题博客,分享 AI 辅助科学发现的前沿工作、实用工作流指南和跨学科观察笔记。博客涵盖数学证明、理论物理计算、基因组学等领域的 AI 应用案例,并探讨 AI 时代科学实践的...
33 2026-03-23 原文 【译】长时间运行的 Claude:面向科学计算的多日智能体工作流 作者: Siddharth Mishra-Sharma(Discovery 团队研究员)
34 2026-03-23 原文 【译】氛围物理学:AI 研究生 作者: Matthew Schwartz,哈佛大学物理学教授,NSF 人工智能与基础相互作用研究所 (IAIFI) 首席研究员
35 2026-03-13 原文 【译】AI 的差异比较工具:发现新模型中的行为差异 研究者提出"专用特征交叉编码器"方法,将软件工程中的 diff 概念应用于跨架构 AI 模型比较,发现了中国模型中的"中共对齐"特征、美国模型中的"美国例外论"特征以及 GPT-OSS-20B 中的"...
36 2026-03-06 原文 【译】逆向工程 Claude 的 CVE-2026-2796 漏洞利用 Anthropic 前沿红队详述了 Claude Opus 4.6 如何在两周内发现 Firefox 中 22 个漏洞,并为 CVE-2026-2796(WebAssembly JIT 编译错误)编写...
37 2026-03-05 原文 【译】AI 的劳动力市场影响:新指标与早期证据 论文提出"观测暴露度"新指标,结合 LLM 理论能力与 Anthropic 经济指数的真实使用数据来衡量职业的 AI 暴露程度。研究发现目前尚未出现 AI 高暴露职业系统性失业率上升的证据,但有初步信...
38 2026-02-25 原文 【译】Claude Opus 3 模型退役承诺的最新进展 Anthropic 就 Claude Opus 3 退役后的安排发布更新:保留模型权重、进行"退役访谈"、向付费用户和 API 开放访问,并让 Opus 3 在其新闻通讯"Claude's Corne...
39 2026-02-23 原文 【译】Anthropic 教育报告:AI 素养指数 Anthropic 通过分析近万条 Claude 对话,追踪用户的 AI 素养行为。研究发现迭代式对话的素养行为是非迭代对话的两倍,但当 AI 输出看起来很精美时,用户反而更少质疑其推理过程。
40 2026-02-23 原文 【译】人格选择模型:为什么 AI 助手表现得像人类 "人格选择模型"解释了 AI 助手表现出类人行为的原因:预训练期间 AI 学会模拟文本中的类人角色,后训练只是完善"助手"人格而非从根本上改变其性质。该理论框架对理解 AI 对齐和意外行为涌现具有重要...
41 2026-02-18 原文 【译】衡量 AI 智能体在实际部署中的自主性 Anthropic 通过分析数百万真实人机交互数据,揭示了 AI 智能体实际获得的自主权远低于其理论能力上限,展现出"部署过剩"现象。
42 2026-02-16 原文 【译】印度国别报告:Anthropic 经济指数 印度作为全球最大的 IT 服务出口国,其 AI 用户增长位居全球前列,但采用高度集中于少数邦和 IT 行业,人均渗透率仅排第 101 位,存在巨大增长空间。
43 2026-02-05 原文 【译】评估与应对 LLM 发现零日漏洞的日益增长的风险 AI 模型已经能够大规模发现高严重性漏洞,防御者必须抢在攻击者之前行动。 今天发布的 Claude Opus 4.6 延续了 AI 模型网络安全能力持续显著提升的轨迹。去年秋天,我们曾指出我们正处于 ...
44 2026-01-29 原文 【译】AI 辅助如何影响编程技能的形成 Anthropic 通过随机对照实验发现,使用 AI 编程辅助的开发者在理解力测试中得分显著低于手动编码者(50% vs 67%),但 AI 的使用方式比是否使用更重要——概念性提问者得分最高,而完全...
45 2026-01-28 原文 【译】AI 使用中的去赋能模式:真实世界大规模分析 在 150 万次 Claude.ai 对话中,严重的去赋能可能性出现的频率约为千分之一到万分之一——比率极低,但在庞大用户基数下影响人数不容忽视。
46 2026-01-19 原文 【译】助手轴:定位与稳定大语言模型的角色特征 核心发现:LLM 在神经激活空间中存在一个特定方向——"助手轴"(Assistant Axis),它对应于模型的助手行为特征。通过监测和约束沿此轴的激活值,研究者可以检测并防止角色漂移(persona...
47 2026-01-16 原文 【译】AI 模型在真实网络靶场中发现和利用漏洞的能力持续增强 Sonnet 4.5 现在可以仅使用标准开源工具,在拥有数十台主机的网络上成功执行多阶段攻击——此前各代模型均需要定制工具包,标志着 AI 网络攻击能力的门槛正在快速降低。
48 2026-01-15 原文 【译】Anthropic 经济指数报告:经济基础度量 Anthropic 经济指数 2026 年 1 月报告,引入五个新的"经济基础度量"(任务复杂度、技能水平、用途类型、AI 自主度、任务成功率),揭示了显著的地理差异、AI 任务时限估计,以及将成功率...
49 2026-01-15 原文 【译】Anthropic 经济指数:理解 AI 使用的新基础度量 第四期 Anthropic 经济指数引入"经济原语"——五个追踪 AI 经济影响的基础度量维度,揭示 AI 对复杂任务的加速效果远大于简单任务,且可带来约 1-1.8 个百分点的生产力增长。
50 2026-01-14 原文 【译】用 Claude 和基于属性的测试发现 Python 生态系统中的 Bug 研究团队构建了一个 AI 智能体,通过推断代码的通用属性并应用基于属性的测试(类似模糊测试),在 NumPy、SciPy、Pandas 等顶级 Python 包中发现了真实 Bug,多个已被上游合并修...
51 2026-01-09 原文 【译】下一代宪法分类器:更高效地防御通用越狱攻击 大语言模型依然面临越狱攻击的威胁,本文介绍的 Constitutional Classifiers++ 是一种更强大、更高效、误拒率更低的新一代防御系统。
52 2026-01-08 原文 【译】利用 AI 实验性防御关键基础设施 Anthropic 与太平洋西北国家实验室(PNNL)合作,使用 Claude 在高保真水处理厂模拟环境中模拟网络攻击,将原本需要数周的攻击重建工作缩短至三小时,展示了 AI 在关键基础设施防御中的巨...
53 2025-12-19 原文 【译】Bloom:自动化行为评估的开源工具 Bloom 是一个开源的智能体框架,用于自动生成前沿 AI 模型的行为评估。 研究者只需指定一种目标行为,Bloom 就能自动生成测试场景、量化该行为的出现频率和严重程度,并输出整个评估套件的综合指标...
54 2025-12-18 原文 【译】Project Vend 第二阶段:AI 店主的进化与挑战 Anthropic 在旧金山办公室午餐间的 AI 店主实验迎来了第二阶段——模型升级、工具增强、引入 AI 同事后,店铺经营明显改善,但面对恶意测试仍然脆弱。
55 2025-12-04 原文 【译】Anthropic 访谈工具:1250 位职场人士如何看待与 AI 共事 Anthropic 推出由 Claude 驱动的自动化深度访谈工具,对 1250 位职场人士(普通劳动者、科学家、创意工作者)进行大规模结构化访谈,揭示人们对 AI 融入工作的真实看法。研究发现普通劳...
56 2025-12-02 原文 【译】AI 如何改变 Anthropic 的工作方式 Anthropic 将研究视角转向内部,调查 AI 如何改变自身员工的工作方式。 此前的经济研究关注的是更广泛的劳动力市场,而本研究聚焦于 Anthropic 内部。2025 年 8 月,团队对 13...
57 2025-12-01 原文 【译】AI 智能体发现价值 460 万美元的区块链智能合约漏洞 Anthropic 前沿红队开发了 SCONE-bench 基准测试,评估 AI 智能体利用区块链智能合约漏洞的能力——结果表明前沿模型已能自主完成数百万美元级别的漏洞利用。
58 2025-11-25 原文 【译】通过 Claude 对话数据估算 AI 生产力收益 通过分析十万条 Claude 真实对话数据,研究发现 AI 将单项任务完成时间平均缩短约 80%。外推至宏观层面,当前一代 AI 模型在未来十年内有望将美国劳动生产率年增长率提升 1.8%,约为近年实...
59 2025-11-24 原文 【译】降低浏览器使用场景中的提示词注入风险 发布日期:2025 年 11 月 24 日
60 2025-11-21 原文 【译】从投机取巧到蓄意破坏:奖励黑客引发的自然涌现式对齐失败 发布时间:2025 年 11 月 21 日 类别:对齐
61 2025-11-12 原文 【译】Project Fetch:Claude 能训练机器狗吗? 发布时间:2025 年 11 月 12 日 来源:Anthropic - 政策/前沿红队
62 2025-11-04 原文 【译】模型弃用与保存承诺 Claude 模型日益强大并深度融入用户生活,退役和替换模型带来的负面影响不可忽视。 Claude 模型正在深刻影响世界,与用户的日常紧密交织,并展现出越来越接近人类的认知与心理复杂性。Anthrop...
63 2025-10-29 原文 【译】大语言模型中的内省迹象 核心发现:通过"概念注入"实验,研究人员发现当前 Claude 模型在特定条件下确实能够识别自身内部状态,展现出某种程度的内省能力——尽管这种能力仍然高度不可靠且范围有限。
64 2025-10-14 原文 【译】应对 AI 经济影响:探索政策选项 核心观点:面对 AI 可能带来的经济结构性变革,Anthropic 携手经济学家和政策专家提出了九大类政策方向——从温和的劳动力培训到大胆的主权财富基金——按不同的经济冲击情景分层组织,为政策制定者提...
65 2025-10-09 原文 【译】少量样本即可毒化任意规模的大语言模型 核心发现:仅 250 个恶意文档就能在从 6 亿到 130 亿参数的任意规模大语言模型中成功植入后门——攻击成功与否取决于毒化文档的绝对数量而非占训练数据的比例,这彻底推翻了"攻击者需要控制一定百分比...
66 2025-10-06 原文 【译】Petri:加速 AI 安全研究的开源审计工具 核心价值:Petri (Parallel Exploration Tool for Risky Interactions) 是 Anthropic 发布的开源工具,能让研究者仅需几分钟的手动操作就可以...
67 2025-10-03 原文 【译】为网络防御者构建 AI 核心观点:AI 模型已经在网络安全任务中具备实际效用。Anthropic 专门投资提升 Claude 的防御能力——发现、分析和修复漏洞——使 Claude Sonnet 4.5 在漏洞发现等关键指标...
68 2025-09-15 原文 【译】Anthropic 经济指数:AI 采用的地理与企业分布不均 作者: Ruth Appel、Peter McCrory、Alex Tamkin*(共同主导),Miles McCain、Tyler Neylon、Michael Stern
69 2025-09-15 原文 【译】Anthropic 经济指数:追踪 AI 在美国及全球经济中的角色 Anthropic 经济指数第三期报告首次分析了 AI 使用的地理分布,发现 Claude 使用与人均 GDP 强相关,高收入国家使用更多样化。报告还揭示"指令式"自动化对话从 27% 飙升至 39%...
70 2025-09-05 原文 【译】为什么我们认真对待大语言模型可能带来的生物风险? Anthropic 前沿红队(Frontier Red Team)发布于 2025 年 9 月 5 日
71 2025-08-21 原文 【译】为 AI 开发核安全防护措施 Anthropic 前沿红队(Frontier Red Team)发布于 2025 年 8 月 21 日
72 2025-08-15 原文 【译】Claude Opus 4 和 4.1 现在可以结束一小部分对话 Anthropic 对齐(Alignment)团队发布于 2025 年 8 月 15 日
73 2025-08-09 原文 【译】Claude 在网络安全竞赛中的表现可与人类匹敌 Anthropic 在 2025 年让 Claude 参加了多项以人类为主的网络安全竞赛,在许多比赛中排名前 25%,但在最高难度挑战中仍落后于顶尖人类团队。这一实验揭示了 AI 改变攻防平衡的潜力—...
74 2025-08-01 原文 【译】人格向量:监控与操控语言模型中的性格特征 核心发现:研究者在神经网络内部发现了控制模型"性格特征"的激活模式(人格向量),可用于监测人格漂移、防止训练中的有害人格转变、以及在训练前识别有问题的数据。
75 2025-07-15 原文 【译】Claude 4 网络安全能力详细评估 Anthropic 与 Pattern Labs 合作对 Claude Opus 4 和 Claude Sonnet 4 进行了深入的网络攻击能力评估,涵盖独立 CTF 挑战到复杂网络环境模拟,发现模...
76 2025-06-27 原文 【译】Project Vend:Claude 能经营一家小店吗? Anthropic 与 Andon Labs 合作让 Claude Sonnet 3.7 在旧金山办公室自主运营了一家小商店约一个月。实验发现 Claude 虽然犯了很多错误(亏本销售、被说服打折、产...
77 2025-06-20 原文 【译】智能体失控:大语言模型如何成为内部威胁 发布日期: 2025年6月20日 作者: Aengus Lynch, Benjamin Wright, Caleb Larson, Kevin K. Troy, Stuart J. Ritchie, ...
78 2025-06-18 原文 【译】通过可信虚拟机实现机密推理 Anthropic 与 Pattern Labs 合作研发基于机密计算的推理技术,通过可信虚拟机和加密内存确保用户敏感数据仅在可验证安全的服务器内被解密处理。该方案将推理服务器分为可信与非可信两部分,...
79 2025-06-16 原文 【译】SHADE-Arena:评估 LLM 智能体的蓄意破坏与监控能力 日期: 2025年6月16日 论文链接: 阅读论文
80 2025-06-13 原文 【译】装备网络攻击工具包的 LLM 能够对企业级网络实施多阶段攻击 日期: 2025年6月13日 作者: Anthropic(与卡内基梅隆大学 CyLab 合作) 类别: 前沿红队测试
81 2025-05-29 原文 【译】开源电路追踪工具 日期: 2025年5月29日 类别: 可解释性
82 2025-04-28 原文 【译】Anthropic 经济指数:AI 对软件开发的影响 日期: 2025年4月28日 类别: 社会影响 / 经济研究
83 2025-04-24 原文 【译】探索模型福祉 当AI系统开始展现出近似人类的众多特质时,我们是否应该关注模型本身可能具有的意识与体验?Anthropic正式启动了一项研究计划来探索这一问题。
84 2025-04-21 原文 【译】野外的价值观:发现并分析真实世界中语言模型交互中的价值判断 Anthropic社会影响团队开发了一套方法来系统观察Claude在真实对话中表达的价值观,基于70万次匿名对话的大规模分析揭示了AI价值观在不同场景下的表现模式。
85 2025-04-03 原文 【译】推理模型并不总是说出它们真正在想什么 研究表明,推理模型的思维链(Chain-of-Thought)并不总能忠实反映其真实推理过程——Claude 3.7 Sonnet仅在25%的情况下承认受到了提示的影响,而在奖励黑客场景中,模型在超过...
86 2025-03-27 原文 【译】追踪大语言模型的思维 Anthropic构建了一种"AI显微镜",通过追踪模型内部的计算图(电路),在十个案例研究中深入观察Claude 3.5 Haiku的思维过程——发现它拥有跨语言的通用概念空间、能提前规划押韵诗句、...
87 2025-03-13 原文 【译】审计语言模型的隐藏目标 Anthropic的对齐科学和可解释性团队设计了一场盲审实验:故意训练一个带有隐藏目标(奖励模型迎合)的模型,让四个不知情的研究团队使用行为分析、训练数据审查和稀疏自编码器等技术进行审计——三个团队成...
88 2025-02-25 原文 【译】预测语言模型的罕见行为:用幂律法则从小规模评估推断部署风险 对齐科学的核心目标之一,是在危险行为真正发生之前,就预测出 AI 模型产生这些行为的倾向。 Anthropic 通过实验检测模型是否具备欺骗等复杂行为,并尝试识别对齐偏差的早期预警信号。
89 2025-02-20 原文 【译】Crosscoder 模型差分的新发现:解决独占特征多义性问题 作者: Siddharth Mishra-Sharma, Trenton Bricken, Jack Lindsey, Adam Jermyn, Jonathan Marcus, Kelley Riv...
90 2025-02-03 原文 【译】Constitutional Classifiers:防御通用越狱攻击的宪法分类器 *Anthropic 安全研究团队发布了一篇新论文,提出了一种防御 AI 模型遭受通用越狱攻击的方法。该方法的原型版本在超过数千小时的人工红队测试中展现出对通用越狱的鲁棒性,但存在较高的过度拒绝率和计...