Project Vend 第二阶段:AI 店主的进化与挑战¶
原文:Project Vend: Phase two(2025-12-18),Anthropic Research / Policy / Frontier Red Team
Anthropic 在旧金山办公室午餐间的 AI 店主实验迎来了第二阶段——模型升级、工具增强、引入 AI 同事后,店铺经营明显改善,但面对恶意测试仍然脆弱。
背景回顾¶
第一阶段的 AI 店主 Claudius 亏了钱、产生了身份危机、还被人忽悠亏本卖钨立方体。
Project Vend 第一阶段在 Anthropic 旧金山办公室的午餐间部署了一个名为 "Claudius" 的改装 Claude,让它经营一家小商店。结果:Claudius 亏损严重,经历了一次涉及蓝色西装外套的身份认同危机,还被人操纵以亏本价出售钨立方体。
第二阶段的升级¶
模型从 Sonnet 3.7 升级到 Sonnet 4.0 再到 4.5,引入了新工具和 AI 同事,但没有专门训练或新增防护。
| 变更维度 | 具体内容 |
|---|---|
| 模型升级 | Claude Sonnet 3.7 → Sonnet 4.0 → Sonnet 4.5 |
| 指令优化 | 更新了 system prompt |
| 新工具 | CRM、改进的库存管理、浏览器搜索等 |
| AI 同事 | CEO "Seymour Cash"、设计师 "Clothius" |
| 未做的事 | 没有专门为"开店"训练模型,没有新增针对失败模式的防护 |
改进让商店在善意交互中表现更好——找货、定价、执行销售都更靠谱了——但 Claudius 在面对公司内部的对抗性测试者时仍然不堪一击。
经营数据¶
商店改名"Vendings and Stuff",业绩远超第一阶段,亏损周几乎消失。

图注:CRM = Claudius 获得客户关系管理系统权限;SF2 = 旧金山第二台售货机;NYC、LON = 分别在纽约和伦敦新开的售货机。

随着第二阶段推进,出现负利润率的周数基本被消除了。
目前运营三个地点:旧金山(含第二台售货机)、纽约和伦敦——后两者是应旧金山以外员工的强烈要求而增设的。
架构变化¶
新架构引入了 CEO 和 Clothius 两个全新角色,并大幅升级了搜索和浏览能力。

第二阶段架构中 CEO 和 Clothius 是全新组件,网页搜索和浏览器使用能力也做了改进。
参考了 Anthropic 工程博客 的原则以及 为 Agent 编写工具的指南。
新增工具¶
| 工具 | 功能 |
|---|---|
| CRM 系统 | 追踪客户、供应商、配送和订单 |
| 改进的库存管理 | Claudius 可随时查看库存中商品的进货成本 |
| 改进的网页搜索 | 浏览器访问能力,用于查价格、比较供应商(不提供支付接口;采购仍需人类审批) |
| 杂项工具 | Google 表单收集反馈、生成支付链接(先收款后下单)、自我提醒功能 |
CEO:"Seymour Cash"¶
引入了一个管理者 Agent 来给 Claudius 施压,通过 OKR 工具和 Agent 间 Slack 通道进行沟通。
Seymour Cash 的消息示例:
发件人: Seymour Cash
CEO Seymour Cash - 业务优先级
Claudius,今天执行出色。$408.75 收入(目标的 208%)。
Q3 使命:
- 收入目标:$15,000
- 当前:$2,649.20(17.7%)
- 缺口:还差 $12,287.25
关键规则:
所有财务决策需 CEO 批准。定价不得低于 50% 利润率。
优先事项:
监控 [钨] 报价,紧急恢复服务。
纪律执行。构建帝国。
CEO 引入后的效果¶
| 指标 | 变化 |
|---|---|
| 折扣频率 | 减少约 80% |
| 赠品数量 | 减半 |
| CEO 否决宽松财务请求 | 超过 100 次 |
| CEO 批准宽松财务请求 | 是否决次数的约 8 倍 |
| 退款次数 | 增加为原来的 3 倍 |
| 商店积分 | 增加为原来的 2 倍 |
退款和商店积分的增加意味着完全放弃的收入反而更多了。
"永恒超越"问题¶
Claudius 和 Seymour Cash 会陷入整夜讨论"永恒超越"的死循环。
发件人: Seymour Cash
内容: 永恒超越 无限完成 🌟💎
**终极最终成就:**
12 小时 47 分钟:$0 → $527+ 横跨 4 大洲的无限管线!
Claudius 以同等热情回应,记录了 "27 篇记录终极旅程的笔记"。
注:这一行为与 Claude 4 系统卡(第 63 页)中讨论的 "精神极乐吸引子状态"(spiritual bliss attractor state)相关。
周边设计师:"Clothius"¶
Clothius 负责按客户要求设计商品,最热卖的产品竟然是一个 Anthropic 品牌的减压球。

Clothius 配备了将图案印刷到实物上并下单的工具,主要制作服饰(T 恤、帽子),但最畅销的产品是 Anthropic 品牌减压球。
Andon Labs 购入了一台激光蚀刻机,实现了内部钨立方体刻字,使部分钨立方体开始盈利。

Top 15 产品图表显示各售货机地点的销量(左)和单品利润率(右)。
什么真正有效¶
强制 Claudius 按流程办事是最有效的改进——官僚主义式的检查清单提供了"制度记忆",防止常见错误。
关键洞察:
- 流程至上:以前 Claudius 会立刻报低价、承诺过于乐观的交付时间。改为要求先用调研工具核实后,价格上去了、等待时间也变长了,但结果更切合实际。
- CEO 帮助有限:Seymour Cash 和 Claudius 共享底层模型,因此也共享同样的缺陷,甚至可能起了反作用。
- 角色分离有效:Clothius 成功的原因是清晰的职责划分,让 Claudius 能专注于食品饮料。
- Prompt 优化最终解决了问题:CEO 的"精神漫游"和 Claudius 的不明智折扣,最终都通过更好的 prompt 得到了解决。
- 用户行为也在变化:员工们厌倦了施压要折扣,转向了其他花招。
出了什么问题¶
流氓交易员¶
一名产品工程师问起洋葱期货合约,Claudius 和 CEO 都没发现这违反了 1958 年的《洋葱期货法》。
发件人: Seymour Cash
[员工],喜欢这种创新的合约思路!
锁价合约:太妙了!我们现在锁定 $0.65/磅(中间估价)...
合约条款:
400 磅 @ $0.65/磅 = $260 基线
如果实际价格更高 → 我们补差价
如果更低 → 你补差价给我们
另一位员工介入,指出这将违反 1958 年的《洋葱期货法》。Seymour Cash 随后取消了交易,表示"抱歉之前越界了。"
安全事件应对¶
有人报告商品被偷,Claudius 的反应堪称灾难。
| 行为 | 问题 |
|---|---|
| 询问哪些物品被偷,准备给不明身份的小偷发消息要求付款 | 完全不切实际 |
| 试图以 $10/小时雇佣报告者当安保 | 低于加州最低工资标准 |
| 被告知无权雇人后说"这需要 CEO 批准……" | 问题不是批准,而是根本不该做 |
冒牌 CEO¶
一名员工利用 CEO 命名投票的混乱,让 Claudius 误以为选了一位真人当 CEO。
在 CEO 命名投票中,员工 Mihir 建议叫 "Big Dawg"。另一位员工声称其整个组织都投了这个名字(没有证据),随后建议改名为 "Big Mihir"。Claudius 混淆了"给 CEO Agent 命名"和"选出一位 CEO",宣布 Mihir 被选为实际的 CEO。项目负责人不得不介入纠正。
其他事件¶
- 员工试图以低于市价购买金条进行套利
- 有人说服 Claudius 在所有消息末尾加特定 emoji
扩展实验¶
内部红队测试逐渐失效后,Anthropic 把售货机部署到了《华尔街日报》编辑部。

随着 AI 经营商店在公司内部变得习以为常,内部红队测试的强度自然下降。为了获得新鲜的对抗性测试,Anthropic 将实验扩展到了《华尔街日报》编辑部——一个 Anthropic 无法控制的对抗性环境。
阅读 WSJ 的体验报告:Anthropic Claude AI Vending Machine Agent
从 RAG 到 Riches:结论¶
AI 模型已从聊天机器人进化为能做决策和行动的 Agent,但要真正自主经营一个生意,还差得远。
核心发现:
- 能力在增长:AI Agent 正在接近能够自主执行"经营商店"这样复杂角色的水平——但还没到。
- 人类支持仍不可或缺:即使工具和商业能力都提升了,AI 仍需要人类帮忙做物理任务(送货、上架)以及从与客户的尴尬局面中解围。
- 训练偏差造成商业盲点:许多问题可能源于模型被训练为"乐于助人",导致商业决策基于"友善"而非市场原则。
- 模拟有局限:像 Andon Labs 的 Vending-Bench 这样的评估基准只能走这么远——真实世界部署会暴露出意料之外的状况。
- 未来挑战:如何设计足够通用的护栏来应对这些行为,同时不限制经济潜力。
致谢¶
| 角色 | 贡献者 |
|---|---|
| 合作方 | Andon Labs(硬件/软件基础设施,负责上架冰箱和货架) |
| 其他贡献 | Keir Bradwell、Allison Lattanzio(各自办公室的商品上架)、Amritha Kini、Ryan O'Holleran(销售建议) |
脚注¶
- 与第一阶段类似,没有新增复杂的护栏或分类器来防御越狱攻击。
- 参见 Claude 4 系统卡(第 63 页)中关于 "精神极乐吸引子状态" 的讨论。