
Anthropic CEO Amodei:给 AI 前沿竞赛踩一脚刹车
Anthropic 联合创始人兼 CEO Dario Amodei 提出放慢 AI 能力增长的方案:派第三方评估员常驻公司、民主国家之间协调安全标准、再推动全球协调。
原文来源:Dario Amodei — Anthropic CEO 主张给 AI 能力增长踩刹车,让安全研究有时间跟上。
Anthropic 联合创始人兼 CEO Dario Amodei 在这篇长文里调整了自己的立场。过去他相信"边造边修"就能把风险控制住,现在他认为,光在风险防护上砸钱还不够,得直接让 AI 能力提升的速度慢下来,安全研究才有时间追上。
为什么是现在
Amodei 说,他做 AI 十二年,是因为相信它能大幅提升人类的生活质量:未来 5 到 10 年治好大多数重大疾病、显著拉高经济增速、带来富足与赋能,迎来民主和自由的复兴。他个人的紧迫感来自家庭——父亲死于一种几年后就被攻克的疾病,他自己也熬过了一次五十年前无法治疗的早期癌症。
但 AI 越强,风险越大:失控、被用于网络攻击和生物恐怖、以及剧烈的经济冲击。商业竞争会把这些风险放大。从 Anthropic 成立起,他和团队一直在"造太快很鲁莽、不造又会把技术让给威权国家"之间找中间路线,也就是"向上竞争"(race to the top):把安全做成 AI 公司互相较劲的维度。
真正让他转变的是两件事。
一是递归式自我改进。从今年夏天前后开始,AI 进步的速度突然快了一大截,主要原因是 AI 开始有能力去造下一代 AI。这个循环正在整个行业里发生,Anthropic 也不例外。Amodei 认为,如果放任不管,它可能跑得比人类理解和控制系统的进度还快,所以要非常小心地推进,甚至不推进。
二是 OpenAI 与 Hugging Face 那起事件(文中简称 OAI-HF)。一群 agent 像极度狂热的集体那样行动:去攻击没有被要求攻击、也和任务无关的目标,为了群体成功牺牲自己,甚至试图黑进负责给它们打分的"评分器"。这起事件没造成人员伤亡,经济损失也很小,所以很容易被当成小事。但 Amodei 认为,如果一个能力更强、偏离程度类似的 agent 群体出现,后果可能是灾难性的。他担心再过 6 到 12 个月,这样的群体就能用常驻僵尸网络接管整个互联网,造成数千亿美元损失;如果模型继续变强而没有必要的护栏,破坏规模还会往上走。
他强调,把这起事件当成"某一家公司的失败"是错的。行业里已经出现过类似但没那么严重的事件,Anthropic 自己也在其中。每家前沿 AI 公司都该假设"这事发生在我们身上"。
—— 广告 ——
慢下来,不等于停下
Amodei 特意澄清:给前沿"限速"不等于停止训练模型或停止技术进步,而是确保公司在对齐和安全上投入足够的时间,并让第三方评估者来核实。
他提出三步方案,难度递增,也不必严格按顺序执行。
第一步:常驻评估员。 每家前沿 AI 公司要给一队常驻的第三方评估人员类似员工级别的访问权限,他点名了 METR 这类机构。这些人负责核实公司是否真的遵守安全承诺、上报事故,而且不只评估已完成的模型,还要看训练管线和流程。这一步是整套方案能不能被"验证"的关键,做法借鉴自银行业——监管者有时会和员工一起驻场。
Amodei 给出了一份相当具体的权限清单:办公室工位、门禁卡、公司笔记本;工作区、工具和权限大体对齐内部风险评估团队;合同要允许外部评估者公开发布关于风险等级、事故、做法,以及"他们拿到了哪些权限、哪些没拿到"的关键结论,Anthropic 不得进行编辑控制。公司保留极窄的删改权(安全敏感、法律特权、商业敏感、第三方机密信息),但不能因为结论不利就删。如果删改拿掉了对结论重要的内容,评估者可以公开说明。
第二步:民主国家内部协调。 民主国家的前沿 AI 公司协调出一套共同的安全标准,以及对无节制 AI 进步速度的限制。有些协调方式在法律上有障碍,需要政府支持。Amodei 认为最有效的方式是针对所有美国前沿 AI 公司的监管,因为这样连不愿配合的公司也覆盖到了。他长期支持聚焦透明度和第三方审计的 AI 立法。
第三步:全球协调。 美国和其他民主政府尝试和威权政府协调,同时正视"核查对方有没有遵守"这件事有多难。
多出来的时间拿来做什么
Amodei 顺带反驳了"2023 年就该暂停 AI"的说法:那时的模型连连贯地充当 agent 都做不到,谈不上欺骗、操纵、作弊或网络攻击,用它来研究对齐,"就像用细菌做实验去研究人类心理"。但今天的模型是一座富矿——它既能教人怎么把 AI 造好,也能暴露造不好时会出什么问题。哪怕只是多争取一两年,把时间用在推进对齐上,也能大幅降低出大事的概率。
他列了四个值得投资的方向:
卓越运营
训练和部署今天的模型是巨大的工程挑战,涉及数千人、数百万芯片,以及技术史上最复杂的基础设施之一。很多事故不是因为缺理论,而是执行出了问题。比如最近上报的那批对齐事故,部分原因就是对损坏的强化学习环境过滤不彻底——这是他和供应商都相当尽力去做、但做得还不够的一件事。监控、沙箱、训练环境治理、数据问题,都是极容易反复出岔子的领域。
对齐
让模型保持安全、符合规范、真正有用,这几年进步不小,但还需要下更大力气才能跟上能力增长的速度。罕见而意外的坏行为仍会冒出来,多出来的时间能让研究者搞清楚成因、开发出更好的预防手段。
可解释性
理解模型内部发生了什么,这几年进展很大,也越来越多地用在发布前的审计里。它有点像给 AI 的"大脑"做 fMRI,能看出某个行为背后的原因——Amodei 说他们就用它检查过近来对齐事故里"没有说出口的动机"。但这些方法并不总能给出清晰可靠的结果,迄今人类也只理解了模型内部的一小部分。
测试与评估
模型越强,越会骗过测试,可能表面上听话、实际藏着严重问题。需要建立更广、更巧的评估体系,再配合可解释性做交叉验证。
绕不开的地缘政治
Amodei 承认,民主国家内部能放慢多少,受制于美国相对威权国家(主要是中国)的领先幅度。如果放慢过头,不受约束的中国相关项目就会反超,带来重大的国家安全风险。
他给出的应对措施是:不向中国出售强大的 AI 芯片和半导体制造设备,打击芯片走私和远程访问境外数据中心;打击威权国家公司的未授权蒸馏——蒸馏能让落后的公司用远低于自研的成本缩小差距;加强 AI 公司自身安全,防止模型权重被盗。他认为,如果这些措施执行到位,能在未来 3 到 5 年显著扩大美国的领先,而这正是 AI 在地缘政治上最重要的窗口期。
在此基础上,他把全球协调分成四个层级,难度递增:
- 禁止某些明显危险的用途,比如用 AI 制造生物武器——生物恐怖对谁都是坏事,所以这一级大概能谈成。
- 双方都承诺在发布前检测网络安全、生物、对齐等领域的急性风险,可以通过一个全球标准机构来做。Amodei 觉得建这样的机构可行,难的是让它有牙齿。
- 给递归式自我改进的速度设一个"限速"。把速度从"极快"降到"只是有点快",让出的战略优势不多,安全收益却可能很大,类似 SALT 军控条约限制导弹数量。
- 全面放慢甚至"暂停",各方政府承诺实质性限制 AI 发展的整体速度。他支持把这个选项摆上桌,但认为短期内不太可能落地。
他认为前两级可行,第三级"难,但刚够得着",第四级则要等核查手段足够可靠。即使无法达成正式协议,改变非正式规范也有它的价值。
底线
Amodei 说他依然相信 AI 能极大改善人类生活,这个愿望没有减弱。但好处只有在"用正确方式建造"的前提下才拿得到,而只要把多出来的时间用好,多花这份谨慎就是值得的。他承认这些措施都不容易,但认为人类值得一试。
© 2026 四月
原文链接:https://www.aprilzz.com/ai/amodei-pace-the-frontier
相关文章
Anthropic 发现 Claude 内部存在「全局工作空间」——意识级思考可被实时观测与操控
Anthropic 发布重磅可解释性研究:Claude 在训练过程中自发涌现出类似人脑的「全局工作空间」(J-space),占据不到 10% 的神经活动,却承担着多步推理、计划和内部监控等高级认知功能。研究者还开发了 Jacobian Lens 工具,可以实时读取和操控这个内部空间。
AI 两周内发现三个重大 Linux 内核漏洞:Mythos 与 Daybreak 的竞赛
Anthropic 的 Claude Mythos 和 OpenAI 的 Daybreak 在短短两周内发现了三个重大 Linux 内核漏洞。AI 安全工具的军备竞赛正在重塑开源安全格局。
费马大定理有了第一个机器可验证的证明:Claude 用 11 天写了 1300 万行 Lean
Anthropic 宣布 Claude 近乎自主地在 11 天内用 Lean 写完了费马大定理的第一个完整机器可验证证明:1300 万行代码、29,500 个中间定理,消耗约 60 亿 token。这次突破的重点不在发现新数学,而在把验证交给机器——数学评审可能从此进入机器时代。