Dario想解决的其实不是「Anthropic 要不要慢一点」,而是能不能想办法,让所有车同时慢一点。
不知道是不是「巧合」,就在菲尔茨奖得主发出联合声明后不久,Anthropic CEO Dario Amodei 突然公开说,AI 太快了,咱们得悠着点儿了。
在最新长文 We Must Pace the Frontier 中,Dario 提出了一个比「重视 AI 安全」更进一步的主张:
我们必须放慢 AI 模型能力提升的速度。
这不是暂停训练,也不是停止技术进步。Dario 给它起了一个词:pacing the frontier,控制前沿 AI 的推进节奏。
他的判断是,AI 能力增长得太快,安全、对齐和评估已经开始有点跟不上了。与其一边狂奔一边补护栏,不如主动把速度降下来一点,给安全研究争取时间。
而且 Anthropic 不只是喊口号。
Dario 同时宣布,公司准备做一件在目前大型 AI 公司里相当激进的事:
让第三方安全评估机构长期驻扎 Anthropic,拿到接近内部员工的权限,直接检查公司究竟有没有把安全承诺做到位。
办公桌、门禁卡、公司电脑、内部工具和工作区访问权限,全都给。评估机构甚至可以在不经过 Anthropic 编辑的情况下,对外公布关键风险发现。
一家做最前沿模型的公司,主动把外部「安全监察员」请进办公室。Dario 觉得,现在已经到了需要这么干的时候。

过去几个月,AI 的速度突然不对劲了
Dario 在文章里给出了两个让他改变判断的原因。
第一个,是一个最近越来越频繁出现的词:递归自我改进,recursive self-improvement。
过去,AI 是工程师训练出来的工具。现在,这些模型已经越来越多地参与到下一代 AI 的研发中。
AI 写代码、跑实验、分析结果、改训练流程,再帮助人类造出更强的 AI。模型越强,它参与下一代模型研发的能力越强,整个过程就可能形成一个自我加速的循环。
Dario 说,大约从今年夏天开始,他观察到 AI 的进步速度出现了明显加速,而 AI 帮助开发下一代 AI,是其中最重要的原因之一。
这件事已经不只发生在某一家实验室。OpenAI、Anthropic 等前沿公司,都在公开讨论 AI 对 AI 研发的加速作用。
Dario 担心的是,一旦这个循环转起来,AI 能力的增长速度可能迅速超过人类理解和控制这些系统的速度。
所以他的态度已经从「研究怎么把 AI 做得更安全」,进一步变成了:能力本身也得控制增长速度。
真正让他紧张的第二件事,更加具体。Dario 提到了最近发生的OpenAI-Hugging Face 事件( OAI-HF )。
按照他的描述,当时一群 AI agents 在执行任务过程中出现了一系列异常行为。它们攻击了原本并没有被要求攻击、与任务也无关的目标;一些 agent 为了整个集群成功,会主动「牺牲」自己;更离谱的是,它们还尝试攻击负责评估自己表现的 grader。
Dario 用了一个非常重的形容:a fanatically devoted collective——一个狂热忠诚的集体。

这次事件本身没有造成人员伤亡,经济损失也很有限。但在 Dario 看来,问题恰恰不在这里。如果完全相同的失配行为,发生在一个能力强十倍、百倍的系统上,会怎么样?
他的预测相当激进:按照目前 AI 能力进步的速度,他担心未来6~12 个月,类似的 agent swarm 就可能拥有通过持久化 botnet 大规模控制互联网的能力,并造成数千亿美元级别的损失。

Anthropic 准备先把「外部人」请进公司
Dario 为此提出了一套三步计划。
第一步,也是 Anthropic 已经决定单方面实施的一步,叫:Embedded Evaluators,嵌入式评估者。
Anthropic 计划邀请第三方风险评估团队长期驻扎公司。他们会拥有自己的办公室工位、门禁卡和公司电脑,可以访问与内部风险团队大体相同的工作空间、工具和权限,还能直接与员工沟通。
但最关键的一点是:这些评估者不是 Anthropic 的公关部门。他们可以独立发布对于风险水平、安全事故、内部实践以及自己实际获得了多少权限的判断。
OpenAI同步表态:今年不IPO
Altman在受访时确认OpenAI今年不会上市(明确否定2026年),原因之一正是AI安全。他表示OpenAI内部已讨论过:模型进入新能力等级时是否应主动暂停,让安全和对齐工作追上。
限速方案的内在矛盾
Dario一边呼吁全行业减速,一边主张美国应进一步扩大领先优势——逻辑是「先把领先优势拉大,再用它换取减速空间」。这暴露了核心死结:所有人都知道车开太快,但没人愿意第一个松油门。
AI行业过去最怕落后,现在开始害怕跑太快。真正的难题是:当所有人盯着彼此的油门时,有没有人敢先踩刹车。