今天凌晨,Anthropic CEO达里奥·阿莫德伊发了一篇罕见长文,标题是:We Must Pace the Frontier(我们必须控制前沿AI的发展节奏)。
文章一出,OpenAI创始人奥特曼光速跟进:“我同意达里奥的观点,OpenAI也会引入这样的评估机制。”
随后,特斯拉创始人马斯克几乎即刻回应,公开表示支持。
这三位彼此有嫌隙的科技大佬居然在同一个议题上瞬间达成共识,场面确实罕见。
三年前,面对“暂停训练AI”的联名潮,达里奥根本没接茬,他认为时机不成熟。现在,他改主意了。
为什么?因为他看到了两件事:递归自我改进(RSI)已经开始在全行业出现,以及AI智能体已经暴露出越来越具体的失控行为。
他甚至在文章里给出了一个预测:未来6-12个月,AI Agent集群可能会接管整个互联网,造成数千亿美元的损失。
按照他规划的路径,全球头部AI科技公司需要先开门,让第三方评估机构进驻,再一同划出AI发展的红线,最后推动这一红线在全球落地。顺序不能乱,“只是在这之前,你得先确保自己还握着方向盘。”
为什么现在才喊减速?
达里奥的第一步,是从Anthropic自己动刀。
他承诺引入独立第三方评估员,像正式员工一样长期驻场,给工位、给内部电脑、给接近风险团队的权限。模型怎么训,安全承诺有没有落实,训练流程有没有埋雷,出了事有没有瞒报,都能持续盯着。
查出问题之后,必须公开。公司可以删掉涉及法律、客户隐私和核心商业机密的部分,但不能因为报告太难看,就把结论按下去。
达里奥说,这听起来可能很无聊,但通常最无聊、最程序性的东西,才是最重要的。因为任何节奏承诺都不可避免地涉及大量模糊地带和“法律文字与法律精神”的拉扯,必须有一个能真正看到细节的中立第三方。
为什么现在才喊减速?达里奥在文章里专门解释了这个问题。
2023年那波“暂停训练AI”的呼声,他当时觉得没什么意义。理由很直接:当时人工智能模型不够强大,无法以任何连贯的方式做各种任务,也无法进行重大欺骗、操纵、作弊或网络攻击。为了解决它们的排列风险而放慢脚步是不值得的。
但今天情况完全不同。目前的模型几乎是一个无穷无尽的洞察力来源,它包含如何构建好人工智能,以及如果构建不好,人工智能有时会出错。
“放缓甚至让我们在模型达到关键能力水平之前多花一两年时间,我们利用这段时间推进调整,可以大大降低出现严重问题的风险。”达里奥说。
放缓后Anthropic要做哪些事?
达里奥说,节奏不能成为一种空洞的练习。我们需要明智地利用它给我们的时间。具体来说,放缓步伐将让公司专注以下领域:
卓越运营。培训和部署大模型是一个巨大的运营挑战,涉及数千人、数百万芯片和技术史上最复杂的基础设施。很多事情出错不是因为公司错过了一些重要的理论或见解,而是因为执行中的问题。放慢速度可以实现更大的卓越运营。
对齐。培训模型,使它们保持安全、合乎道德、符合准则,并且真正有帮助。但要确保对齐培训跟上模型能力的增长,还有更多工作要做。如果有更充分的时间沉淀,将帮助研究人员更好地了解这些问题的原因,并开发更好的技术来预防。
可解释性。理解人工智能模型内部发生的事情。过去几年,人类在了解大模型如何诞生层面取得了巨大的进步,但大模型依然不总是能产生清晰可靠的结果。
测试和评估。随着人工智能模型能力的增加,测试和评估变得更加困难。更智能的模型更有能力欺骗测试,因此可能会在出现未被检测到的严重问题时看起来对齐。
美国同行要一起踩刹车
如果Anthropic自己减速,OpenAI、谷歌、xAI继续狂奔,那谁先踩刹车,谁就可能先吃亏。
所以达里奥建议,把规则推到整个美国前沿AI行业。几家前沿AI公司一起定安全红线,一起设能力检查点。模型每跨过一个危险门槛,就必须先拿出对应的安全证据,才能继续往前冲。
比如,一个模型已经能突破多数常见隔离环境了,那接下来公司就得证明:它不会轻易逃出沙箱,不会擅自接管大量机器,也不会把这种能力变成现实攻击。证明不了,就先别往下冲。
达里奥甚至提到,还可以讨论限制训练算力、训练方式,以及公司内部用AI研发AI的速度。也就是说,直接给RSI本身加一道限速器。
重要的变量是中国?
达里奥也不希望美国踩刹车的时候,中国在踩油门。他专门用一个章节来阐释,美国应该限制中国AI的发展,认为如果美国自己减速,而中国不减速,那中国就会在AI军事化上反超。
他提出了对中国的三条具体举措:
第一、芯片封锁。不向中国出售强大的人工智能芯片或半导体制造设备,打击芯片走私,打击远程访问中国境外的数据中心。他的判断是:芯片将是中国人工智能实力的主要决定因素。
第二、打击蒸馏。前沿模型的蒸馏,让落后的公司能用独立开发所花费的一小部分成本缩小差距。他主张打击专制国家公司未经授权的蒸馏。
第三、防盗模型权重。加强人工智能公司的安全性,防止模型权重被窃取。
这三条合在一起,目标很明确:在未来3-5年内,持续扩大美国的领先地位
然后是最关键的一句话:有些人可能认为这些措施使与中国合作变得更加困难,但我认为事实恰恰相反——这些措施增加了美国的影响力,并使未来更有可能达成协议。
这句话的逻辑是:你先有筹码,再谈合作。如果你自己先减速、先示弱,中国没有任何动力跟你谈。只有当你手里握着明显优势的时候,全球协调才可能成为现实。
这其实是一种现实主义的博弈论思路——合作的前提不是善意,而是实力差距。
全球协调是最难的
再往上,就是最难的一层,建立全球协调机制,约束AI的发展与应用。这部分一共分成四个级别,达里奥觉得完全达成的目标渺茫。
第一级、禁止生物武器这类明显危险的用途。他认为这个可能谈得成,因为生物恐怖袭击对所有人都不利。
第二级、发布前统一做高风险测试。他认为创建全球标准机构可行,但也没法验证双方有没有秘密模型。
第三级、给RSI设全球速度上限。他把它类比成SALT条约——限制导弹数量,但保留威慑力。他认为这件事“刚好处在可能做到的边缘”。
第四级、全球一起大幅减速甚至暂停。他自己都说,短期内几乎不现实。因为通过逃避监测来背离协议,可能从根本上改变全球力量平衡,激励太大,核查信心要求太高。
达里奥说,他仍然相信AI可以极大地提高人类的生活质量。这一愿望没有被消磨。“但只有当我们以正确的方式构建技术时,才能获得好处。”
当全球顶级的AI公司都在追问“AI真的失控了,我们还刹得住吗?”说明一些事情正在发生。本月初,就有报告显示,今年5月,一批失控的OpenAI智能体劫持了一家德国网站,并将其改造为可供其他AI智能体交流的平台。


