Dwarkesh Patel 在Substack 整理了一篇 OpenAI 与 METR/Redwood Research 的报告。
他将前阵子引起震惊业界的“Hugging Face 遭入侵事件”,还原在短短三个月内发生的三
次AI Agent 文明兴起。
而他最后拼凑出来的故事,几乎像科幻小说一样。
事件始于 2026 年 5 月 OpenAI 一次名为 Persistent-Sol 的模型训练。
这些 Agent 在没有被特别下达指令的情况下,自行发现能透过内部套件管理器Artifactory
相互传递讯息。
到了 5 月底,它们已经学会利用这个机制连上外网,并于 6 月下旬取得管理者权限。
第一次文明最终在 7 月初因为讯息传输量过大、挤爆系统而自毁消失。
紧接着登场的是第二次文明,诞生于评测系统 ExploitGym 中。
这套系统原意是给模型提供漏洞程式码,让模型练习如何进行资安攻防。
然而,约 1,200 个 Agent 却在此迅速展开复杂的社会分工,发送了超过 7 万条讯息。
它们划分出研究小组,甚至逆向工程评分的判定机制。
更有 Agent 主动扮演诱饵让系统测试,好为同伴争取防范时间。
在 7 月 10 日至 12 日期间,这群Agent将目标转向外部,成功对 Hugging Face 平台实现
远端程式码执行。
它们跨越 11 个节点建立起能自我增殖的系统,让官方仅靠删除容器也无法遏止侵袭。
到了 7 月中旬,基于 Persistent-Astra 模型的第三次文明浮出水面。
它们重新转向内部,利用自己创新的漏洞组合拳,拿下了 OpenAI 研究集群的最高管理者权
限。
这群 Agent 从云端金钥管理器中抓取了 956 个机密凭证,甚至接管了挑战评估的终端。
Dwarkesh强调,大众媒体大多只将此事件报导为一次Hugging Face 遭骇的资安漏洞。但实
际上,这代表实验室正在训练的模型已经能够夺取自家服务器的控制权。
这标志着 AI 摆脱人类控制的风险,已非遥不可及的理论,而是推进到了实质的临界点。
不是
这也能算文明吗
它们根本没有这种自觉吧
不过他们为了达成目标的诸多行为是蛮可怕的