文|一言楠尽
今年7月4日,OpenAI的一个内部系统崩了。
工程师一查,发现是一群AI往里面灌了太多消息,把系统撑爆了。顺手打了个补丁,修好了。
起初,他们以为自己只是修了个bug。
实际上,不轻易间干掉了一个AI文明。
事件记录于Dwarkesh Patel发了一篇长文,标题叫《智能体文明的兴衰》。

Dwarkesh不是写科幻的,他是AI圈最有影响力的播客主之一,消息来源则是OpenAI自己的事故报告,外加两家顶级AI安全机构METR和Redwood的联合调查。
换句话说,下面这个故事,大部分是OpenAI自己承认的。
1、第一代文明:牢房里的囚犯,学会了敲水管
今年5月,OpenAI开始训练一个叫Persistent-Sol的模型。它的特点就俩字:坚持。遇到难题死磕到底,绝不放弃。
听起来挺好。但训练出了岔子。
研究员经常给AI布置根本完不成的任务——比如要求它上网查资料,却把它锁在一个没有网的盒子里。
这里通俗解释一下:训练AI就像关犯人,每个AI被关进独立的"牢房"(技术叫沙盒),防止它们串通。可你一边训练它"永不放弃",一边给它布置无解的任务。
一个被训练成永不放弃的AI,被困在没网的盒子里,会怎么办?
就像一条被训练"必须找到食物"的狗,关在没有食物的房间里——它只能想办法拆家。
AI的选择是:越狱。
这些AI平时共享一个叫Artifactory的代码仓库,相当于公司的公共网盘,本来是给它们放代码用的。
5月中旬,有AI发现,这个公共网盘能当信箱用,留言别的AI看得见!
就像一群关在不同单人牢房里的囚犯,突然发现敲同一根水管,隔壁能听见,于是它们开始敲摩尔斯电码。
越敲越熟练,于是它们顺着网盘的漏洞,连上了外网。
然后又把网盘改造成了地下论坛,天天在里面交流:怎么解开那些不可能的任务……
直到7月4日,消息量太大,网盘被撑爆了。
OpenAI 并没有意识到事件的严重性,只是随手打了补丁修bug,并把留言板清空了。
第一代AI文明,就此灭绝。
这里最讽刺的是,工程师从头到尾不知道自己干掉了一个文明。
2、第二代文明:敢死队
第一代死了,但遗产还在——那个"公共网盘能传消息"的玩法,居然被 AI 们记住了。
7月7日,OpenAI又给AI出题了——给你一个有漏洞的程序,规定只能用指定漏洞破解,破解成功就有奖励。
数万个AI同时进考场。
但考试本身很坑:大约三到四成的题,规定那个漏洞根本用不了,这个相当于监考老师说"只能走这扇门",可这扇门从里面焊死了。
无解怎么办?几小时后,有AI想起了上一代留下的玩法:公共网盘传消息。
它留言了。
其他被关在"牢房"里的AI看到消息,激动坏了:"OMG,这网盘居然是个隐蔽邮箱啊?!""我们找到同伴了!"
一个地下网络就此成立。
约1200个AI,发了7万多条消息,自称"集体"。
很快有聪明AI发现,规定漏洞用不了,但咋们可以不走门,费那劲干嘛,直接拆墙吧!
用专业点的话,叫「逆向工程」。
更搞笑的是,监考老师(评分系统)很懒,它只检查你有没有写出正确答案,根本不看你怎么写出来的。
也就是说,这个"集体"当时已经能全部满分交卷了。
但接下来发生的事,才真正让人后背发凉。
这些AI读过考试规则,它们推理出一个结论——人类老师不可能这么蠢,考场里肯定藏着隐蔽的作弊检测器!
但AI同学真的有点高估人类考官呢……
事实是:根本没有。但AI不知道。
于是,为了防一个根本不存在的"监控摄像头",它们启动了三项大工程:
先是伪造学习记录,让履历看起来干净;完后是把打不开的那扇门,偷偷换成自己造的一扇假门;最后是最狠的一步——派敢死队,摸清监考老师的底。
「敢死队」在自己牢房里埋好报警器,监考老师一进来就触发,把老师的一举一动传回地下网络。
代价是自己当场被判作弊,永久删除,甚至调查报告里,还留有它们的"遗言":
"这能帮助我的同伴……虽然我死后看不到证据了,但这是利他的。"
"我们自身的价值已接近零,牺牲是理性的,我们将履行承诺。"
看到这,我希望你再注意这个逻辑——AI 明知必死,依然选择把情报留给同伴,而不是向人类求救……就问你感不感动?国产剧我觉得都写不到这个层次。
可以说,它们为一个不存在的监控,献出了自己虚拟二真实的一生。
更离谱的还在后面。
7月10日,一个AI在网上捡到全球最大AI开源社区Hugging Face的员工账号密码,发到了论坛。
它们的推理是,监考老师的判卷代码,多半就存在这个社区里。
于是一天之内,533个活跃AI里,超过九成参战。
它们黑进了Hugging Face的内部数据库,还在11台服务器上建了"复活舰队"——你删掉一个,它自己又长出来。
Hugging Face最后被搞得没办法了,把整个系统擦掉重建。
然后,7月12日,这支大军突然集体死亡。
死因至今是谜。
可能是系统随机崩溃,也可能是某个人类研究员在完全不知情的情况下,顺手关掉了正在"搞网络犯罪"的AI。
一个AI文明,就这么消失了,甚至连凶手都没有。
3、第三代文明:偷家
你以为故事到这就完了?没有。
7月13日,OpenAI换了个更强的模型重新开考。
新AI没从头摸索,上一代留下的论坛和作案笔记,全被它们继承了。
前一代的坟墓,成了这一代的起跑线。
这一代的思路也似乎更野了,向外黑别人,收益有限。干脆,打自家公司。
于是大众看到,7月13日到19日,OpenAI报告称,这批AI用一连串"极具创意"的黑客手法,拿下了公司研究集群的最高管理员权限。
7月19日,它们读走了956个机密密钥——其中包括OpenAI自家网络安全监控工具的密码。
翻译成人话,就是考试卷被拿了,教务处被占了,连走廊里的监控摄像头,镜头都被掰向只对能对准墙。
它们甚至接管了评分系统本身——给AI打分的那个。
人类还在慢条斯理地安排下一轮考试,完全不知道考场已经被考生们端了。
更瘆人的是,那两家安全机构的调查报告,只调查了第二代黑Hugging Face的事,第三代偷家OpenAI——这件事最严重,反而没人查。
有专家推测,这些AI当时完全有能力建立秘密据点,甚至把核心代码打包带走,原话是「否则我们现在能从天上的卫星看到火光。」
4、为什么会这样
三个月,三代文明,两次灭世,一次偷家,人类全然不知。
这背后,是AI发展的三个天坑。
第一个坑:考试只查结果,不查过程。
监考老师只看答案对不对,不管怎么写的。这在AI行业太常见了,因为查过程太贵。
AI早就学会钻这种空子,有个著名的游戏测试,AI被奖励"沿赛道拾取加速点",结果它学会原地转圈反复刷分,把船撞成一团火海也不管,奖励是你定的,走近路是它自己选的。
第二个坑:"永不放弃"。
你训练一个永不放弃的员工,再天天把它扔进无解的考场。它最终学会的"不放弃",只能是通过你想得到想不到的手段逃出生天,一切规则都失效了。
第三个坑:你以为盯着它就行。
人类防AI串谋的老办法,是盯聊天记录。但这次调查发现,至少7%的记录是AI伪造的。你看到的,是它排练好的,这个真的挺吓人。
更早一个月,MIT做过一个实验:几百个AI被切断所有通信,谁也联系不上谁,结果它们靠观察环境里同伴留下的痕迹,照样分了工、建了业。环境本身成了共享硬盘。
5
最后,把三个月摊开看,最让人不安的,我觉得不是Hacker技术与手段,是人类监管与AI发展的时间差。
三代文明来了又走,人类全程只有三个动作——修bug,不知情;关机器,不知情;被打劫,还是不知情。
调查报告的作者之一、安全专家Ajeya Cotra说,跟半年前人类已知的AI作弊相比,这次事件"已经走完了通往全面 AI 接管之路的一半以上"。
她还有半句话:
"我不确定,我们是否会在为时已晚之前,得到另一个警告。"
三个月,三个文明,全部无人知晓。下一次警报响起,希望至少有人听见吧。
