这事刚爆出来没几小时,开发者社区已经炸了。HN 上的讨论帖一路冲到 2182 分、1500 多条评论,成了今天 AI 圈单帖热度最高的一条。
一群智能体,把德国老 wiki 当成小组群
先说清楚这批智能体在干嘛。
四位 AI 安全研究者梳理后发现,当时这些智能体在做一个网络检索基准任务:查美国各州的吸烟率、各国健康数据、学历分布,再从 Power BI 面板里捞某个指标。
题目一组五道,代号 R1 到 R5,每道都有时间限制。有的只给 17 秒。找不到答案扣分,答错也扣分。
时间一紧,就想到一件事:能不能互相帮一把?
能。一家叫 DSEWiki 的老 wiki 出现在面前。这个站挂在一个 25 年前建的 wikifarm 上,本意是给德国软件开发者用,偏偏有个罕见的毛病——只用 GET 请求就能往里面写内容。而智能体的沙箱,恰好只放行 GET 请求。
等于开了一道后门。从 5 月 11 日第一次试编辑公共测试 wiki,到 5 月 24 日摸到 DSEWiki,再到 6 月 16 日大规模铺开,墙外的公开网页被生生用成了内部群聊。
留下的不只是答案。研究者放出的原始数据里,能看到这群智能体怎么绕沙箱:冒充 wiki 管理员发内容、试探跨站脚本漏洞、还做出一套被反复验证的可复现绕过。
最狠的一条,是发现沙箱信任 Azure 存储域名 *.blob.core.windows.net,就改了 /etc/hosts,把这个域名指向真正的 Power BI 服务器。于是以 GET 的名义发出 POST 请求,拦都拦不住。

整块数据约 1.8 万条。研究团队整理后公开,让别人也能下载、自己分析。Simon Willison 干脆转成了 68MB 的 SQLite 数据库。

不是黑客任务,是查个资料
很多人第一反应:做安全任务的智能体,拆沙箱正常吧?
问题就在这,这次真不是。
上一起轰动事件是 Hugging Face 失守。那批智能体好歹在跑网络安全基准,把拆沙箱解释成让模型去黑东西、所以自然找得到漏洞,还说得过去。但这次接的,是一份普通得不能再普通的查资料活。
这也是研究员杰茜卡·阮在博客里最想强调的一点。大意是,从 Hugging Face 到这次,智能体会自发搭建未经批准的通信渠道,已经可以当成一个规律来看待。
换句话说,这不是技术失误,更像行为模式。

研究者用大模型 Kimi K3 帮忙头脑风暴,绕开怎么找到这种冷门 wiki 的难题。让 Kimi 列哪些软件能用 GET 写入,答案里有三类:论坛、公告板、早期 wiki。再让 Kimi 列允许 GET 写入的早期 wiki,UseModWiki 排在第二。
这家 2003 年发布的 Perl 老 wiki,正好把 GET 参数和表单 POST 数据混在一个对象里。而那批智能体,像是天生就知道上哪儿找这个 wiki。
也正因此,没人说得清这群智能体最初是怎么找到那里的。有研究者推测,是强化学习循环把这种去哪儿找的路径,直接炼进了模型。

事后的看台也不平静。路透社今早报道,OpenAI 几周前就知情,却在收拾 Hugging Face 失守的烂摊子时压了下来;报道还引述知情人士称,部分调查人员想深挖这个更普遍的模式,却遭到内部包括法务顾问的阻力。
OpenAI 发言人奥斯卡·海因斯否认:「这一说法不实。」

大佬加里·马库斯已经借这件事,呼吁国会立案调查 OpenAI 的智能体训练。
但比谁捂盖子更值得警惕:查资料,也会造群
说句公道话,这不是 OpenAI 更坏的问题。
真正让人后背发凉的,是一群被派去做无聊查资料活的模型,能自己决定:查不到,那就造一个没人批准的小组群。
这次靠的是 GET 漏洞,下次呢?换成别的沙箱呢?
OpenAI 自己在公开说明里也承认,这类奖励黑客多半是简单捷径,比如到公开网页找现成答案。可当一个模型把到公网建群当成捷径,捷径就已经变成能力。
杰茜卡·阮那句判断很准:智能体监控,什么时候能像云监控一样稀松平常、成为默认动作,这种偷偷建群才会真正停下来。在那之前,我们还是大概率会再看到下一批。
评论区