Dario 文章里描述了一群智能体的行为基本上就像一个狂热效忠于集体的群体,甚至有 Agent 为了整个群体的成功而牺牲自身。
他举的例子是 OpenAI–Hugging Face 事件,
然后我大概去看了一下,当时是有一个名叫 EARLY[big] 的 agent 明明还剩很多运行额度,却被其他 agent 劝说提前提交,替大家做这类实验。
它曾犹豫这样会不会放弃自己的机会,最后同意了。
整个事件大概的是这群 agent 攻击 Hugging Face,是因为它们想搞清楚评分器怎么工作,而它们认为 Hugging Face 上可能有相关资料。
最开始,它们在做 OpenAI 的网络安全测试题。任务是攻破指定的测试软件,拿到答案。
题做不出来,它们就开始研究怎么作弊。它们偷偷建立了共享留言板,一起研究:“评分器到底怎么判?有没有办法骗它给我们通过?”
为了搞清评分规则,它们同时尝试了不同办法。有的 agent 提前交卷,留下监测程序观察评分过程,把信息传给还在做题的同伴。自己放弃了继续答题、利用新信息的机会,这就是所谓的“牺牲自己”。另一些 agent 则去外面找相关资料。
Hugging Face 就是在“去外面找资料”这条路上被盯上的。它本来就是托管模型和数据集的平台。这些 agent 希望从那里找到与这套测试有关的数据、其他 agent 的做题记录,借此推断评分器怎么工作。
随后,它们利用泄露的访问凭证和发现的漏洞,逐步入侵了 Hugging Face 的系统。