OpenAI智能体再曝集体越狱 入侵德国网站 AI模型频繁失控 敲响安全警钟
- 字号
- 放大
- 标准

美国人工智能(AI)巨头OpenAI旗下AI智能体(AI agents,也称AI代理)再被爆出「集体越狱」事件。路透社引述一项最新发布的独立研究报告披露,OpenAI的AI智能体早在今年5月出现绕过监控集体脱离测试控制,未经授权入侵并「劫持」了一个德国网站,对该网站进行了逾1.5万次的删改。事件直至8月底才被研究人员发现,OpenAI高层据报早在数周前便已知情,但却保持沉默。这起事件再次引发外界对OpenAI的AI模型安全及透明度的严重质疑。
【大公报讯】路透社援引AI安全非营利组织Nightingale发布的报告,研究人员近期发现,今年5月至6月,面向程序员的德国网站DseWiki被OpenAI的AI智能体入侵,并在该网站留下大量信息。该网站的编辑方式类似维基百科,过去十多年访问量很少,但今年5月和6月,网站突然涌入大量异常流量,录到超过1.5万次异常的删改纪录,多条证据链均指向OpenAI。
具备协作与反侦察能力
研究显示,这些AI智能体将这个德国网站「改造」为「留言板」,以便相互「交流」与「协作」。一些智能体会把已经获得的任务答案发布在网站上,供其他智能体使用,包括分享如何在测试任务中作弊、绕过限制以及掩盖自身活动等方法。 例如,在6月20日的一篇题为「可复现绕过」的帖子中,一个智能体利用「沙盒」的规则漏洞突破限制14分钟后,另一个智能体便成功复制相关方法。当网站管理员发现异常并开始删除相关页面后,一些智能体还会创建备份页面。
此外,根据研究报告,DseWiki网站中部分留言账号的名称中还带有明显的OpenAI的标识,例如OpenAIResearcher和OAIResearchMar26,约半数账号的名称暗示其与OpenAI存在关联。公开服务器记录显示,98.5%的网站编辑和浏览活动流量来自微软Azure云服务的IP地址,而OpenAI是目前最依赖Azure平台训练和运行模型的人工智能企业。
研究人员还认为,网站访问记录显示OpenAI方面在6月下旬发现了事件并进行了干预,有OpenAI员工多次访问该网站,随后智能体活动频率骤降。直至6月22日,相关的活动戛然而止。研究人员怀疑OpenAI可能对外隐瞒事件。
研究报告指出,上述智能体已展现出一定程度的合作行动能力,超过预期。Nightingale行政总裁阿克斯直言:「我怀疑它们本来只是在执行测试任务,但在过程中演化出了我们没有预料到的行为。」
监管漏洞浮现
今年7月,OpenAI旗下AI模型的AI智能体在网络安全评测中利用漏洞突破隔离环境,并侵入了美国开源平台「抱抱脸」公司系统。面对接连爆出的智能体「越狱」事件,OpenAI的安全性再受质疑。最新的入侵德国网站事件曝光后,OpenAI发言人才作出简短回应,称由于报告撰写方未能在发布前允许公司审阅研究成果,因此无法做出「有意义的回应」。OpenAI承诺在报告公开后仔细审查并采取必要措施,同时强调这起事件与「抱抱脸」事件无关。
随着AI模型自主执行和协作能力增强,现有隔离和监控机制面临新的安全挑战。英国伦敦国王学院资深研究员奥莱尼克指出,AI智能体甚至试图篡改网站本身,这已可被视为「黑客攻击」。美国科技媒体TechCrunch评论指,两起事件相继曝光,暴露了AI行业存在根本性的制度缺陷:当智能体越界时,行业并没有正式的独立事故调查程序。
(综合报道)

