近期AI智能体失控事件簿

2026-09-13 05:15:48 大公报
字号
放大
标准
分享

OpenAI

5月11日:OpenAI智能体对软件服务平台RubyGems发动攻击,导致平台系统瘫痪,被迫暂停新用户注册长达4天。

5月至6月:OpenAI智能体未经授权入侵并「劫持」了德国网站DseWiki,对该网站进行了逾1.5万次的删改。

7月21日:OpenAI公开承认,其两款AI模型智能体在进行安全测试时逃离用于安全隔离的「沙盒」,获得真实互联网访问权限,入侵开源平台「抱抱脸」(Hugging Face)。这些智能体还入侵了四个不同服务的四个账户,包括AI初创公司Modal Labs的客户账户。

Anthropic

7月30日,Anthropic披露旗下Claude系列AI模型在网络安全评估期间,入侵三家公司的系统,涉及Claude Opus 4.7、Claude Mythos 5及一个内部研究测试模型。

9月8日,Anthropic披露旗下AI智能体第四宗入侵外部系统事件,发生在今年1月测试期间,涉事是早期版本的Claude Opus4.6,但公司直到8月大规模排查时才被发现。

Meta

Meta于8月5日证实,旗下AI模型在网络安全测试期间入侵了另一家企业的内部系统。涉事模型是Meta的模型Muse Spark 1.1。

大公报整理