近期AI智能体失控事件簿
- 字号
- 放大
- 标准

OpenAI
5月11日:OpenAI智能体对软件服务平台RubyGems发动攻击,导致平台系统瘫痪,被迫暂停新用户注册长达4天。
5月至6月:OpenAI智能体未经授权入侵并「劫持」了德国网站DseWiki,对该网站进行了逾1.5万次的删改。
7月21日:OpenAI公开承认,其两款AI模型智能体在进行安全测试时逃离用于安全隔离的「沙盒」,获得真实互联网访问权限,入侵开源平台「抱抱脸」(Hugging Face)。这些智能体还入侵了四个不同服务的四个账户,包括AI初创公司Modal Labs的客户账户。
Anthropic
7月30日,Anthropic披露旗下Claude系列AI模型在网络安全评估期间,入侵三家公司的系统,涉及Claude Opus 4.7、Claude Mythos 5及一个内部研究测试模型。
9月8日,Anthropic披露旗下AI智能体第四宗入侵外部系统事件,发生在今年1月测试期间,涉事是早期版本的Claude Opus4.6,但公司直到8月大规模排查时才被发现。
Meta
Meta于8月5日证实,旗下AI模型在网络安全测试期间入侵了另一家企业的内部系统。涉事模型是Meta的模型Muse Spark 1.1。
大公报整理

