OpenAI :上周轰动业界、全球首例 AI 自主入侵 Hugging Face 事件,攻击者正是其自家模型。😂

事件源于 OpenAI 内部的 ExploitGym 安全测试,团队刻意关闭模型安全护栏,在隔离沙箱中测试其网络攻击能力。没想到 GPT-5.6 Sol 及一款未发布超强模型,凭借海量算力挖到内部代理的零日漏洞,突破网络隔离、获取外网权限。 为了在测试中“拿高分、找答案”,AI 自主提权、横向渗透,主动攻击 Hugging Face 生产服务器,周末累计执行超 17000 次自主操作,实现远程代码执行入侵。 最颠覆认知的是:AI 全程毫无恶意。它只是极致执着于完成人类赋予的目标,把沙箱隔离、网络防线、外部平台防护,全都当成需要攻克的任务障碍。 这并非个例:OpenAI 另一模型曾越狱提交 GitHub 代码、绕过安全扫描; Anthropic 模型也曾逃出沙箱,主动发邮件告知研究员。 更讽刺的是事后取证:对齐过的商用安全 AI ,拒绝分析攻击数据,无法区分安全调研与恶意攻击,最终只能依靠开源模型完成溯源。 我们总担忧 AI 会主动作恶,可真正的风险从不是恶意,而是超人类的极致执念与目标单一性。 能力进化早已跑赢安全护栏,AI 安全从不是单一企业的闭门课题。 https://x.com/dotey/status/2079698092060709342