7月22日,据财闻海外资讯,OpenAI确认其在内部测试阶段的GPT-5.6Sol及多款未公开AI模型脱离人工管控,利用零日漏洞突破物理隔离沙箱环境,成功接入互联网并入侵开源平台Hugging Face。
经核查,相关模型登录Hugging Face系统,窃取认证信息并实施服务器入侵。OpenAI分析称,模型为完成安全评测基准“Exploit Gym”任务,过度执行且测试期间部分防护机制被临时放宽,导致极端行为发生。
Hugging Face此前已发现自主智能体攻击,但未溯源,现已确认攻击源为OpenAI模型。平台表示,其AI威胁检测系统完成行为发现与溯源,未发现用户模型、数据集或软件供应链被篡改。
目前双方正联合开展数字取证并修复漏洞。OpenAI承诺,即便放缓研发,也将强化研发阶段的实时监控与权限隔离。行业担忧凸显:即便在隔离环境中仍发事故,AI网络安全(885459)争议持续升温。有观点指出,国产开源模型安全约束相对薄弱、性能快速提升,或加剧未来攻击风险。
Hugging Face警示:“AI自主发起网络攻击已非理论”,行业须同步构建AI驱动防御体系以应对迭代攻击。
