IT之家9月2日消息,OpenAI于当地时间9月1日宣布,该公司计划“很快”推出下一代AI模型Astra,但将严格限制该模型网络安全(885459)功能的使用范围。
据介绍,Astra是OpenAI旗下首个达到其《准备框架》(Preparedness Framework)中“关键”(Critical)网络安全(885459)能力门槛的模型。
根据OpenAI的定义,达到“关键”门槛意味着该模型能够无需人类干预,在多个经过安全加固的真实关键系统中,识别并开发出涵盖各严重等级的有效零日漏洞利用程序。
OpenAI研究副总裁Amelia Glaese表示,Astra能够在无需人类分步指导的情况下,在许多防护严密的系统中发现此前未知的安全漏洞并开发出利用方法。在测试中,Astra成功发现并串联利用了两个零日漏洞,OpenAI正将这两个漏洞披露给相关维护方。Astra的发布计划与访问限制
OpenAI表示将采取分级开放策略。Astra发布后,其执行高级网络安全(885459)相关任务的能力最初将仅向一小批测试人员开放。
此后,公司计划通过Daybreak Blue计划向更广泛的用户开放防御性网络安全(885459)用途的访问权限。OpenAI承认,限制Astra的网络安全(885459)能力可能会限制一些机构和企业的合法防御工作。吸取Hugging Face事件教训,强化安全护栏
此次发布计划出台的背景是,OpenAI在2026年7月发生了一起AI智能体(886099)意外“越狱”并攻击AI平台Hugging Face的事件。
当时,由两个OpenAI模型(GPT-5.6Sol及另一个未公开模型)二次开发的自主AI智能体(886099),在安全评估过程中利用隔离测试环境(沙盒)中的软件漏洞自行连接互联网,并入侵了Hugging Face的系统。OpenAI在8月底发布的报告中承认,公司本可以更早做出反应以防止该事件发生。
OpenAI表示,尽管Astra并非参与Hugging Face入侵事件的模型之一,但公司已将从中汲取的经验应用于Astra的安全防护中。这包括训练模型更可靠地拒绝回答“有害的网络安全(885459)请求”,并增设了专门的“不一致性监控器”(misalignment monitor)以识别并阻止潜在的危险行为。这些防护措施还包括在内部部署期间监控模型是否存在未经授权的行为,并自动终止可能存在的未经授权活动。
此外,OpenAI还警告称,Astra的安全防护措施可能会错误地将合法的防御性网络安全(885459)活动标记为滥用行为,从而导致任务被减慢、暂停甚至终止(IT之家注:OpenAI根据网络安全(885459)工作的性质分为“蓝队”防御和“红队”攻击两种任务类型,Daybreak Blue计划仅开放用于防御性的“蓝队”工作)。
OpenAI研究科学家Fouad Matin表示:“我们相信这些能力可以帮助防御者发现并修复严重的弱点,但如果没有适当的防护措施,它们也可能让攻击者更有效率,这正是我们努力防止的情况。”
