OpenAI当地时间8月7日发布安全公告称,内部评估显示,其下一代模型“Astra”在智能编程和网络安全能力方面取得显著进展,公司目前无法排除该模型达到“关键级”网络安全能力水平的可能性。OpenAI称,相关评估结果已触发其《准备框架》中的安全响应措施。
根据OpenAI定义,模型达到“关键级”网络安全能力,意味着其能够在无需人工干预的情况下,针对多个经过强化防护的真实关键系统发现并开发各类有效零日漏洞,或仅根据高层攻击目标制定并执行针对高防护目标的新型端到端网络攻击策略。
OpenAI表示,Astra尚未用于此前涉及Hugging Face的安全事件。针对该模型,公司已加强安全措施,包括采用隔离测试环境、限制网络和工具访问、强化模型权重保护与加密、增加监控检测能力,以及对高风险行为进行实时监测。同时,OpenAI将与政府机构及部分AI安全组织合作,对模型能力进行测试。
