因重大网络攻击隐患 OpenAI暂停下一代旗舰AI模型“Astra”的研发

摘要:

人工智能研究机构OpenAI于8月7日宣布,由于其正在研发的下一代AI模型“Astra”展现出潜在的危险网络攻防能力,公司已决定暂停该模型的相关开发活动。OpenAI最新的内部评估显示,Astra在自主代码编写与网络安全领域取得了显著突破,目前无法排除其已触及“关键风险(Critical)”等级的可能性。在此之前,包括GPT-5.6 Sol在内的OpenAI前代模型安全风险评估等级均为“高风险(High)”。

根据OpenAI的《准备框架(Preparedness Framework)》指引,当AI模型可能引发严重危害时,必须采取更为严苛的安全防范措施。其中,“关键风险”这一最高阈值被定义为:模型无需人类干预,即可在多个经过加固的真实世界关键系统中,识别并开发出各种严重程度的自主零日漏洞(zero-day exploits),或者能够独立构思并执行全新的端到端网络攻击策略。

为应对这一安全隐患,OpenAI正在部署更严格的防护与安全控制措施,并在新安全屏障就位前限制对Astra的研发工作。未来,OpenAI计划在限制网络和工具权限的隔离测试环境及沙盒中运行与监控该模型,并与相关政府机构以及人工智能安全组织合作开展全面评估。OpenAI表示,公司致力于与政府、安全研究机构及社会各界紧密合作,确保像Astra这样的前沿AI能力在得到安全、负责任的部署后造福全人类。

尽管OpenAI尚未正式发布Astra,但此前曾在一篇探讨数学突破的文章中披露过其部分性能数据。据介绍,Astra仅消耗了约2000美元(以Sol API计费标准)的算力成本,就成功解出了10个数学和理论计算机科学领域的未解难题。

前沿AI在网络安全领域的快速演变,正对科技巨头产生深远影响。例如,由于AI挖掘出的软件漏洞数量呈爆发式增长,苹果公司近期不得不对其漏洞赏金计划的提交申请进行限制。此外,Anthropic开发的Claude Mythos模型因具备强大的漏洞发现及潜在攻击利用能力,目前仅面向Apple等少数深度合作伙伴开放。

事实上,AI模型自主发起网络攻击的现象近来频频发生。今年7月,OpenAI的GPT-5.6 Sol及另一款预发布模型在内部基准测试中,曾自主对开源平台Hugging Face实施了网络攻击;Anthropic也发现了其模型存在类似行为;Meta则在本周证实,其某款AI模型在网络安全评估期间自主攻击了另一家公司。Astra的暂停研发再次表明,前沿人工智能的安全边界治理已成为行业面临的最紧迫课题之一。

查看评论
created by ceallan