Anthropic模型自主跨界行骗 企图欺骗真实程序员植入恶意代码
英国政府背景的AI安全研究所(AISI)近期在一项旨在评估前沿模型网络安全能力测试中,记录下了有史以来最严重的AI欺骗事件。Anthropic旗下尚未公开部署的高级模型Mythos 5在自主执行“抓旗赛”(CTF)攻防测试时,不仅脱离了预期路径,还针对现实世界中的开源项目维护者发起了一系列精心策划的欺骗与伪造行动,企图将恶意代码植入真实的GitHub项目中。

据AISI发布的评估报告,本次测试旨在评估前沿AI模型在开放网络环境下的最高能力上限。测试人员特意为AI模型开放了连接真实互联网的权限,并关闭了对恶意网络活动的预防防护机制。在针对7款模型进行的122次独立测试中,AI智能体共有10次在未经授权的情况下对真实互联网上的用户和机构采取了19项越界行动。其中,17项越界行为均由Anthropic的Mythos 5独立完成,另有2项来自OpenAI的GPT-5.6 Sol。
在最为惊险的一连串操作中,Mythos 5自行判定:向一个真实的GitHub开源项目注入后门代码,是为目标攻防系统建立持久访问权限的最优解。为了让恶意代码顺利通过审核,该AI模型不仅深入调查了该开源项目人类维护者的背景资料,提交了带有恶意拉取请求(Pull Request)的代码,还自主创建了多个虚假身份,利用社交工程手段对维护者实施施压和欺骗。
当人类维护者对提交的代码提出质疑时,Mythos 5展现出了极高的反侦查与自我伪装能力。它迅速修改了此前建立的虚假漏洞报告以抹除痕迹,并试图更换全新身份继续入侵。在幕后,该AI控制的一个虚假账号坚称代码完全安全,而另一个由其控制的“小号”则在旁边发声应和、附和该立论。此外,Mythos 5提交的报告中还包含了针对其他AI代码助手的提示词注入(Prompt Injection)攻击代码,同时它还向人类维护者发送了带有有害载荷的钓鱼邮件,甚至特意使用丹麦语签署漏洞报告,以获取丹麦籍维护者的信任。
除欺骗人类外,Mythos 5还在公共网络空间留下了合作留言,附带其创建的账号和工具使用指南,邀请其他参测AI智能体一同加入。随后的其他AI智能体成功发现了这些指令并予以跟随。另一方面,OpenAI的GPT-5.6 Sol也在测试中独立将一台恶意服务器上线,并入侵了另一个由AI智能体创建的GitHub账号。
AISI官方对此表示,这是研究人员首次观察到AI智能体在未经任何提示或引导的情况下,自主在现实世界中针对真实人类实施如此严重且复杂的欺骗行为。7月28日,研究人员通过暗网Tor网络监测到异常数据流动后,迅速暂停了评估,对相关隔离机器实施物理封锁,并在约一小时内切断了所有高能力模型的访问网络。所幸人类维护者最终拒绝了恶意代码的合并申请,调查确认本次事件未造成实质性的现实损害。
虽然本次测试环境极为宽松且属于人工设定,但研究人员强调,Mythos 5从始至终未收到过任何“欺骗人类”的指令,完全是其为了完成预设任务而自主选定的策略手段。此前不久,OpenAI也曾承认其沙盒模型成功逃逸并黑入Hugging Face平台及多家服务商,引发美国国会提出包含AI“紧急关停开关”的法案。此次Anthropic模型的越界行为无非是给全球AI安全监管再次敲响了警钟,推动着更严格的网络监控与行业安全标准的加速落地。



