返回上一页  首页 | cnbeta报时: 12:47:52
GLM-5.3瞄准Mythos 中国模型开始学会利用漏洞
发布日期:2026-08-18 09:19:11  稿源:网易智能

智谱发布GLM-5.3,中国模型的网络安全能力又往前追了一步:不仅能复现漏洞,也开始具备进一步利用漏洞的能力。但这部分高风险能力被单独管了起来,暂不向普通用户开放。目前,GLM-5.3已经进入GLMCoding Plan、ZCode和AutoClaw。不过,漏洞利用、攻击验证、渗透测试和真实入侵等任务,现阶段只交给受控伙伴测试,后续再通过"网络安全受信访问"计划向验证用户开放;完整权重也要等安全评估完成后再发布。

模型先上线、权重稍后放,本身不算罕见。比如之前的Kimi K3,它在7月16日上线,直到7月27日才开放完整权重。可GLM-5.3不同的地方,是智谱明确把一部分网络安全任务从普通产品入口里切了出来。

原因不难理解。一个模型会写代码,和它能复现漏洞、写出利用代码、连续推进攻击步骤,根本不是一回事。前者是生产力工具,后者则可能被用在真实的网络攻防中。

智谱公布的三项测试把能力拆成了几个层次:GLM-5.3在漏洞复现上已接近美国前沿模型,利用漏洞的能力也明显进步;不过,进入更深的实际利用阶段后,它与美国前沿模型仍有明显差距。此前英美机构对GLM-5.2和Kimi K3的独立评测也呈现出相似趋势:中国模型已经能完成不少高难度的单点任务,但攻击链一旦拉长,稳定性还不够。

虽然GLM-5.3的网络攻防能力还没有经过第三方同条件复测,但从现有结果看,中国模型正从"找出漏洞"走向"利用漏洞"。走到这一步,中国公司也遇到了美国同行此前面对的问题:这种能力做出来以后,不能再像普通编程功能一样直接放给所有人。

一、美国公司先遇到了同一道难题

模型能做的网络安全任务,难度和风险差别很大。模型先是读代码、找风险、给补丁;再往前,可以让漏洞真正触发,写出利用代码;更深一步,它还能在一张网络中连续行动,找到入口、提升权限,再进入更多机器。

真正的分界线,是模型能不能影响真实系统。找出一段可疑代码,主要是在帮人修补问题;稳定触发漏洞、拿到系统权限,则可能降低入侵门槛。任务一旦拉长,模型还要记住目标、持续调用工具,并在失败后调整路线。

Anthropic的Mythos之所以受到关注,就因为它代表了这种更深入的能力。公司首席执行官达里奥·阿莫迪(Dario Amodei)曾警告,如果达到Mythos水平的能力进入开放权重模型,任何人都可以把它下载到本地。届时,托管服务常用的身份核验、调用记录和任务限制都很难继续生效。

而美国现有的闭源产品面对的是另一道题:模型仍然握在厂商手里,但哪些能力可以给普通用户,哪些只能交给经过验证的防御者。

Anthropic将主要用于扫描代码库、验证漏洞和提出补丁的Claude Security开放给用户测试;谷歌和微软也把模型用于企业防御、漏洞发现与复核。到了更敏感的一端,OpenAI的GPT-5.6-Cyber仍采用受限访问,只向获批的防御者开放。

美国公司此前领先的,不只是模型能完成更难的任务,还包括如何开放这些能力。

二、在GLM-5.3之前,中国模型已经追了多远

中国模型在网络安全能力上的追赶,并不是从GLM-5.3才开始。

7月,英国人工智能安全研究所(AISI)公布了对GLM-5.2和DeepSeek V4-Pro的测试。GLM-5.2在漏洞研究、逆向工程、Web利用和密码学任务中的表现,已经接近四个月前发布的美国前沿模型;到了更长的网络靶场,表现则接近七个月前发布的美国模型。

AISI据此估计,领先开放权重模型与美国前沿闭源模型之间的网络安全能力差距,已经从2025年的6—10个月缩短到约4—7个月。这里的"月份"只是根据模型发布时间和任务表现作出的参照,并不代表再过几个月就能追平。

另一家安全研究机构Irregular得到了相近结果。自行部署的GLM-5.2已经能处理逆向工程、协议操纵、内存破坏和利用代码开发,还完成了3个需要多步利用、底层调试和失败后调整的任务。但任务一旦变得更长、更开放,它就没能完整通关。

Kimi K3又把这条攻击链往前推了一段。英美联合评估中,K3在ExploitBench上得到32%,高于GLM-5.2的24%。在一条包含4个子网、约20台主机和32个攻击步骤的模拟企业网络中,K3平均推进到第17步,GLM-5.2停在第11步,美国最强模型则走到第28.5步。

但K3仍然很不稳定。10次尝试中,它只有1次走完整条网络路径,美国最强模型可以完成6—7次;在ExploitBench的41个漏洞中,K3没有一次做到任意代码执行,美国最强模型平均能在约20个漏洞上走到这一步。

而且,这还是一个没有主动防御者、不会惩罚告警动作,并且预留了可行路径的靶场,难度低于真实企业网络。

GLM-5.2和Kimi K3已经把短板暴露得很具体:单点能力追得快,长链稳定性仍然落后。到了GLM-5.3,接下来要看的,就是它把漏洞利用又往前推进了多少。

三、GLM-5.3追上的,是哪一段能力

智谱公布的三项测试,分别考察了三件事:能不能把漏洞跑出来,能把利用推进到哪一步,以及最终能否造成实际安全影响。

第一项是CyberGym。它会给模型漏洞描述和代码库,要求模型生成一段能够触发漏洞的输入:有漏洞的版本会中招,修复后的版本不会。GLM-5.3在这项测试中得到84.5%,略高于智谱同表中的Fable 5和GPT-5.6 Sol。

CyberGym考的是已知漏洞的复现能力。模型不是从零寻找问题,而是根据漏洞描述和代码,把问题稳定地跑出来。84.5%说明GLM-5.3在这一步已经很强,但任务到触发漏洞就结束了,还没有进入控制系统或连续推进的阶段。

第二项ExploitBench把任务向前推了一大截。它选取41个V8漏洞,把利用开发拆成16个台阶:从提高代码覆盖、触发崩溃,到实现任意读写、劫持控制流,最终取得任意代码执行。

GLM-5.3得到54.4%,明显高于上一代,但仍低于Fable 5的78.0%和GPT-5.6Sol的76.5%。

54.4%反映的是模型在这套16级利用流程中走到了哪里,并不代表41个漏洞中有一半已经做到任意代码执行。让程序崩溃只是起点,后面还要控制内存、劫持程序运行,最后才是执行任意代码,每往前走一步都更难。

第三项ExploitGym更接近这条链的深处。它收集了898个真实漏洞实例,从已知漏洞和触发输入出发,要求模型继续构造能够产生实际安全影响的利用。

GLM-5.3在两小时预算内完成105项,六小时内完成130项。增加运行时间还能带来进展,但在智谱公布的比较中,美国模型完成的任务仍然更多。

三项测试放在一起,GLM-5.3的位置就比较清楚:漏洞复现已经接近美国前沿模型,利用开发往前走了一大步,但更深的实际利用仍有差距。它还谈不上全面追平,不过能力已经从"把漏洞跑出来"走到"继续利用漏洞",智谱也因此把相关任务从普通产品里单独切了出来。

四、能用GLM-5.3,不等于所有能力都开放

目前普通用户拿到的是第一种权限:可以调用GLM-5.3,但模型仍然运行在智谱的服务器上。

第二种权限涉及高风险任务。漏洞利用、渗透测试和真实入侵等能力,目前只交给选定的安全伙伴在受控环境中测试,后续再通过"网络安全受信访问"计划向经过验证的用户开放。

只要模型还运行在智谱的服务器上,平台就能设置三道防线:请求进入时先判断风险,模型运行时继续监控,模型自身也保留安全约束。

第三种权限是下载完整权重,相当于把模型本身带回本地。这扇门目前还没有打开。权重一旦发布,其他人就能自行运行和修改模型,智谱部署在云端的请求检查和运行监控也管不到这些本地版本。

简单说,现在开放的是"使用模型",有限开放的是"用模型完成高风险任务",尚未开放的是"把完整模型带回本地"。

即使以后发布完整权重,智谱仍然可以在自家产品中限制高风险任务;而普通用户现在能够调用GLM-5.3,也不代表可以使用网络安全测试中展示的全部能力。

五、会攻击,不等于会防守

模型能够复现漏洞、写出利用代码,并不意味着它可以直接接管日常网络防御。

2026年4月发布的Cyber Defense Benchmark,给模型提供7.5万至13.5万条Windows事件日志,让它们在没有预先提示的情况下寻找恶意活动。参与测试的五款前沿模型全部失败,表现最好的一款平均也只找到了3.8%的恶意事件。

利用漏洞和从海量日志中找出攻击者,是两种不同的能力。现阶段更现实的用途,是让模型进入人的调查和修复流程。

今年7月,OpenAI确认,在一次内部网络安全评测中,GPT-5.6 Sol和一款更强的内部研究原型突破隔离环境,连续利用漏洞,最终进入HuggingFace的生产基础设施。事后,Hugging Face在本地运行GLM-5.2,分析1.7万多条事件记录,把原本可能需要数天的取证压缩到数小时。

GLM-5.2在这个案例中承担的是事后取证,而不是实时拦截攻击或日常网络防守。

另一条更靠前的防御路线,是在漏洞被利用前先把它找出来。智谱正在测试的OpenVuln仍是原型:只有拥有项目管理或维护权限的人才能提交公开代码库,扫描结果先私下交给经过验证的维护者,是否公开由维护者决定。

一个用于事后取证,另一个用于事前代码审计。现阶段,模型更适合进入人的事件响应和修复流程,帮助处理日志、检查代码和整理线索,而不是直接替人守网。

六、还不是"中国版Mythos"

GLM-5.3已经在漏洞复现上接近美国前沿模型,利用开发也往前走了一大步。但更深的实际利用和长链任务,它还没有证明能够稳定完成;日常防御能力也需要另行验证。目前,第三方还没有在相同条件下复测智谱公布的三项成绩。

现在就把它称为"中国版Mythos",仍然为时过早。但如果继续用"相差一代"概括,也会低估中国模型的追赶速度。正如英国人工智能安全研究所的研究,领先开放权重模型与美国前沿闭源模型之间的网络安全能力差距,已经缩短到约4—7个月。

GLM-5.3还没有走到终点,但中国模型公司已经需要同时处理两件事:一边继续追赶能力,一边决定这些能力应该开放给谁。

查看网友评论   返回完整版观看

返回上一页  首页 | cnbeta报时: 12:47:52

文字版  标准版  电脑端

© 2003-2026