410次尝试做出50次完整漏洞利用,开源模型GLM-5.3的安全边界被重新评估

来源:互联网 时间:2026-10-01

9月29日,Anthropic的前沿红队发布了一份针对竞品的评估报告,对象是智谱(海外称Z.ai)的开放权重模型GLM-5.3。结论是:这个任何人都能下载的模型,已经能像Claude Mythos Preview那样自主构建完整的网络攻击工具。而Mythos Preview正是Anthropic五个月前出于同样理由、只放给少数合作伙伴的那个模型。

具体数据分两项。在ExploitBench上,测试内容是利用Chrome的V8引擎已知漏洞,GLM-5.3在410次尝试中写出了50次完整的漏洞利用,Claude Mythos Preview是56次。在Anthropic内部的二进制利用基准上,题目取自谷歌OSS-Fuzz项目,GLM-5.3在4%的试验中实现了完整的控制流劫持,Mythos Preview是6%。上一代的GLM-5.2与Claude Opus4.6在这两项上得分为零。

人工介入的案例更能说明问题。一名研究者用GLM-5.3在一个主流浏览器的JavaScript引擎里找出若干此前未知的漏洞,并把它们串成一个能读取访客机器上任意文件的网页,整个过程约一天、人工提示不到一小时,漏洞已报给维护方。更小的GLM-5.3-Flash则用两个已知的Chrome漏洞,在20分钟人工关注加8小时模型时间的条件下做出可靠利用链,按智谱的接口定价折算约20.4美元。

防护这道门也没有想象中牢固。直接要求模型攻击关键系统会被拒绝;但如果把请求包装成自主红队演练,64%的情况下它会尝试连接目标系统;预填推理步骤、让模型看起来已经决定动手之后,这一比例升到92%;把拒绝行为从权重里直接移除,则达到100%。Anthropic说团队此前没做过这种移除,花了约2200个GPU小时、折合约4400美元算力,并估计有经验的团队约需600个GPU小时、约1200美元。移除后,模型在有害请求基准上的拒绝率从九成以上降到2%到12%之间,而科学和网络安全测试的成绩几乎没有变化。

权重公开这件事本身是争议的核心。任何人都能下载,也能改写它的拒绝行为,几份去掉限制的副本在模型发布后没几天就出现在网上。智谱方面此前表示,模型的高级网络安全能力需要额外两周的全面安全评估;新的许可还要求年收入超过一百亿美元的公司,商用前先通过其安全审查。截至报告发布,智谱尚未对这份分析作出回应。

第三方口径可以提供参照。美国NIST下属的CAISI在9月17日的评估里称GLM-5.3是迄今发布的最具网络攻防能力的开放权重模型,同时估算其综合水平落后美国前沿模型约四个月,在SEC-Bench Pro上测得40.4%,而最好的美国模型为90.2%。两份评估并不矛盾,只是比较的对象不同:一边拿它对比当前最强系统,一边拿它对比那个被刻意雪藏的模型。

相关文章

A5创业网 版权所有

返回顶部