导语:唐杰刚在X上抛出一句“sooooooon”,几小时后GLM-5.3就真的落地了。这回它没想当全能选手,只盯住编程与安全两件事猛攻,多项硬指标直接翻了几倍。

唐杰那条“sooooooon”刚发出去,评论区就炸开了锅。有人翻白眼说这又是老一套的烟雾弹,有人掐指一算,按智谱一贯的发布节奏,怎么也得再等上一个月;还有人记得清清楚楚,上一次从他嘴里蹦出soon已经是三个月前的事了。

结果打脸来得比预想中快得多。从唐杰发推,到Z.ai官网挂出技术博客,中间只隔了几个小时,这大概是大模型圈子里兑现最快的一次“soon”。平时这种提前放风的预告,往往要拖上数周才能看到下文,这回显然是个例外。

不做全能选手,只啃编程这块硬骨头

GLM-5.3的定位简单粗暴:不打算跟别人比谁的腿多,只挑编程和安全这两件事,往死里做。编程维度上最扎眼的不是哪一张单科成绩单,而是进步的速度。

SWE-Marathon从19.4分直接翻倍到42.5分,FrontierSWE也从67.5分抬升到78.1分。真正让人愣一下的是Terminal Bench 3.0——这个基准模拟的是真实Linux终端环境里的多步操作,模型得看懂命令行、处理好文件状态、还得排得动程序的报错,全是开发者每天躲不开的琐碎活儿。GLM-5.2在上面只拿了4.6分,这一代干到了28.3分,五倍还多。同一个基座、差不多的参数规模,光靠后训练就把一项能力拔高了五倍。

GLM-5.3突然发布!唐杰的“sooooooon”这次兑现了-1.png
配图来自原报道《GLM-5.3突然发布!唐杰的“sooooooon”这次兑现了》。

安全这条线,玩的是“攻”不是“守”

这次发布里更抢眼的是网络安全那一半。CyberGym这个基准不考怎么写安全代码,考的是怎么找出漏洞再把它利用起来——模型得在给定的系统里识别隐患、构造攻击、验证效果,说白了就是扮演白帽黑客。GLM-5.3在这个项目上拿到84.5分,位列所有参评模型第一名。

Z.ai还同步放出了一份安全披露账本,数字相当吓人:相关研究一共记录了2,436条安全发现,覆盖269个开源项目,其中1,097条属于Critical或High级别。最老的一处漏洞诞生于1981年,平均算下来,每条漏洞在被发现之前,已经在代码里躺了26.6年。

GLM-5.3突然发布!唐杰的“sooooooon”这次兑现了-5.png
配图来自原报道《GLM-5.3突然发布!唐杰的“sooooooon”这次兑现了》。

26.6年这个数,一下就把问题的分量摆到了台面上。很多漏洞从写进代码那天起就没挪过窝,只等着某个恰好能触发它的场景。传统安全审计靠人海战术堆,可代码量指数级膨胀的速度,早就让这种打法跟不上了。

Agent能力全线铺开,下一代才是大菜

顺着这条线往下看,Agent能力也被重点照顾。GLM-5.3引入了Effort Level机制,从Non-Thinking到Max一共四档推理深度,任务越复杂,模型就可以投入越多的计算量,相当于给用户一把调节旋钮,自己掂量着办。

Agentic方向的成绩单也不含糊:Toolathlon Verified 73.0、AutomationBench 48.2、Agents' Last Exam 28.5、HLE w/ Tools 62.5、GDPVal-AA v2 1769,多个基准都稳在第一梯队。

GLM-5.3突然发布!唐杰的“sooooooon”这次兑现了-9.png
配图来自原报道《GLM-5.3突然发布!唐杰的“sooooooon”这次兑现了》。

智谱还透露了一个更大的消息:下一代大版本会换全新架构,参数规模直接翻倍,全面对标Fable 5。这么看,GLM-5.3更像是中场哨声前的热身,是给后面那记重拳垫的一脚。

soon的下半场

关于soon的故事还有续集。今天又有人跑到X上追问唐杰,那GLM-6呢?唐杰的回复还是那两个字:soon。同一个词第二次出场,但这次愿意押注的人显然更多了——毕竟就在几个小时前,这句soon刚刚兑现过一次。

免责声明:本文基于公开报道的事实信息整理,仅供参考,不构成任何投资或技术选型建议。

点赞(0)

评论列表 共有 0 条评论

暂无评论
立即
投稿
发表
评论
返回
顶部