导语:新一期AA榜单中,GLM-5.3与Kimi K3并列为全球第四、国产第一,而它却是前十名里唯一参数量不足T级的模型,仅744B(激活40B)。作者亲测一周,从安全审查、Skill开发、3D游戏与写作四个实战场景展开,并拆解其与GLM-5.2同底座、纯靠后训练提分的路线,以及低推理成本、易私有化部署两大用户红利。

各位好,我是冷逸。新一期AA(Artificial Analysis)排行榜正式出炉,前十名里国产模型一口气占了三个席位。其中,Kimi K3与GLM-5.3双双冲到全球第四、国产第一,排在他俩前面的只剩Claude Fable 5、Opus 5、GPT-5.6 Sol和Grok 4.6这四款。

AA榜单最新排名截图,Kimi K3与GLM-5.3并列全球第四、国产第一
AA榜单最新排名:Kimi K3与GLM-5.3并列全球第四、国产第一

除了分数,榜单里其实还藏着一个很容易被忽略的细节:前十名中,只有GLM-5.3的参数量没有达到T级,仅为744B(激活40B)。看完成绩单和参数,大家更关心的想必是——这模型真用起来到底行不行?下面我就结合这一周的实际使用感受,用四个具体案例来聊一聊,顺带说说这个参数体量背后的门道。

榜单前十名模型参数一览,GLM-5.3是其中唯一未达T级的选手
前十名模型参数一览:GLM-5.3是唯一未达T级的选手
GLM-5.3模型介绍页截图
GLM-5.3模型介绍页截图

一、安全审查。我此前在GitHub上开源过一个Markdown编辑器,发布时几乎没做任何安全层面的检查。当时没太当回事,可真到了要部署上线的阶段,才发现里面的坑着实不小。于是我把整份代码交给GLM-5.3过了一遍,它一口气帮我找出了6个漏洞。

GLM-5.3为Markdown编辑器代码指出的漏洞详情
GLM-5.3为Markdown编辑器代码指出的漏洞详情

逐条读完它对每个问题的分析,我有点后背发凉。它给出的不是那种含糊的"可能存在风险",而是直指问题究竟出在哪里、攻击者会怎样利用。更贴心的是,它还顺手给了两套解决方案:一是把DOMPurify集成与SRI直接写进HTML,二是重写一版加固后的代理脚本,最后反问我一句"要不要做"。这还用问?当然要做。

GLM-5.3给出的加固修复方案示意
GLM-5.3给出的加固修复方案示意

这里也建议各位,自己的真实项目在推向生产环境之前,很有必要先让GLM-5.3帮忙扫上一遍。这不是玩笑话——近期黑灰产相当猖獗,已经有不少政企网站因此中招,一次疏忽付出的代价,可能远比想象中大得多。

CyberGym安全基准上的得分对比
CyberGym安全基准上的得分对比

而且,GLM-5.3在安全攻防上的能力并非我一个人的体感。在CyberGym这项评测中,模型需要从白盒源码出发,通过触发程序故障来识别并验证漏洞,GLM-5.3拿下了84.5%的成绩,领先Mythos 5的83.8%和GPT-5.6 Sol的83.6%。

二、Skill开发。在我看来,Skill开发是最能检验一个模型Agentic能力的场景之一。身边不少朋友做Skill,基本只认Opus 4.8/5和GPT-5.6 Sol这两款。这次我试着让GLM-5.3上场,几轮对话下来,它很快就做出一个专写GitHub「README.md」的Skill,思路相当顺畅:第一步,先请它推荐一批优秀的GitHub仓库作为参考;第二步,从这些高质量README中提取共性特征,归纳成一份规范;第三步,再依据这份规范,生成一个专门撰写「README.md」的Skill。

GLM-5.3生成README专用Skill的对话过程
GLM-5.3生成README专用Skill的对话过程

随后,我仍拿前面那个Markdown编辑器练手,用这个新Skill重写了一份README。下图是原始版本的README,再往下是两份README的改动对照情况。

原始版本的README截图
原始版本的README截图
两份README的改动对照
两份README的改动对照情况

可以看出,经Skill生成的README.md在专业度和观感上立刻上了一个台阶,一下子专业、高级了不少。这个Skill我之后还会再打磨一番,届时会开源出来分享给大家。

Skill重写后的README效果展示
Skill重写后的README效果展示

三、3D游戏。趁着最近《牛来》大火,我设计了一个略显抽象的提示词:参考"图1.png"的剧情内容和人物主体,结合最近爆火的《牛来》热点,使用Three.js创建一个3D互动游戏,演绎现代版"牛头不对马嘴",故事务必新颖。这一个提示词其实同时在考核三件事:3D建模能力、一口气写出长代码而不翻车的工程质量,以及创意水准。三关叠加,相当能看出模型的真实功底。

3D互动游戏的提示词设计
3D互动游戏的提示词设计

最终呈现的效果,确实有点"牛来"的味道。总体而言,GLM-5.3的3D生成能力无可挑剔,基本与Kimi K3并驾齐驱,两者一同把国产模型抬到了世界级水平。

GLM-5.3生成的3D互动游戏画面
GLM-5.3生成的3D互动游戏画面
3D游戏场景细节截图
3D游戏场景细节截图
游戏运行效果继续展示
游戏运行效果继续展示

四、写作能力。写作表现是我最近测下来最大的意外之喜。我的提示词非常简单直接:用豆瓣长评的腔调评价《牛来》。它标注的文体是"论文腔",而交出的成品着实让我惊喜。

GLM-5.3生成的《牛来》豆瓣长评截图
GLM-5.3生成的《牛来》豆瓣长评截图

这篇影评开篇就亮出结论:《牛来》作为电影是零分,作为事件却是满分。它描绘了一个两人剧组、一头走进梦境的牛、灾难级的建模和梦游般的叙事,并拿塔可夫斯基凝视水面的长镜头与布努埃尔割开眼球的剃刀作对照,认为《牛来》什么都不割——它横冲直撞的样子,意外抵达了同样的地方。这不是解构,因为解构要先懂结构,这更像是纯粹的无知之勇,是电影诞生之初"老子不管反正就要拍"的原始冲动。

影评开头部分特写
影评开头部分特写

它继续写道,我们看了太多"正确"的电影,算法知道你要哭就下刀子,美术知道你要截图就留水印位,精修的完美看多了人会失明,而《牛来》粗糙到近乎赤诚——在一个人人表演"懂观众"的时代,一个彻底不懂观众的东西反而成了唯一的真实。那些驱车三十公里前来的观众,买的不是票,是赎罪券,为我们曾用十倍票价供奉无数精致的无聊而赎罪。它还搬出对照:美国有《房间》,中国有《牛来》,托米·韦索烧了六百万美元拍出邪典圣物,而《牛来》九天票房七千三,被嘲几天后单日反冲三十五万,"烂片拯救票房"这件事本身就是最超现实的剧情。

影评中段论述部分
影评中段论述部分

评分说明同样出彩:五星,一分给牛,一分给梦,一分给两人剧组明知不可为而为之的莽,一分给影院经理紧急加场时脸上的表情,最后一分给所有笑着散场、又在深夜写下"其实我们笑的是自己"的伪君子们——包括我。收尾那句更是点睛:"牛来了。它不是来拍电影的,是来给电影收尸的。结果,葬礼变成了派对。"

影评结尾与评分说明部分
影评结尾与评分说明部分

说实话,它的笔力真的有把我惊喜到:腔调拿捏到位,行文颇有水准,全然不是那种硬接话的"理工味"。一个主打Coding的模型,文科功夫居然也没落下,这大概又是后训练带来的能力溢出红利。

GLM-5.3生成的影评效果展示
GLM-5.3生成的影评效果展示

小小的模型,大大的智能。这次AA榜单中得分在60以上的模型一共有6个,其中GLM-5.3参数量最小,只有744B(激活40B)。和它同处第一梯队的都是什么来头?Kimi K3是2.8T,Grok 4.6约1.5T,Qwen3.5-max为2.4T,Claude Opus 5更是网传10T级别。

AA榜单60分以上模型名单,GLM-5.3参数量最小
AA榜单60分以上模型名单:GLM-5.3参数量最小

排在GLM-5.3前后的这些选手,体量普遍是它的两倍,多的甚至有十来倍,可智能程度呢?彼此之间只差两三分。更有意思的是,它与GLM-5.2共用同一个底座,每一分提升都来自后训练——这句不是我说的,而是智谱官方博客的原话:"It uses the same base model as GLM-5.2 — every gain comes from post-training"。翻译成大白话就是:同一副骨架、同一个天花板,上一代只发挥到53分,这一代直接摸到了60。

头部模型参数量对比
头部模型参数量对比:GLM-5.3以四分之一身板打平

换言之,除了预训练,后训练同样能抬高模型的智能上限,这次智谱或许趟出了一条新的模型训练之路,这也是智谱创始人唐杰教授把GLM-5.3称为一场"控制变量实验"的原因。那预训练与后训练到底怎么区分?借用沃垠AI群友的一句解释:"记住知识和会用知识是两码事。预训练相当于给你塞进大量知识,让你记住;后训练则是让你学会把这些知识真正用起来。"

预训练与后训练机制示意
预训练与后训练机制示意

光讲道理不够直观,把它和最近发布的两款模型摆在一起,差距就一目了然了。第一款是Kimi K3,同样拿到60分,与GLM-5.3打平,可体量达2.8T,GLM-5.3只有它的四分之一——同样的分数,四分之一的身板。第二款是DeepSeek-V4-Pro-0813,AA得分53,比GLM-5.3低7分,总参数量约1.6T,是GLM-5.3的三倍。值得注意的是,上一代GLM-5.2同样是53分。换句话说,GLM仅用一代迭代,就在同一把标尺上,把自己与一个体量三倍的对手拉开了7分的差距。

GLM-5.3与Kimi K3、DeepSeek-V4-Pro-0813的得分与体量对比
GLM-5.3与Kimi K3、DeepSeek-V4-Pro-0813的得分与体量对比

对普通用户来说,这意味着什么?如果说60分是结果,那智谱把力气使在了哪儿?答案是死磕Coding与Agentic能力。据官方博客,GLM-5.3在其自家Code Bench上相比5.2提升约50%,并自称"当前最强的开源权重编程模型"。其中还藏着一个略"超纲"的意外之喜:智谱提到,在扩大后训练规模的过程中,模型的网络安全(漏洞发现类)能力涌现速度超出预期,在CyberGym这类网络安全基准上做到了开源SOTA。一个主打编程的模型,把能力外溢到安全领域,这种"练着练着多长出一身本事"的现象,恰恰是后训练威力的又一侧面印证。

GLM-5.3在Code Bench等基准上的提升数据
GLM-5.3在Code Bench等基准上的提升数据

"小小的模型,大大的智能"落到用户端,会带来两个实打实的好处。其一是推理成本更低、速度更快:参数少意味着同样的算力能支撑更多请求,落到API价格与响应延迟上,就是更便宜、更迅速。其二是私有化部署门槛更低:GLM系列向来开源权重,744B总参加上40B激活的体量,意味着企业在自己机房搭一套私有化部署,所需硬件规格与成本都比动辄2T、3T的庞然大物友好得多。

目前已确认,GLM-5.3的模型权重将于下周五正式开源,值得期待。想要上手体验的话,目前Z.ai、智谱清言APP、BigModel开放平台与GLM Coding Plan均已开放。API价格与上一代GLM-5.2保持一致,并未涨价:输入8元/百万tokens(缓存命中2元),输出28元/百万tokens。

免责声明:本文内容整理自公开报道,AI 产品动态与进展以官方发布为准,仅供参考,不构成任何投资建议。

点赞(0)

评论列表 共有 0 条评论

暂无评论
立即
投稿
发表
评论
返回
顶部