不跑Benchmark,不做数学题。三个模型吃完全相同的Prompt,做同一个游戏、同一个PPT工作台、同一家小餐馆——三轮实测下来,最贵的那个居然没全赢。

这几天我是真有点"玩"上头了。前面连续折腾了几轮DeepSeek Harness,从插件到桌面版,越玩越觉得有意思。但就在我准备继续往下测的时候,DeepSeek自己先来了一刀——V4 Pro涨价了。以前DeepSeek最大的优势之一就是又能打又便宜,现在价格一涨,它还香不香?

偏偏这两天GLM-5.3又出来了,Coding和Agent这块声量很猛,再加上前段时间同样很火的Kimi K3。这不正好——GLM-5.3、Kimi K3、DeepSeek V4 Pro,全部塞进DeepSeek Harness,狠狠干一轮。所有配置完全一样,三个模型吃完全相同的Prompt,做三个真正能看到结果的东西:《牛来》动作小游戏、AI PPT工作台、《欢迎来龙餐馆》经营小游戏。主要就看五件事:谁做得最好、谁最快、谁最稳、谁最省钱,最后到底谁能把活交出来。

模型实测配图
配图来自原报道《绝了!把 GLM-5.3 塞进 DeepSeek Harness,跟 Kimi K3、V4 Pro 干了三轮,最贵的那个居然没全赢》。

第一轮:《牛来》动作小游戏

第一个Case致敬最近火爆出圈的《牛来》:玩家操控牛妈妈在草原上保护小牛,击退一波波敌人,最后打Boss。要求能移动、攻击、闪避,有输有赢,一局3到5分钟,结尾要有电影片尾感,六句话慢慢出来。

这轮DeepSeek出乎我意料:游戏性做得相当不错,核心体验跟另外两个差得没那么远,难度甚至是三个里最高的,我后来专门调了一次难度才通关。比较可惜的是电影片尾没做完整。Kimi的优势很直接——建模和整体视觉更精美,角色场景第一眼就让人觉得"完成度高",结尾六句话也完整做出来了,单从体验上看是三个里最好的。GLM这版画面比V4 Pro精致,但角色建模比Kimi稍微僵一点,牛妈妈偏儿童卡通风格;不过真玩起来完成度不低,操作战斗反馈灵敏,难度最轻最友好。有个小细节我很喜欢:每波敌人打完会给一点喘息时间再进下一波,节奏舒服。最戳我的是结尾字幕——一行淡入带点黄色,下一行出现时上一行慢慢变白,质感和认真设计的片尾一样。

只看综合成品,GLM-5.3和Kimi K3基本打平:Kimi人物建模和精致度略胜,GLM在战斗反馈、节奏和字幕细节上有我更喜欢的地方。V4 Pro游戏性并不输,输在视觉质感和结尾没做完。

第二轮:AI PPT工作台

第二个Case换了个方向,做一个正经生产力工具:输入主题、选受众、选风格,一键生成六页PPT的工作台,要有缩略图、页面切换、文字编辑、三套视觉主题和全屏预览。

V4整体功能比较全,该有的基本都有,但两个问题:HTML下载后网页没法下拉,内容看不全;还有一页出现乱码。完成度是有的,就是还不够好。K3这版整体视觉更高级,尤其大屏排版和质感更像成熟产品Demo,但有个明显毛病——左边缩略图很多直接是黑的。GLM这轮比前面两个都好,而且不是好一点点:质感高了一个档次,画面上基本挑不出大问题,排版更成熟。更关键的是新建PPT时它真的弹出一个新页面,把主题、受众、风格、页数都列好让选,再照着你选的生成——这一点比前两个高出不少。美中不足是留了个调试用的自检面板没收起来,说明还有打磨空间。

AI PPT配图
配图来自原报道《绝了!把 GLM-5.3 塞进 DeepSeek Harness,跟 Kimi K3、V4 Pro 干了三轮,最贵的那个居然没全赢》。

话说回来,三个都没把AI PPT做到理想程度。我本来希望重新输入主题需求后真的生成一套完全不一样的PPT,可实际上更多还是在模板结构上换文字做微调——GLM那版最接近,但也还没完全做到。严格讲,都还是Demo。

第三轮:《欢迎来龙餐馆》经营游戏

第三个Case换了个安静的方向。最近沈腾那部《欢迎来龙餐馆》很火,看完真挺感人,就做个战火背景下的小餐馆:客人进来、点菜、做菜、上菜、赚钱,一局代表营业一天,结尾同样要电影片尾收束。

这一轮的差距比前两轮明显。DeepSeek做的餐馆挺像个真餐馆——客人不是头像横着飘进来,而是真的走进来,有时一个、有时两三个、甚至会来一家四口,这个细节一下让餐馆有了"人在营业"的感觉。它是唯一一个有店员送菜环节的,结尾处理得也不错,字幕一点一点出现,节奏是有的。Kimi更像横版点击小游戏,人物头像从一边进来、点两下、做菜、再出去,视觉精致但玩起来有点单调,客人进来机械、走得又快。

客观说这一轮GLM发挥得最好:游戏封面一进去就挺大气,木质质感一摆真有点老餐馆感觉;客人走动来回很自然,空间够大,右侧点单端菜按键好使;形形色色的客人看着丰富;没及时上菜客人真的会走——中间我一度三个灶同时开火忙不过来,才体会到生意太好也不见得是好事。整体处理下来是三个里最完整的。

餐馆游戏配图
配图来自原报道《绝了!把 GLM-5.3 塞进 DeepSeek Harness,跟 Kimi K3、V4 Pro 干了三轮,最贵的那个居然没全赢》。

三轮跑完的账:速度、成本与选择

先把最实在的几笔账算清楚。速度成本上,DeepSeek V4 Pro是毫无悬念的第一,又快又便宜,三个Case都顺顺当当交出来了。GLM-5.3排第二,我充的是199的Coding Plan,用起来不错但只有5小时额度太少,而且它是三个里最慢的。Kimi K3单看API是最贵的,这一轮花了43块,不过速度不慢排中间。

看结果:GLM-5.3和Kimi K3基本能打平,但GLM整体更稳也稍微好一点;V4 Pro也不错,只是相比之下会粗糙一些,能用但还没到那个份上。怎么选?想要相对快、质量又不错,优先选K3;追求更深完成度和更好质感,选GLM-5.3;纯看性价比,还是V4 Pro,速度之王。另外这三个跑下来,DeepSeek Harness作为基座完全OK,三个模型接进去都能正常干活,没掉链子。

当然得说句实在的,今天的测试结果只代表近期情况。大模型竞争就是这样,今天这个更强,明天可能换成那个,谁也别想一直坦然坐着。但把时间拉长看,整体是一起往上走的——跟国外顶尖比差距确实还有,可追赶速度是实打实的。更希望的是它们每一个都能越来越好,我们也能慢慢用上更好的AI。

免责声明:本文基于公开报道的事实信息整理,仅供参考,不构成任何投资或技术选型建议。

点赞(0)

评论列表 共有 0 条评论

暂无评论
立即
投稿
发表
评论
返回
顶部