8 月 12 日深夜,DeepSeek 官网的 API 文档悄然更新,Pro 模型版本号换成了 DeepSeek-V4-Pro-0813。按官方群里放出的评分,正式版远超预览版,在 Terminal Bench 2.1 上比肩当下最强模型。但与此同时,权威评测机构、个人实测乃至一个简单的「鹈鹕测试」,都和这张跑分表对不上。

先看官方给出的一面。据第一财经报道的 DeepSeek 官方群消息,V4 Pro 正式版相比预览版进步巨大:DeepSWE 测试集从 12.8 分飙到 62.7 分(近 5 倍),DSBench-Hard 从 31.1 冲到 67.2,DSBench-FullStack 从 41.8 提升到 71.1,涨幅普遍接近翻倍。硬件规格上,V4 Pro 延续 MoE 架构,总参数 1.6 万亿、每次推理激活约 490 亿参数,接口提供 100 万 token 上下文和最高 38.4 万 token 输出——对长任务 Agent 而言,这是硬刚需。调用方式不变,模型名仍是 deepseek-v4-pro,老用户代码一行不用改,价格也与预览版一致(每百万 token 缓存未命中输入 3 元、输出 6 元),并未随转正上调,尽管此前官方曾表示价格将要上涨。

DeepSeek V4 Pro 相关配图
配图来自原报道《V4 Pro正式版“V5”,但鹈鹕测试翻车了》。

跑分的另一面:独立评测与实测的落差

问题在于,这次「转正」的发布痕迹异常低调。官方既没有像 V4 Flash 正式版那样发布完整的更新日志(含 9 项基准测试的具体分数和「模型结构、尺寸保持不变,仅重新进行后训练」的说明),也没有官方公告——截止报道,与 V4 Pro 正式版相关的只有三处:官网「模型 & 价格」页面、首页一句简短的滚动公告、一张跑分表。

独立评测给出的数字,与跑分表并不吻合。权威评测机构 Artificial Analysis 上线了 V4 Pro 0813(最大推理强度)的独立评测页,综合智能指数 53 分,相比预览版的 45 分确有提升、与 GLM-5.2 齐平,但离跑分表里「接近甚至超过 Fable 5」的说法相去甚远——作为参照,同一天发布的 Grok 4.6 拿到了 61 分。在考察数学能力的 Proof Bench 上,以数学见长的 DeepSeek,V4 Pro 正式版甚至没挤进前 10。个人评测者也给出类似反馈:AI 博主牙医发文称,reasoning_effort=max 时模型在长程 Agentic Coding 任务上倾向于早停——总计 50 轮测试中,两次在 42 至 43 轮就自行停止,且成绩没打过 GLM-5.1。

最直观的例子是所谓的「鹈鹕测试」。提示词是让模型生成一个循环动画 SVG:鹈鹕骑自行车,轮子转、踏板动、腿踩得正确,无限循环。将同样的提示词分别发给 V4 Pro 正式版和 Flash 正式版,结果是 Flash 完成得远比 Pro 好——无论是鹈鹕的动作还是背景的云彩,Pro 都不如 Flash。

DeepSeek V4 Pro 相关配图
配图来自原报道《V4 Pro正式版“V5”,但鹈鹕测试翻车了》。

这些落差让不少人怀疑,0813 这个版本号可能只是「占位符」——DeepSeek 也许并没有真正上线新模型,或者有意压制了能力、先占住坑,等 DeepSeek Harness 准备就绪再释放,以免超高并发挤爆服务器。这个猜测有一条线索支撑:DeepSeek Harness 负责人崔添翼此前透露,V4 Pro 正式版将和 DeepSeek Harness 同时上线,而 8 月 13 日正是 Harness 的最后一次测试。并且,V4 Flash 正式版 API 文档里写明,其公开基准测试中的 Code Agent 任务,正是用 DeepSeek Harness 极简模式作为测试框架——V4 Flash 在 Terminal Bench 2.1 的 82.7 分,严格说是「模型 + Harness」组合的成绩,不是纯模型裸分(V4 Flash 预览版该项是 61.8 分,V4 Pro 预览版是 72.1 分)。

「斩杀线」的价格战,正在改写行业

V4 Pro 转正只是这轮价格战的注脚。自 DeepSeek V4 Flash 正式版 7 月 31 日上线后,行业叙事换成了「每任务/单位智能的价格」——按 Artificial Analysis 的测试,在完成相同水平任务的前提下,V4 Flash 的价格低于市面上 70% 的模型,这些处在分水岭之内的竞品,被戏称为被 DeepSeek「斩杀」。落在线上的厂商只有两条出路:大幅下调定价,或放弃普惠开发者市场、收缩到高端企业客户。

于是各家的应对变得相当微妙。OpenAI 的 GPT-5.6 Luna 7 月 9 日才上线,7 月 30 日就宣布降价 80%(输入从每百万 token 1 美元砍到 0.2 美元,输出从 6 美元砍到 1.2 美元)。Anthropic 把 Sonnet 5 的首发优惠价格(2 美元/10 美元)在 8 月 10 日直接永久化,Opus 5 定价 5 美元/25 美元,正好是 Fable 5 的半价。谷歌 7 月 21 日一口气发三款 Gemini Flash 轻量模型,主力款 3.6 Flash 当天宣布输出价永久下调 17%。国内更是放血式促销:智谱把 GLM Coding Plan 全员额度重置回满并叠 1.5 倍限时加成,火山引擎给 GLM-5.2 开出四倍折扣,OpenRouter 上三家供应商从 60% 一路压到 95%。

有意思的是,真正站在金字塔尖的旗舰——GPT-5.6 Sol、Kimi K3、Claude Fable 5——一个都没降价。Kimi K3 甚至逆势涨价:对比上一代旗舰 K2.6,国内版输入价上涨 208%、输出价上涨 270%。逻辑很清楚:斩杀线之上可以继续收溢价,能力足够强、DeepSeek 够不到,就不在杀伤范围内。V4 Flash 总参数仅 284B,在 Artificial Analysis 的智能指数里只拿 50 分——在复杂推理、长链路、多步规划这类「必须万无一失」的任务上,它确实还够不到头部旗舰。

斩杀线不会停在原地

让这条斩杀线继续下移的技术,已经开始走向成熟。一是推测解码:用一个小模型快速出草稿,大模型只做并行验证和修正,草稿命中率稳定在 80% 以上时,旗舰模型的有效推理成本能降到原来的三分之一到五分之一。2026 年 6 月 DeepSeek 发布的 DSpark 模块已部署到 V4 Flash 和 V4 Pro 线上流量,在相同吞吐下用户生成速度提升了 60% 到 85%。二是静态知识剥离:把事实性知识从参数中拆出去,只靠外部检索补充。DeepSeek 联合北大今年 1 月发表的论文提出 Engram 技术——相当于把模型的闭卷考试改成开卷考试,在模型中间插一本「速查手册」,事实性问题直接翻手册,脑容量全留给真正需要动脑筋的推理,同样能显著降低模型成本。

回到 V4 Pro 本身。无论 0813 是占位符还是真转正,一个事实是确定的:当 DeepSeek Harness 与 V4 Pro 正式版真正一起上线时,凭借「模型 + 框架」的组合成绩,行业很可能迎来一个新的斩杀档位。而国内玩家已经全部挤进这条赛道——智谱的 ZCode 在自研 Code Bench 上,让 GLM-5.2 配合 ZCode 相比配合 Claude Code,复杂跨文件任务通过率高出 2.39%,缓存命中率超过 98%。

番茄在涨价、鸡蛋在涨价、糖在涨价,结果番茄炒蛋反而便宜了。这个逻辑能维持多久,没人说得明白——但它至少说明,这一轮由 DeepSeek 掀起的降价,靠的不只是压缩利润,更是技术把成本打下来的结果。

免责声明:本文基于公开报道整理,评测数据来自不同口径(官方、Artificial Analysis、个人评测),结果存在差异属正常现象;不构成投资建议。

点赞(0)

评论列表 共有 0 条评论

暂无评论
立即
投稿
发表
评论
返回
顶部