8 月 13 日,阿里把 Qwen3.8-2.4T 的模型权重放了出来。单看参数规模,2.4T 并不是今天行业里最大的数字;真正值得留意的,是这件事发生的位置——开源与闭源的分界线附近,而且它不是孤例。
先解释一下这步棋为什么特殊。过去几年,Qwen 的产品线一直劈成两半:小一点的模型开放权重,更大更强的 Max 系列只走 API。从 Qwen-Max-0428 到 Qwen2.5-Max,旗舰级权重始终攥在手里。这一次,2.4T 参数的 Max 级模型头一回把权重交了出来——只是放出来的版本和云端版并不完全相同:开放版目前只能跑纯文本、只有 thinking 模式、原生上下文 262K;云端 Max 版则在这个基础上叠加了视觉输入、non-thinking 模式、默认 1M 上下文和官方内置工具。
把增强能力留在云上、再放一个基础版出去,这几乎成了当下开源模型的固定剧本。开源保住面子和生态,云上保留能赚钱的部分。理解了这个逻辑,再回头看这次放出的东西,重点就不在「多大」,而在「怎么搭」和「收不收费」。
硬参数:先摆到桌面上
Qwen3.8-2.4T 一共 92 层,总参数 2.4T,每个 token 激活 95B。MoE 用了 512 个专家,每次挑 10 个路由专家,外加 1 个共享专家。注意力部分是它最像 Kimi K3 的地方:92 层按 23 组重复,每组是 3 层门控 DeltaNet 加 1 层门控全注意力——换算下来,线性注意力与全注意力的比例大约是 3:1。原生上下文 262K,可以外推到 1,010,000 token,并且做了多 token 预测(MTP)训练,示例配置一次预测 3 个候选 token,命中就让一次前向传播推进多个 token,减少逐 token 生成的串行延迟。
把 Kimi K3 拉过来对比,数字几乎能对上号:K3 总参数 2.8T、896 个专家,93 层里同样是约 3:1 的线性/全注意力配比(69 层 KDA 加 24 层 Gated MLA)。两家在 MoE 调度上略有分歧——Qwen 靠专家并行和融合算子压低通信开销,Moonshot 则用 MoonEP 让热门专家按当前负载动态复制到更多 GPU 上——但整体架构的相似度已经高到没法说是巧合。K3 在层间信息流上多走了半步:它引入 AttnRes,允许模型重新组合多个历史层的输出;Qwen 这边则沿用了 Qwen3.5 的 Pre-Norm 残差实现。
比架构更有看头的,是「怎么跑起来」
这次开源在推理侧的信息,反而比架构更值得琢磨。官方提供了 BF16 和 FP8 两种 checkpoint,社区又在此基础上做了 NVFP4 和 MXFP4 的量化版本。完整精度版本至少需要两台 NVIDIA B300 或 AMD MI355X 节点才能跑起来,压到 FP4 之后,单节点就能部署。对一个 2.4T 参数的模型来说,能不能塞进一台机器,直接决定它的使用成本和门槛。并行上则是 TP、DP、EP 三件套的组合:注意力部分靠张量并行把矩阵拆开,MoE 部分靠专家并行把不同专家摊到不同 GPU 上,再靠融合通信和专用 kernel 尽量把专家调度带来的开销压下去。这些词在 Kimi K3 那里几乎一字不差地重复了一遍。
后训练的重心,明显偏向了 Agent
官方在模型卡里直接把 Agent Execution 列为核心升级方向——更强的自主规划、对环境反馈的处理、更可靠的端到端任务完成。看官方评测的增长曲线,增量几乎全部堆在 Agent 类任务上:Terminal Bench 2.1 从 74.5 涨到 86.6,PaperBench 从 64.8 跳到 93.0,JobBench 从 31.3 升到 53.4,Toolathlon Verified 从 49.7 涨到 72.5;反观传统知识/推理 benchmark,GPQA Diamond 只是从 92.4 挪到 92.6,HLE 从 41.4 到 43.6。谁在进步、谁原地踏步,一眼便知。
另一个细节是默认开启 preserve_thinking,把前几轮的推理上下文保留下来,让 Agent 在一次工具调用之后不必只拿着最终答案重新开始,而是能接着上次的思路往下走。Kimi K3 也做了几乎一样的事,官方明确说多轮交互和工具调用时要把此前的 reasoning 内容和 tool calls 完整送回模型。两家同时走到这里,说明「保留推理状态」正在从外围框架的职责,逐渐转进旗舰 Agent 模型本身的训练与接口范式。
许可证的小动作,暴露了商业算盘
最值得琢磨的其实是许可证。Qwen 3 时代大量模型用 Apache 2.0,Qwen 3.8 换成了专门的 Qwen3.8-Max License;Kimi K3 同样弃用 Apache、改用自家 License。两个授权在方向上高度一致:使用、复制、修改、分发、微调、部署、托管甚至出售衍生品都可以,但商业产品月活超过 1 亿或月收入超过 2000 万美元,需要在界面显著展示模型名称;做 Model-as-a-Service 或 AI 工作助手、且企业集团连续 12 个月收入超过 5000 万美元的,商业使用前还要另行取得许可。差别只在具体阈值和覆盖范围。
换句话说,到了 3T 级旗舰这一档,两家选择的全都是「开放权重 + 自定义商业许可」,而不是小模型时代更宽松的 Apache 式开放。「开源」的门槛没有消失,只是搬到了更后面的位置。
同一张图纸上的竞争
把这些放在一起看,2026 年的旗舰开源模型几乎是在同一张图纸上施工:总参数进入 2–3T,激活参数锁在 100B 上下,注意力改成约四分之三的线性状态层配四分之一全局注意力,上下文目标稳定在百万 token,后训练死磕 Coding、Research 和长程 Agent,部署则越来越依赖 FP4/FP8 量化、融合 kernel 和专家并行。架构上的那点差异,已经缩小到「细节」的范畴。
这个趋同本身信息量很大。过去「开源」的想象空间是另一个生态、另一条技术路线;现在头部玩家愿意放出来的部分越来越像,说明真正的竞争点正在往后移——移到不公开的推理基础设施、数据配方、后训练工艺,以及那些留在云端的增强能力上。权重公开了,护城河并没有跟着公开。
接下来真正有意思的问题只有一个:谁能在这一张几乎一样的图纸上,再画出点不一样的东西。
发表评论 取消回复