导语:一夜之间,Google发布Gemini 3.8 Flash、Meta发布Muse Spark 1.3、初创公司Mostik展示模型间潜空间通信。三件事共同指向:AI推理成本正从多个维度同时下降,智能正以惊人速度变得便宜。
昨天夜里的硅谷发生了三件大事。Google发布了Gemini 3.8 Flash,Meta发布了Muse Spark 1.3,一家此前没人讨论过的初创公司Mostik则登上了权威媒体WIRED的专访。如果只看前两件,这很像又一个普通的AI刷榜之夜。Google刚刚把Gemini推上DeepSWE榜首,几个小时之后,Meta又公布了更高的成绩,世界第一的头衔甚至只维持了几个小时。
但如果把昨天晚上这三件事连起来看,真正值得关注的东西完全不在那些榜单上。AI的经济学正在发生突变。过去几年,我们讨论AI成本,最常看的数字都是每百万token多少钱。但Agent出现以后,这套计量方式正在变得越来越不够用。未来真正重要的问题可能不是"一百万token多少钱",而是修好一个Bug多少钱、完成一份研究多少钱、让一个Agent连续工作三个小时到底多少钱。
Google发布了他们全新的旗舰模型Gemini 3.8 Flash,官方称之为他们迄今为止最强大的推理与代码模型。这也是Google在六周时间内对Flash系列的第三次更新,从3.6到3.7,再到现在的3.8。过去Flash给人的印象一直非常简单:更快、更便宜,但能力会比最强模型差一些。Google现在正在一点点改变这个定义。
这一次3.8 Flash最核心的提升集中在long-horizon coding和agentic workflow。在衡量AI长周期软件工程能力的DeepSWE v1.1上,它拿到了约74%的成绩。真正恐怖的是另外一个数字:钱。Gemini 3.8 Flash的API首发价格依然保持在输入0.75美元/1M token、输出3.75美元/1M token。在DeepSWE上完成一道完整任务,它的平均成本只有2.36美元。作为对比,同样约74%的Claude Opus 5,单任务平均成本达到11.84美元;GPT-5.6 Sol约73%,平均成本也要6.46美元。
正在Google众人为Gemini 3.8 Flash的发布庆祝时,Meta突然杀回来了。Meta发布了Muse Spark 1.3模型。按Meta公布的评测,Muse Spark 1.3在DeepSWE v1.1上的成绩达到了75.4%。这个数字超过了Gemini 3.8 Flash、Claude Opus 5和GPT-5.6 Sol。更夸张的是,Muse Spark 1.2在这个测试上的成绩还只有约55%。从1.2到1.3,一个小版本更新直接提升了约20个百分点。
Meta这次真正值得看的同样不是75.4%。还有两个数字:工具调用减少约20%,token消耗减少约25%。这件事很容易被忽略,但它其实非常接近Agent真正商业化以后最重要的问题。一个Agent最浪费钱的地方,很多时候不是正常思考,而是跑偏。比如coding agent在第20步错误理解了需求,它可能继续修改五个文件、运行三轮测试、搜索大量代码,最后才发现路线错了,然后全部重来。
如果Google和Meta还在研究如何用更便宜、更少的token完成任务,那么Mostik开始碰一个更加底层的问题:这些token为什么一定要存在?Mostik在俄语里的意思是"桥"。CEO Sasha Malysheva是这套方法的主要开发者,它的首席科学家则是日内瓦大学教授、2010年菲尔兹奖得主Stanislav Smirnov。他们正在尝试做一件听起来很简单、实际上极其困难的事情:让两个AI模型不再通过自然语言互相交流。
今天绝大多数Multi-Agent系统都是这么工作的:Model A得到一些信息以后,先生成几百甚至几千个token,把自己的结论用自然语言说出来;Model B再把这些文字全部读进去,重新理解并建立自己的内部表示,然后继续推理。但问题在于,大模型内部真正进行计算的东西,本来就不是中文或者英文。这就相当于两台电脑明明可以直接传数据,电脑A却先把文件打印成几百页纸,再让电脑B用摄像头一页一页OCR回去。
Mostik把完整版的GLM-5.2 753B和只有4B、可以运行在移动设备上的Qwen 3.5进行了桥接。最后得到的混合系统,能力落在两个模型之间,但推理成本只有完整GLM-5.2的1/20。当然,现在就说Mostik已经解决了模型通信肯定太早。但1/20这个数字还是让人非常兴奋。因为它让人开始认真思考一种完全不同的未来AI架构。
过去两年讨论端侧AI,我们一直在研究怎么把更大的模型塞进手机:7B、4B、3B、1B,不断蒸馏、量化、压缩。但如果Mostik这条路线最后真的能够跑通,未来的手机也许根本不需要一个"什么都会"的大模型。你的设备里可能只需要运行一个0.xB或几B的小模型。它很便宜,可以持续运行,负责理解你当前在哪个App、刚刚做过什么、设备是什么状态,并且处理绝大多数简单、高频的任务。真正碰到困难的问题,再通过潜空间的通信调用远程的大模型。
所以回头看昨天晚上,表面上是三条完全不同的新闻。Google发布Gemini 3.8 Flash,把frontier级别的能力压进了Flash的价格区间;Meta发布Muse Spark 1.3,让Agent用更少的token和tool call完成更多事情;Mostik则更进一步,开始尝试让模型之间的一部分token从一开始就不要产生。它们其实都指向同一个变化:智能正在以非常夸张的速度变得便宜。
而且这种降价已经不只是API单价下降。模型价格在下降,完成任务所需要的计算量在下降,现在甚至连模型之间交换信息的方式都开始被重新设计。这件事最后可能带来的影响,比benchmark又涨几个百分点大得多。因为很多技术真正爆发,从来不是发生在"第一次能用"的时候,而是发生在"终于便宜到可以随便用"的时候。今天让一个Agent花几十美元去完成一件普通人的小任务,也许完全不划算。如果未来只需要几毛钱,很多现在根本不会有人考虑的应用突然就成立了。
免责声明:本文内容整理自公开报道,仅供参考与讨论,具体信息请以官方发布为准。
发表评论 取消回复