导语:Anthropic凌晨发布Fable 5.1和Mythos 5.1,缓存读取价格直降75%,长时间Agent任务成本最高降低45%。新模型在蛋白质设计、金星地图绘制等科研任务中展现突破性能力,或为Anthropic上市前最后一次重磅模型发布。

Anthropic在凌晨突然上线了Fable 5.1和Mythos 5.1两款新模型。上一代Fable 5几乎成为SOTA模型的代名词,如今Anthropic开始自己超越自己。两款模型同时发布,Fable 5.1面向普通用户和企业,Mythos 5.1则将同一套前沿能力开放给经过验证的网络安全和生命科学机构。

Fable 5.1发布
图注

定价方面,基础价格保持不变,Fable 5.1依然是10美元/百万输入Token、50美元/百万输出Token。但缓存读取价格大幅下降75%,从1美元/百万Token降至0.25美元/百万Token。性能提升主要集中在长时间、多步骤的Agent任务上,Terminal-Bench-Science从24.7%飙升至52.6%,AutomationBench从17.1%提升至31.4%。

比起模型本身,更值得注意的是发布的时间节点——这很可能是Anthropic公开递表前最后一次重量级模型发布。几天后就是9月7日美国劳动节,按照此前披露的计划,已经秘密提交IPO文件的Anthropic可能在劳动节后正式公开招股书,最快于9月底至10月初上市。

Agent任务成本下降
图注

Fable 5.1延续了前代的100万Token上下文窗口和128K最大输出,基础价格未变。放到当前旗舰模型阵容中,Fable 5.1依然属于明显更贵的一档:同样按100万输入+100万输出计算,Fable 5.1是GPT-5.6 Sol当前价格的2.5倍,GLM-5.3的10倍以上。

值得关注的变化发生在Agent持续运行的成本上。Fable 5.1的5分钟和1小时缓存写入价格仍然分别是12.5美元和20美元/百万Token,但缓存读取从Fable 5的1美元/百万Token降到0.25美元,相当于直接砍掉75%。缓存读取可以理解为:一段上下文已经被模型处理过之后,后面的请求不需要每次重新按完整输入价格读取。

对于连续运行几个小时的Agent,会反复读取系统提示词、代码库、工具定义以及此前已经处理过的上下文,任务越长、工具调用越多,缓存读取占到的成本就越高。Anthropic用今年8月四周的实际使用数据做过测算:在按Token计费的场景下,相同任务从Fable 5换到Fable 5.1,典型工作负载的整体成本预计下降约25%;对于上下文更重、工具调用更多的复杂任务,降幅最高可达到约45%。

缓存读取价格对比
图注

也就是说,虽然Anthropic没有把Fable 5.1本身卖得更便宜,但专门把"让它长时间工作"这件事做得更便宜了。不过,便宜也只是相对于过去,基础价格摆在那里。有开发者就在发布评论区提醒,即使缓存命中率很高,成本依然可能迅速累积,一次真实的复杂任务就可能花掉20到50美元。

从性能变化来看,Fable 5.1越来越像一个专为长时间任务准备的模型。在Anthropic公布的Benchmark中,提升最明显的是Terminal-Bench-Science 0.1,从24.7%提高到52.6%,直接翻倍。测试终端环境Agent能力的Terminal-Bench 4.0从42.0%提高到55.8%,面向复杂商业工作流的AutomationBench则从17.1%提高到31.4%。

Benchmark性能提升
图注

但如果换到更传统的推理和Coding Benchmark,提升幅度就没有那么夸张。Humanity's Last Exam不使用工具时,从57.8%提高到60.9%;使用工具后,从63.8%提高到65.0%。CursorBench 3.2.0从70.5%提高到73.4%。总体来看,Fable 5.1的提升明显集中在需要模型连续调用工具、处理多个步骤、检查中间结果,再决定下一步行动的任务。

早期企业测试也在重复这个趋势。Browserbase在其最难的浏览器Agent Benchmark中,让Fable 5.1完成了82%的任务,Opus 5为74%,Fable 5只有57%。Ramp的一次测试里,Fable 5.1在无人干预的情况下连续运行了38个小时。它先发现此前一个机器学习实验的结果其实受到了标签伪影的影响,随后自行修正问题,同时启动6组并行实验跑了一整夜,最后带着新的实验结果和下一步建议回来。

企业测试结果
图注

Canva给出的反馈则更偏向生成质量。其测试认为,Fable 5.1的文字表达更容易理解,也更能遵循写作规范;在与Fable 5的盲测中,Canva更偏好5.1的输出。并且,在Canva Code里,Fable 5.1直接做出了一个节奏游戏:不仅生成了关卡和真实音乐,还让玩法节奏与音乐拍点对应。Canva称,这是他们测试过的其他模型都没有做到的。

Fable 5.1和Mythos 5.1看起来像是两款模型,但Anthropic在官方文档里说得很明确:Mythos 5.1与Fable 5.1"identical",区别只是为经过审核的用户提供了"more permissive safeguards"。也就是说,两者仅在安全限制上有差别:Fable 5.1面向普通用户和企业开放,涉及网络安全和生命科学里的部分高风险能力时会受到额外限制;Mythos 5.1则通过受信任访问计划,把限制更少的同一套前沿能力开放给经过验证的机构。

Mythos 5.1科研能力
图注

这次发布里,Anthropic把相当大的篇幅留给了科研能力,而这部分也主要由Mythos 5.1展示。其中最抢眼的一个实验,是让Mythos 5.1直接设计蛋白质binder。很多现代药物需要通过与人体内特定靶点结合,完成阻断、激活或者递送。Anthropic给Mythos 5.1接入了开源的蛋白质设计和折叠工具,让它自行设计binder,再把结果送到两家外部机构进行真实实验验证。

结果是,在12个靶点上,Mythos 5.1设计的binder命中率接近50%。Anthropic称,目前蛋白质设计中常见的命中率大约只有10%到15%;其中三个靶点上,模型设计出的binder结合亲和力,比Adaptyv Bio蛋白质设计比赛里的最佳方案高出约10倍。这里值得注意的并不是Claude又会了一道生物题,它真正做的是一段更完整的科研流程:调用专业工具进行分子设计,再把设计送进真实实验环境验证。

蛋白质设计实验
图注

类似的事情也发生在计算科学里。Fable 5.1利用NASA三十多年前Magellan任务留下的雷达数据,自己训练了一个神经网络,为大约三分之一的金星表面重新生成高分辨率高程地图。过去的地图能够分辨的地形细节大约在10到20公里尺度,新地图则缩小到2到3公里;高度数据的准确度最高提高了约25%。这份地图随后被以Creative Commons许可公开,希望能为NASA的VERITAS和欧洲航天局的EnVision金星探测任务提供参考。

此外,Mythos 5.1还做了一件更加工程化的事情。生物学研究经常需要反复运行蛋白质和基因组深度学习模型,GPU速度直接决定很多实验要花多少时间和钱。Mythos 5.1针对7个开源模型自行编写定制GPU Kernel,并缓存中间计算结果,最终在保持输出完全一致的情况下,把推理速度最高提高了2.5倍。Anthropic估算,在一些全基因组分析任务里,这些优化可以把GPU成本降低30%到60%。

科研计算优化
图注

把这些案例放在一起,Anthropic对Claude科研能力的定义已经发生了变化。过去谈AI for Science,很多时候还是让模型读论文、检索资料、写代码或者解释结果。到了Fable 5.1和Mythos 5.1,Claude开始进入更长的科研流程。这条路甚至已经开始从软件走向真实实验设备——就在Fable 5.1发布前一周,Anthropic开放了Model Hardware Standard的研究预览,希望让AI Agent能够直接操作显微镜、液体处理设备和机械臂等实验室硬件。

随着能力往科研和高价值任务里走,Anthropic不仅需要面对"该向谁开放"的安全问题,也越来越在意另一件事:怎么防止最核心的模型能力被别人"搬走"。Fable 5.1这次加入了更强的反蒸馏机制。Anthropic在官方公告里直接点名了一种做法:过去,API用户可以修改多轮对话里的历史上下文,同时保留Claude此前生成的thinking记录。这样一来,外部模型就有机会批量收集Claude的推理轨迹,用来训练和蒸馏自己的模型。

反蒸馏机制
图注

从Fable 5.1发布当天开始,新创建的API账号已经不能再这样操作。只要修改此前的对话上下文,之前保存的thinking transcript就不能继续保留。Anthropic明确表示,这项改动就是为了封堵一种"已经公开记录的蒸馏技术"。企业端的安全体系也在同时补齐,Anthropic同时推出的Enterprise Frontier Safeguards,就把监控所需要的数据直接存在客户自己控制的云基础设施里,而并非Anthropic的服务器。

如果目前的计划没有变化,再过几天,Anthropic可能就要正式把自己的账本摆到华尔街面前。The Information最新报道称,Anthropic计划在9月7日美国劳动节之后公开IPO招股书,并在9月中旬举行投资者日,最快可能在9月底至10月初上市。公司已经在6月秘密提交了IPO文件。放在这个时间窗口里,Fable 5.1很自然地成为了Anthropic公开递表前的一次能力展示。

Anthropic上市计划
图注

今年5月,Anthropic最近一轮私募估值达到9650亿美元。到了8月,多名投资者已经预计,Anthropic上市时的估值可能达到2万亿美元以上。投资者预计其年化收入年底可能达到1000亿至1200亿美元。路透社8月获得的内部财务预测显示,Anthropic预计2028年收入达到1900亿到2000亿美元。而公司的年化收入run rate,也已经从2025年底的约90亿美元,增长到今年5月的470亿美元,并在7月底进一步超过650亿美元。

就在即将上市的时间点上,Anthropic仍在花大量的钱买GPU、训练模型、做推理和扩张团队。Fable 5.1发布前一周,Anthropic被曝与Nscale签下一份为期六年、价值450亿美元的算力合同,租用西弗吉尼亚州约460MW的数据中心容量。几天后,又与英伟达支持的Lambda签下约350亿美元云计算合同。仅这两笔新近曝光的算力承诺,就已经达到800亿美元。

算力投资
图注

这可能正是Anthropic上市以后最需要证明的一道算术题。增长已经足够快,问题是,在算力承诺也以数百亿美元的速度膨胀时,收入最终能不能跑得比成本更快。Fable 5.1的价值,不只是让Anthropic在递表前再拿下一张漂亮的Benchmark成绩单。从更长时间的Agent,到科研和高价值企业任务,再到缓存降价、安全、权限和基础设施,Anthropic正在试图证明一条更完整的链路:模型能力可以变成工作,工作可以变成收入,而收入最终可以跑赢算力。

Anthropic未来展望
图注

几天之后,等Anthropic公开招股书,这条链路就不再只是模型公司的产品故事,它还会变成华尔街给Anthropic定价的依据。

免责声明:本文内容整理自公开报道,仅供参考与讨论,具体信息请以官方发布为准。

点赞(0)

评论列表 共有 0 条评论

暂无评论
立即
投稿
发表
评论
返回
顶部