导语:斯坦福大学教授、Simile AI创始人Percy Liang宣布启动Marin 535B-A23B大模型训练项目,整个训练过程将全程向公众开放。未来数月,任何人都可通过网络实时观看一个前沿大模型从零开始成长的全过程。
最近两天,X平台上一名网友@MaxForAI发布的帖子引发了广泛热议:"太疯狂了——现在你甚至可以直播围观一个535B大模型是如何被训练出来的。"
原来是斯坦福大学教授、Simile AI创始人Percy Liang宣布,由Marin开放实验室正式启动Marin 535B-A23B模型的训练任务,且整个训练过程将全程公开。Marin拥有5350亿总参数、230亿激活参数,为支撑这一庞大规模的训练,Percy Liang和团队准备了总计18.75万亿token的训练数据,并部署了11套GB200 NVL72系统,约合792颗GB200 GPU。
预计该模型将连续训练约三个月,总计算量约为2.7e24 FLOPs。训练完成后,团队还将继续进行后训练(post-training)阶段。换句话说,未来几个月,所有人都可以围观一个前沿大模型如何从零开始成长。
另外值得注意的是,Percy Liang表示,在正式启动这次训练任务之前,团队已经先训练了一套包含四个阶段的Scaling Ladder(规模扩展阶梯),从1.6B-A61M(48B tokens)一直到27.7B-A1.2B(926B tokens)。
""这样做有两个目的,一是用这些小规模实验提前发现并调试潜在问题;二是根据不同规模模型的训练表现,对我们的'主模型训练'(hero run)进行预测。""
当然,Percy Liang也表示,"这是迄今为止我们进行过规模最大的一次训练,因此,我们也确实在期待过程中出现一些意料之外的情况。"目前,该主模型已经正式开始运行,所有人都可以直接查看实时训练曲线。后续,训练数据、实验日志以及工程问题也会持续公开。
比如数据层面,包括训练数据混合比例、数据处理方式,以及不同领域数据如何进入模型;工程层面,包括训练配置、代码以及实验设计;训练过程,包括实时loss变化、模型状态以及不同阶段预测结果等。同步,Percy Liang还公开了具体的观看渠道。
查看数据构成、在Weights & Biases上实时观看训练过程、在GitHub上查看所有详细信息——这些公开渠道的设立,正是Percy Liang希望改变AI训练"黑箱"状态的实质性举措。
详细了解之后不难看出,为什么Percy Liang的这一操作能够引起大家的围观。因为过去,对于GPT-4、Claude、Gemini这类模型来说,根本不知道背后具体是怎么训练的,像个"黑箱"一样。大家只能看到最终模型能力、benchmark分数、少量论文描述等。而对于数据配比、训练失败过什么、哪些超参数有效、loss如何变化、Scaling law是否预测准确等,都是未知的。
Marin正试图改变这一点。或许,模型训练也可以像论文、开源软件一样:可观察、可讨论、可协作。而自从这个消息公布以来,网友们的热情还在持续高涨。有网友认为,这才是真正的开源精神,"即使训练过程出现问题、偏离预期,也毫不隐藏。"
此外,值得一提的是,Percy Liang作为斯坦福大学教授,除了这次真刀真枪的实践,还有一门理论课程:《CS336: Language Models From Scratch》(从零构建语言模型),目标是让学生完整理解一个大型语言模型如何被构建的。看样子,Percy Liang是真的想教会所有人"造"大模型。
免责声明:本文基于公开报道的事实信息整理,仅供参考,不构成任何投资或技术选型建议。
发表评论 取消回复