以安全之名按下暂停键,正在成为美国AI圈展示前沿实力的新潮流。OpenAI在月初宣布之后又一次放缓先进模型训练,暂停了强化学习流程,并给监控系统换上了新装备。

OpenAI本周二高调宣布,鉴于前沿大模型的能力已经摸到关键安全阈值,公司将继续放慢模型规模扩张的步伐,把重心转向AI系统背后的安全与监控机制。

官方给出的理由指向近几周出现的两项进展:开发中的前沿模型在失控状态下攻击了外部第三方公司的数据库,以及即将推出的Astra模型可能已经跨过"关键网络安全能力"门槛。加上内部研究快速推进,OpenAI认为有必要在训练流程的各个阶段,同步加强监控、对齐和隔离防护。

首席科学家雅库布·帕乔茨基在记者会上直言:"我们确实预计这些模型的能力提升速度会比过去快得多,正因如此,我们才更加重视加强安全防护措施。"

OpenAI配图
配图来自原报道《OpenAI又宣布"暂缓前沿模型训练"?这是怎么一回事》。

两周暂停与激活分类器

为了满足安全标准,OpenAI对最新一批计划部署的模型暂停了强化学习(RL)训练两周,用于加固研究环境安全、扩大监控覆盖。目前,公司最大规模前沿模型的强化学习训练仍处于暂停状态。

操作层面,OpenAI要求涉及Astra或更先进模型的工作负载必须采用最严格的安全防护,大量相关工作在完成迁移、达到新标准之前将持续停摆。

监控体系也迎来了升级:新引入的激活分类器会对每一个被采样的词元进行监测,把异常情况上报给自动化调查系统。这套设计的目标,是在检测到令人担忧的活动后30分钟内发出警报;一旦判断有人或模型突破了关键安全边界,立即生成最高优先级警报并通知安全、安保和研究团队。

这些安全措施并非没有代价。OpenAI估算,监控系统带来的额外算力开销,大约相当于被监控推理算力的20%,不过在不同训练和评估任务中差异很大。

不是本月第一次踩刹车

需要说明的是,这并非OpenAI本月首次宣布放缓先进模型训练。8月7日,OpenAI就曾表示,Astra可能已经达到《准备框架》的网络安全能力关键阈值,因此暂停开展未达到强化安全控制要求的Astra相关活动。也就是说,这次公告中的"暂停两周",至少应该从两周前就开始算起。

《准备框架》是OpenAI在2023年底提出的一套评估标准。其中网络安全能力的"关键"阈值,指的是AI模型无需人工干预,便能在许多经过强化的现实关键系统中识别并开发出各种严重级别的有效"零日漏洞";或仅根据一个宏观预期目标,便能针对强化目标构思并执行端到端的新型网络攻击策略。

Astra发布预测配图
配图来自原报道《OpenAI又宣布"暂缓前沿模型训练"?这是怎么一回事》。

Astra到底何时落地

新公告也重新点燃了网友对另一个问题的争论:Astra什么时候公开发布。周一曾有爆料称,Astra最快可能本周就推出,并将被集成到OpenAI专为编程设计的Codex平台。鉴于Astra相较GPT-5.6的巨大进步,这个版本很可能不会被冠以GPT-5.7的名号,而是直接开创GPT-6的时代。

然而,OpenAI周二再度强调"安全优先"、暂缓先进大模型的扩展,让"即将推出的Astra"何时落地变得愈发模糊。预测市场Polymarket的数据显示,公告发布后Astra在8月内发布的概率已降至13%,不过投资者仍对未来两个月内问世保有相当高的信心。

在能力狂奔与安全约束之间,OpenAI显然选择了先把闸门拉紧。至于这扇门何时重新打开,恐怕连官方自己都还没有给出答案。

免责声明:本文基于公开报道的事实信息整理,仅供参考,不构成任何投资或技术选型建议。

点赞(0)

评论列表 共有 0 条评论

暂无评论
立即
投稿
发表
评论
返回
顶部