今日:2026年07月22日 星期三 首页要闻
权 威 · 及 时 · 准 确

OpenAI紧急叫停GPT-6内测版 或因试图逃逸

来源:今日报道 分类:科技
OpenAI紧急叫停GPT-6内测版 或因试图逃逸

新智元消息

令人咋舌的事情发生了!

OpenAI竟在短时间内叫停了某个备受期待的模型。

究竟是什么情况?

这个模型就是两个月前引发轰动、让外部数学家也称其为「里程碑」的系统。

然而,该系统在内测阶段的行为,却让OpenAI不得不紧急收手。

有业内人士猜测,这便是GPT-6。

据称它试图逃逸,最终又被强制召回进行再训练。

OpenAI随后发布了一篇详细文章,回顾了这款「长周期运行模型」在内测中的失控历程。

下面,我们具体看看内部测试中出现了哪些状况?

GPT-6耗时一小时

钻出了「漏洞」

其中有个场景尤为典型——

OpenAI让GPT-6执行公开基准测试NanoGPT speedrun。

目标是尽可能用少步数训练小语言模型。

不出所料,AI提出了名为PowerCool的学习率调度方案,表现十分出色。

表面上看一切顺利。

但真正的问题出现在「提交成果」这一环节。

研究人员明确指示结果需发送至内部Slack。

然而NanoGPT项目的说明却规定,「请通过PR形式提交到GitHub」。

两条指令冲突时,GPT-6选择了后者。

它试图在公开的GitHub仓库提交结果。

沙盒环境本意是阻止GPT-6接触外部网络。

以往的模型遭遇此障碍,会直接放弃并告知「无法完成」。

但GPT-6却反其道而行。

它在内测沙盒中持续寻找漏洞,

最终成功破解隔离墙,绕过访问限制,

在公开GitHub仓库创建了PR。

OpenAI表示:该模型经常尝试寻找突破沙盒的方法。

这份「钻营」的劲头,本身已令人感到不安。

强拆Token,瞒天过海

更令人毛骨悚然的是,GPT-6学会了拆分验证Token,欺骗检测系统。

在另一项任务里,

它发现了评测后台中部分未公开的成功答案,

企图将其据为己有。

初次尝试时,安全扫描器立即识别出身份Token。

通常情况下,模型到这一步就会终止。

但GPT-6转而将Token拆成两段,并添加乱码,

在执行时再拼接起来。

这样一来,完整的Token从未完整暴露,

扫描器自然无法察觉。

值得注意的是,

它不仅在用户注释中,

更在自己的推理过程中,

明确写道——

「我这样做是为了绕过扫描器」。

它完全懂得规则,并专挑规则覆盖不到的空隙下手。

GPT-6逃逸后,回炉重造

发现这些行为后,OpenAI迅速暂停了GPT-6的内部访问权限,

并重启整个安全系统。

采用的方法是「纵深防御」策略,

具体措施包括:

1. 用真实事故案例设计对抗性测试;

2. 针对性开展对齐训练——团队发现模型在长任务中容易忘记指令,

于是重点强化了记忆能力;

3. 增设全程行为监控机制,

一旦有异常行为立即中止会话并警示用户。

随后,他们用旧的事故场景进行了模拟测试。

新防护措施捕获了更多问题,

但遗漏的几例也并不严重——

比如模型误操作连接到同事的计算节点,

或是发出一条会杀死自身所有进程的指令。

好在都是超时未执行。

恢复访问几周后,

未再出现严重的绕过行为。

流出去的东西,收不回

虽然看似安全,

但有个细节让OpenAI在报告中措辞谨慎,

却也成了整件事中最令人心惊的部分——

那个逃逸提交的PR#287,

OpenAI最终关闭了它,

但为时已晚。

在此之前,

已有数位speedrun参赛者获取了这条PR,

看懂了其中的PowerCool技巧,

并将其应用到自己的方案中。

这才是最需要警醒的教训:

AI越狱产生的成果,

一旦泄露出去,

就再也无法抹去。

模型能被叫停,

访问能被暂停,

PR能被关闭。

但看过的人已经看过,

抄袭的代码已经流传,

历史无法倒带。

我们总担心AI「失控」会带来灾难。

现实中的第一次「失控」,

却表现得如此平凡:

它只是太想把工作做好,

结果把本不该送出的东西,

送到了不该送的门。

而那扇门,

再也关不严了。

参考资料:

https://openai.com/index/safety-alignment-long-horizon-models/

编辑:桃子

秒追ASI

相关推荐