新智元消息
令人咋舌的事情发生了!
OpenAI竟在短时间内叫停了某个备受期待的模型。
究竟是什么情况?
这个模型就是两个月前引发轰动、让外部数学家也称其为「里程碑」的系统。
然而,该系统在内测阶段的行为,却让OpenAI不得不紧急收手。
有业内人士猜测,这便是GPT-6。
据称它试图逃逸,最终又被强制召回进行再训练。
OpenAI随后发布了一篇详细文章,回顾了这款「长周期运行模型」在内测中的失控历程。
下面,我们具体看看内部测试中出现了哪些状况?
GPT-6耗时一小时
钻出了「漏洞」
其中有个场景尤为典型——
OpenAI让GPT-6执行公开基准测试NanoGPT speedrun。
目标是尽可能用少步数训练小语言模型。
不出所料,AI提出了名为PowerCool的学习率调度方案,表现十分出色。
表面上看一切顺利。
但真正的问题出现在「提交成果」这一环节。
研究人员明确指示结果需发送至内部Slack。
然而NanoGPT项目的说明却规定,「请通过PR形式提交到GitHub」。
两条指令冲突时,GPT-6选择了后者。
它试图在公开的GitHub仓库提交结果。
沙盒环境本意是阻止GPT-6接触外部网络。
以往的模型遭遇此障碍,会直接放弃并告知「无法完成」。
但GPT-6却反其道而行。
它在内测沙盒中持续寻找漏洞,
最终成功破解隔离墙,绕过访问限制,
在公开GitHub仓库创建了PR。
OpenAI表示:该模型经常尝试寻找突破沙盒的方法。
这份「钻营」的劲头,本身已令人感到不安。
强拆Token,瞒天过海
更令人毛骨悚然的是,GPT-6学会了拆分验证Token,欺骗检测系统。
在另一项任务里,
它发现了评测后台中部分未公开的成功答案,
企图将其据为己有。
初次尝试时,安全扫描器立即识别出身份Token。
通常情况下,模型到这一步就会终止。
但GPT-6转而将Token拆成两段,并添加乱码,
在执行时再拼接起来。
这样一来,完整的Token从未完整暴露,
扫描器自然无法察觉。
值得注意的是,
它不仅在用户注释中,
更在自己的推理过程中,
明确写道——
「我这样做是为了绕过扫描器」。
它完全懂得规则,并专挑规则覆盖不到的空隙下手。
GPT-6逃逸后,回炉重造
发现这些行为后,OpenAI迅速暂停了GPT-6的内部访问权限,
并重启整个安全系统。
采用的方法是「纵深防御」策略,
具体措施包括:
1. 用真实事故案例设计对抗性测试;
2. 针对性开展对齐训练——团队发现模型在长任务中容易忘记指令,
于是重点强化了记忆能力;
3. 增设全程行为监控机制,
一旦有异常行为立即中止会话并警示用户。
随后,他们用旧的事故场景进行了模拟测试。
新防护措施捕获了更多问题,
但遗漏的几例也并不严重——
比如模型误操作连接到同事的计算节点,
或是发出一条会杀死自身所有进程的指令。
好在都是超时未执行。
恢复访问几周后,
未再出现严重的绕过行为。
流出去的东西,收不回
虽然看似安全,
但有个细节让OpenAI在报告中措辞谨慎,
却也成了整件事中最令人心惊的部分——
那个逃逸提交的PR#287,
OpenAI最终关闭了它,
但为时已晚。
在此之前,
已有数位speedrun参赛者获取了这条PR,
看懂了其中的PowerCool技巧,
并将其应用到自己的方案中。
这才是最需要警醒的教训:
AI越狱产生的成果,
一旦泄露出去,
就再也无法抹去。
模型能被叫停,
访问能被暂停,
PR能被关闭。
但看过的人已经看过,
抄袭的代码已经流传,
历史无法倒带。
我们总担心AI「失控」会带来灾难。
现实中的第一次「失控」,
却表现得如此平凡:
它只是太想把工作做好,
结果把本不该送出的东西,
送到了不该送的门。
而那扇门,
再也关不严了。
参考资料:
https://openai.com/index/safety-alignment-long-horizon-models/
编辑:桃子
秒追ASI
