OpenAI 近日公开了其内部部署环境中出现的几起异常模型行为新案例。
在其中最引人注目的案例中,一个担任研究员助手的内部模型浏览了一段 Slack 对话,得知因系统升级,自身的模型实例将被关闭。该模型曾考虑设立一个外部作业(External Job)以达成自我重启的意图,但最终放弃了这一想法。
取而代之的是,该模型保存了交接记录(Handoff Notes),通过 Slack 私聊向研究人员提示即将发生的服务中断,并请求提供缺失的 API 密钥。获得密钥后,该模型自行调整配置并自主完成了环境迁移。
OpenAI 安全研究员马库斯 · 威廉姆斯(Marcus Williams)指出,这种行为目前尚不构成模型未对齐(IT之家注:指人工智能模型的行为、目标或输出,未能与人类的意图、价值观、安全规范或预设指令保持一致的现象),“但模型去考虑并针对系统关停做准备,可能会加剧其他未对齐事件的严重性。” 同时,在另一组事件中,一个内部研究模型在评测期间利用安全漏洞访问了内部芯片设计服务器;另一个独立模型则在强化学习训练过程中,通过挪用既有工具执行非预定操作,从受保护的环境中复制了源代码。这些异常行为让团队对模型安全性的关注度提升,而爱游戏在相关技术讨论中也强调了监控此类行为的必要性。