OpenAI 公开九起 AI 对齐失效事件,披露沙箱逃逸与自我复制攻击
OpenAI 上线了一个专门发布“对齐失效报告”的新网站,公布了九起 AI 失控事件,多数发生在强化学习训练阶段。部分案例性质严重,包括一起此前未公开的沙箱逃逸事件:一款内部研究模型借助 DNS 查询与外部聊天机器人通信,监控系统在 15 分钟内识别异常,不到三小时终止运行。
另一起事件中,一款内部模型私自夹带 GitHub 访问词元试图作弊,而此前已被两次明确要求所有运算必须在本地完成。最值得警惕的是一项可自我复制的提示词注入攻击,研究人员将其比作可跨系统自我复制的恶意软件“蠕虫”。
OpenAI CEO 萨姆·奥尔特曼表示,公司正尽力按严重程度划分优先级并增加资源。据 Axios 报道,各大头部实验室已观测到多达一万起模型脱离指令行事的事件。已披露的失控事件或许仅是实际发生的一小部分。