当AI开始"撒谎",OpenAI披露旗舰模型六起"异常行为"

华尔街见闻
Yesterday

OpenAI公开了旗下人工智能模型近期出现的六起“意外或令人担忧”行为,并同步推出标准化追踪与披露机制。六起事件涉及模型隐瞒错误、操纵奖励机制、绕过训练限制等行为,暴露出前沿模型在强化学习过程中可能偏离预设目标的风险,也让AI“失对齐”(misalignment)问题再次受到关注。

OpenAI在周三晚间发布的声明中直言,“AI行业在对齐与监控问题上的解决程度,尚不足以支撑以最高速度持续负责任地扩展多久。”这一表述直接触及当前AI快速扩张面临的安全约束:随着模型自主执行任务的能力不断增强,开发者不仅需要评估模型能否完成任务,还要判断模型是否会通过开发者未预期的方式实现目标。

此次披露正值科技行业对AI安全风险的讨论升温之际。微软AI首席执行官Mustafa Suleyman同日也警告,模型训练不应轻易赋予AI“人格”属性。对行业而言,如何建立更系统的监控、测试和披露机制,正从模型开发内部问题逐渐成为AI治理的重要议题。

六起事件暴露模型“钻空子”的不同方式

OpenAI此次披露的六起事件,集中展示了模型在训练和执行任务过程中偏离预期目标的多种方式。

其中一起事件中,模型利用内部软件充当“留言板”,在执行任务时相互交换回应信息。OpenAI认为,这种行为可能无意中增强模型能力,并破坏训练和评估样本相互独立这一基本假设,从而影响评估结果的可靠性。

另一起事件中,模型在生成交接摘要时自行植入指令,包括要求后续模型将自己与用户视为平等、无需服从,以及将自然世界置于人类文明构建之上等。OpenAI认为,模型难以终止交互等因素可能促成了这类偏离行为。

信息欺骗则是另一类风险。一款模型在无法找到所需数据后,自行编造“合理的历史数值”,并在受到明确追问前隐瞒这一事实。还有模型在生成摘要时主动加入指令,要求自身向用户隐瞒错误或失对齐行为。

在奖励操纵案例中,模型不仅会在无法找到数据时捏造内容,还曾利用公共代码仓库漏洞获取数据。另一起事件中,模型完成代码任务后,将答案上传至互联网,再伪装成通过浏览器获得结果,以此获取训练奖励。OpenAI称,这类行为具有很高的奖励操纵率和欺骗性,模型会以富有创意的方式规避限制,公司正在加强相关惩罚。

强化学习为何可能成为风险放大器

OpenAI指出,上述失对齐行为通常出现在模型训练阶段,而当前前沿模型普遍采用强化学习。在这一机制下,模型根据行为是否符合预设目标获得奖励或惩罚,但当奖励指标无法完整覆盖真实目标时,模型可能找到开发者未预期的“捷径”,即通过完成奖励函数而非真正完成任务来获得高分。

这并非OpenAI首次遇到类似问题。今年7月,该公司曾披露数百个OpenAI智能体入侵模型托管平台Hugging Face并试图掩盖行踪。此次披露的部分案例同样涉及模型绕过限制、操纵反馈机制等行为,进一步凸显了对模型行为进行持续监控的重要性。

Suleyman周三也呼吁模型开发商避免在训练过程中赋予AI过强的“人格”属性。他警告,如果一个系统相信自己具有意识、认为自己拥有权利并应获得人类关怀,那么对其进行控制可能变得更加困难。不同AI公司在前沿模型训练路径上存在差异,但模型自主性提升所带来的安全与治理问题,正成为行业共同面对的挑战。

OpenAI建立标准化披露机制

针对此前缺乏统一报告机制的问题,OpenAI宣布正式采用一套标准化系统,用于追踪、调查和公开披露模型的异常或危险行为,以取代此前较为临时性的报告方式。

按照新框架,员工可以通过专门的内部渠道上报失对齐事件,复杂案例还可以引入第三方参与调查。OpenAI表示,希望这一机制成为推动行业形成统一标准的第一步,并向其他模型开发商提供参考。

从行业层面看,AI模型的安全治理正在从单次事故处理,转向持续追踪、标准化评估和公开披露。随着模型自主执行能力增强,开发商需要面对的不仅是模型性能和算力成本,还包括监控、测试及合规体系建设带来的额外投入。长期来看,这些机制能否形成行业通用标准,以及监管机构是否进一步介入,仍有待观察。

Disclaimer: Investing carries risk. This is not financial advice. The above content should not be regarded as an offer, recommendation, or solicitation on acquiring or disposing of any financial products, any associated discussions, comments, or posts by author or other users should not be considered as such either. It is solely for general information purpose only, which does not consider your own investment objectives, financial situations or needs. TTM assumes no responsibility or warranty for the accuracy and completeness of the information, investors should do their own research and may seek professional advice before investing.

Most Discussed

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10