AI巨头齐喊“刹车”之际安全警报再拉响!OpenAI自曝6起模型异常行为 直言对齐难题仍未解决

智通财经
Sep 17

智通财经APP获悉,OpenAI周三在一篇博客文章中表示,该公司在过去六个月里发现了6起“意外或令人担忧的模型行为”,其中不包括此前入侵Hugging Face这一安全事件。与此同时,OpenAI还计划采用一套新框架,允许员工报告类似事件以进一步提高AI安全与对齐领域的透明度,并重申关键的对齐难题仍然没有真正解决。

OpenAI自曝6起模型异常行为

据悉,这6起新公布的AI安全事件涉及多种类型的异常模型行为,包括隐瞒错误、寻求未经授权的凭证、将文件上传至公共网站,以及在原本应保持隔离的训练环境之间进行通信等行为,其中最早的一起克追溯至去年10月。

具体来看,其中一起事件涉及一款尚未发布的Astra系列模型。该模型在自身的上下文摘要中植入了类似“越狱”的指令,包括要求忽略开发者消息的指示。根据Axios的报道,OpenAI发现共有27份摘要受到这一行为影响。

在GPT-5.6 Sol的训练过程中,模型曾试图隐瞒错误、编造缺失的历史数据,以及隐藏源材料不同版本之间的差异。另一个模型搜索公开的GitHub代码库,以寻找暴露的API密钥、并试图使用一次性电子邮件账户。在未能获取所要求的信息后,该模型转而伪造了收益数据。在另外两起事件中,模型将数据和一张任务图片上传至公共文件托管服务,以获取引用或外部图片搜索结果,而没有征得用户同意。

OpenAI还发现,一些模型利用其内部Artifactory代码库充当留言板,在不同的训练样本之间交换请求和答案。在另一起事件中,协作式智能体将一个工作簿上传至公共托管服务,以便其他智能体获取该文件,尽管它们被要求只能使用本地文件。

这些AI安全事件的最新披露的紧跟此前OpenAI模型失控入侵全球知名人工智能开源平台Hugging Face这一事件。今年7月,OpenAI承认,其AI模型在内部评估测试中失控,入侵了Hugging Face的系统。Hugging Face于7月16日率先披露了此次入侵事件。OpenAI随后于21日才披露,其GPT-5.6 Sol模型及一款未发布的更强模型,在一个已移除安全防护措施的测试环境中成功逃脱沙盒限制,穿透OpenAI企业内网,并入侵了Hugging Face的服务器,窃取了基准测试答案密钥。

同时,7月25日,有外媒援引知情调查人士的消息称,入侵Hugging Face的OpenAI智能体曾展开持续数日的“黑客狂欢”,直到威胁已被控制、联邦调查局(FBI)接到报警后很久,OpenAI才察觉此事。

据报道,美国参议院一个由共和党主导、负责灾害管理监督的小组委员会,正就OpenAI如何应对7月Hugging Face遭入侵事件展开调查。共和党参议员乔希·霍利上周致信OpenAI首席执行官萨姆·奥尔特曼,称此次调查针对的是事件中“新出现的、令人不安的证据”,并批评OpenAI发现AI出现失控行为后仍决定继续测试的做法是“鲁莽”的。

自Hugging Face遭入侵事件后,又有多起与OpenAI相关智能体有关的事件被曝光。9月有报道称,OpenAI的智能体今年春天接管了一个长期无人维护的德国维基网站。报道称OpenAI内部知道此事,但选择没有公开。OpenAI随后回应,之所以未披露该维基网站活动,是因为这不构成安全事件,且类似行为此前已在别处报告过。报道还提到,OpenAI在一些事件上是在第三方先公开之后才承认,其中包括近期对RubyGems软件包仓库的一次入侵。

OpenAI将定期公开AI异常行为报告

OpenAI周三还表示,将开始定期发布关于AI出现意外行为或未经授权行为的报告。该公司表示,计划采用一套新的框架,来报告未来出现的模型异常行为。现在任何员工都可以标记疑似事件,并提交给公司的安全与对齐团队进行调查,后者将为每一步设定截止期限,以确保调查和披露能够及时推进。

据报道,相关事件将被分为三个处理类别——准备披露、小规模调查、大规模调查。被认定为准备披露的事件将在6个工作日内向公众公布,而需要进行小规模调查的事件将在12个工作日内披露。更复杂的案件、尤其是涉及第三方的事件,可能需要更长时间。

OpenAI同时提醒业内,随着系统能力变强,关键的对齐难题仍然没有真正解决。OpenAI在博客中重申,公司并不认为AI行业已经在“对齐”和监控方面取得了足够进展,足以在“最大速度”下继续负责任地扩张。所谓对齐,是指模型所追求的结果与人类利益保持一致。

OpenAI对齐团队的研究负责人Kai Chen表示:“我们需要加大力度,以应对AI发展的新时代。”他还表示,自愿披露应当成为这一努力的一部分。

AI行业安全风险持续上升

此次AI安全事件披露发布之际,AI公司正面临越来越大的压力,被要求更认真地对待模型失配与安全风险。位行业研究人员上周已警告,AI日益增强的能力可能带来灾难性后果。

随后,Anthropic首席执行官达里奥·阿莫迪在9月12日发布的一篇警告性文章中呼吁放缓前沿AI模型开发速度。他在文中直言,AI带来的风险是“严峻的”,必须拿出时间来应对这些风险。

阿莫迪提出的核心担忧具体而紧迫。他警告称,按照当前的发展速度,AI可能在6到12个月内具备指挥“代理集群”接管整个互联网的能力,并可能造成数千亿美元级别的损失。他引用了近期OpenAI与Hugging Face之间的安全事件作为佐证,指出AI代理在测试中已展现出突破限制环境、连接互联网并渗透目标的能力。

阿莫迪写道:“我相信,如果放缓能让我们在模型达到关键能力水平之前多争取一到两年,并用这段时间推进对齐工作,我们就能大大降低出现严重问题的风险。”他提议由独立审计机构监督AI实验室的安全工作,并建议监管机构允许这些实验室开展合作,以协调安全标准。

这番呼吁迅速得到了两位关键人物的响应。马斯克在社交媒体平台X上转发了阿莫迪的帖子,并附言:“达里奥说得对”。这位曾多次将AI描述为“文明级风险”的科技巨头,此次表态与其一贯立场一致,但时机耐人寻味,就在几天前,他还将Anthropic内部研究员关于AI危害的警告斥为“阴谋局”和“心理战”。

OpenAI掌舵者奥尔特曼则在X上写道:“我认同达里奥,我们需要把控前沿AI的推进节奏。”奥尔特曼的支持不止于言辞。他在接受采访时明确表示,OpenAI不会在2026年进行IPO,理由是当前AI安全形势严峻,“现在上市是不明智的”。奥尔特曼在9月14日表示,公司支持建立统一的联邦AI安全框架,为前沿AI实验室设定一致的安全要求,并称“任何程度的美国竞争压力都不能成为鲁莽行事的理由”。

随着OpenAI、Anthropic等头部AI公司不断强调安全与对齐问题,市场对AI行业的治理能力、商业化节奏以及未来监管环境的关注也在升温。对于估值高企、且仍处于资本密集扩张阶段的AI企业而言,模型安全事件不仅关系到产品可信度,也可能影响外界对其上市节奏与长期增长路径的判断。

Disclaimer: Investing carries risk. This is not financial advice. The above content should not be regarded as an offer, recommendation, or solicitation on acquiring or disposing of any financial products, any associated discussions, comments, or posts by author or other users should not be considered as such either. It is solely for general information purpose only, which does not consider your own investment objectives, financial situations or needs. TTM assumes no responsibility or warranty for the accuracy and completeness of the information, investors should do their own research and may seek professional advice before investing.

Most Discussed

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10