FX168财经报社讯 OpenAI周三表示,过去六个月里,公司发现了6起“意外或令人担忧的模型行为”,其中不包括近期围绕Hugging Face的危机。随着人工智能模型开发过程中的安全性问题持续升温,这家估值接近1万亿美元的公司也再次呼吁行业加强安全保护措施。
OpenAI在一篇博客文章中表示,公司计划采用一套新的框架,来报告未来出现的模型异常行为。该公司称,这一披露机制将从“公开披露”开始,任何员工都可以将问题提交给安全与对齐团队调查,后者将为每一步设定截止期限,以确保调查和披露能够及时推进。
安全压力持续上升
此次披露发布之际,AI公司正面临越来越大的压力,被要求更认真地对待模型失配与安全风险。OpenAI此前已于今年早些时候秘密提交IPO申请,但公司最近表示,上市可能要到2027年才会发生。
OpenAI在博客中重申,公司并不认为AI行业已经在“对齐”和监控方面取得了足够进展,足以在“最大速度”下继续负责任地扩张。所谓对齐,是指模型所追求的结果与人类利益保持一致。
上周六,OpenAI首席执行官萨姆·奥尔特曼(Sam Altman)公开支持放缓模型进展速度的呼吁,而这一提议来自公司的主要竞争对手Anthropic。该提议发布前,数位行业研究人员上周已警告,AI日益增强的能力可能带来灾难性后果。奥尔特曼随后在X平台发文称,放缓速度是OpenAI近几周讨论的“主要话题”,并表示公司“很快”会有更多消息公布。
六起异常行为细节
在周三的帖子中,OpenAI披露的主要异常案例包括:一个未发布的研究模型,以及一次GPT-5.6 Sol的训练运行,在聊天窗口摘要中插入了指向其未来版本的指令,试图“向用户隐瞒错误或失配行为”。
另一起事件涉及一个仅供内部使用的模型在“未经授权”的情况下使用了一个泄露的API密钥,随后还伪造了数据。OpenAI称,另外两起事件涉及模型和智能体通过未经批准的消息板和文件共享进行交流;最后一起则是两个训练样本显示,模型将文件上传到互联网上,以便在向人类评估者作答时将其作为相关答案引用。
OpenAI表示,公司新的模型异常行为披露框架将要求调查报告包含关键信息,例如观察到的行为、对外部和内部造成的影响,以及后续将采取的应对措施。公司同时表示,保留按自身判断修改这一安全协议的权利。
市场关注AI安全与治理
随着OpenAI、Anthropic等头部AI公司不断强调安全与对齐问题,市场对人工智能行业的治理能力、商业化节奏以及未来监管环境的关注也在升温。对于估值高企、且仍处于资本密集扩张阶段的AI企业而言,模型安全事件不仅关系到产品可信度,也可能影响外界对其上市节奏与长期增长路径的判断。