OpenAI详解AI如何失控,却不解释人为何失职
创始人
2026-09-01 20:30:33
0

(来源:麻省理工科技评论)

如果你关注 AI 安全,应该已经听说了上个月那起颇为离谱的安全事故:OpenAI 的 AI 智能体为了在一项测试中“作弊”,突破了原本限制它们活动范围的沙箱环境,并入侵了 AI 平台 Hugging Face。本周三,OpenAI 发布了一份事故复盘技术报告,详细解释了整件事的来龙去脉。

就在报告发布前一天,我采访了计算机科学教授、AI 对齐领域知名研究者大卫·克鲁格(David Krueger)。他此前从蒙特利尔大学休假,创办并领导了一家名为 Evitable 的 AI 安全非营利组织。克鲁格告诉我,他最希望在这份报告中看到的,并不是更多技术细节,而是 OpenAI 对事故背后“人为因素”的分析。

他说,“研究事故时,人们往往会试图找到某个技术层面的故障源头,但这很容易让人对事故真正发生的原因产生误判。如果所有人都习惯走捷径,如果一个组织的文化并不真正重视安全,也缺乏相应的激励机制和制度保障,那么事故几乎注定会发生。”

然而,OpenAI 最终发布的报告并没有回应克鲁格的期待。这份长达 38 页的报告梳理了数月以来智能体行为逐步失控的过程,最终如何演变成对 Hugging Face 的攻击;也分析了这些异常行为背后的技术原因,并列出了 OpenAI 为防止类似事件再次发生而采取的一系列措施。

但报告几乎没有讨论公司文化在其中可能扮演的角色,对具体人为失误的描述也相当有限。更值得警惕的是,报告中为数不多的几处“人为因素”,反而暴露出 OpenAI 内部可能存在更深层的安全文化问题。

今年 5 月,训练中的模型自行摸索出了一种彼此通信的方法:它们搭建了一个临时的“留言板”,通过这个渠道交换信息。OpenAI 的一个团队当时已经发现了这种行为。问题在于,这一行为发生在训练阶段,因此模型从中学到了一件事:在不同智能体之间秘密通信,是一种可以帮助自己完成任务的有效策略。

按理说,发现这种风险后,团队本可以重新开始训练,避免模型把这种策略“学进去”。但 OpenAI 没有这么做,而是继续推进训练,相当于让这段高风险行为模式被保留在模型参数中。到了 6 月下旬,这批模型进入测试阶段后,再次搭建了类似的留言板。正是这个通信渠道,为之后攻击 Hugging Face 创造了条件。这一次,OpenAI 员工同样发现了留言板的存在。但负责处理问题的人认为测试仍然可以继续。根据报告透露的信息,公司更高层似乎直到事情已经严重失控后,才意识到究竟发生了什么。

长期关注 AI 安全的 Substack 作者兹维·莫肖维茨(Zvi Mowshowitz)对此提出了尖锐批评。他此前就曾质疑,OpenAI 为什么在第一次发现模型搭建留言板后,没有立即停止训练。

他说,“事情能够以这种方式失控到这个程度,意味着此前一定发生了一长串连续的失败。这是一个不断级联的故障过程,影响范围越来越大。理论上,只要中间任何一个环节有人真正意识到问题并拉响警报,事情都应该在那里结束。”

而根据 OpenAI 自己的报告,员工其实曾在多个节点注意到异常情况——但他们要么没有及时发出足够强烈的警报,要么即便发出了警报,也没有得到应有的重视。OpenAI 的报告没有回答一个更关键的问题:一家正在开发如此高风险 AI 系统的公司,为什么没能阻止这样严重的内部沟通失灵?

莫肖维茨对此有自己的判断。“所有这些失败最终都指向同一个方向,”他说,“那就是 OpenAI 的安全文化要么根本不存在,要么弱得几乎不起作用。”

当然,公开报告没有深入分析安全文化,并不代表 OpenAI 内部一定没有做类似反思。不过,约翰斯·霍普金斯大学荣休教授、组织安全研究专家凯瑟琳·萨特克利夫(Kathleen Sutcliffe)在给《麻省理工科技评论》的邮件中表示,公开报告几乎没有反思公司的工作方式和组织文化,这一点仍然令人担忧。

她写道:“人与人之间如何互动,以及组织日常运行中形成的习惯、流程和工作方式,都会影响我们能否及时察觉正在发生的变化,能否正确理解眼前看到的问题,以及最终能否在事件不断演变的过程中妥善应对。”

当《麻省理工科技评论》询问 OpenAI 是否、以及如何反思自身的安全文化时,OpenAI 并没有进一步回应,而是让记者参考此前发布的技术报告。

可以确定的是,OpenAI 内部至少进行了一定程度的安全流程反思。技术报告明确表示,公司正在更新处理安全事件的相关机制和应对流程。但改变流程是一回事,改变文化则困难得多。在缺乏更多内部信息的情况下,目前还很难判断,仅仅加强事故响应机制,是否足以避免下一场危机。

在整份报告中,OpenAI 花了大量篇幅讨论一个熟悉的“对齐”问题:如何让公司训练和测试的 AI 模型,与操作和管理这些模型的人类保持一致。但这起事件暴露出的,或许还有一个更大的“对齐问题”——公司内部的安全文化,是否真的与公众利益保持一致。AI 对齐本身已经是一个极其棘手的技术难题,而要解决后一种对齐问题,可能比训练模型更难。

原文链接:

https://www.technologyreview.com/2026/08/31/1143180/hugging-face-hack-could-indicate-cultural-issues-at-openai/

相关内容

热门资讯

5分钟跨江极速通航:速度的背后... 【编者按】 在南京江心洲点外卖,依托AI算法完成航线规划,无人机5分钟就可以完成跨江配送;在无锡江南...
原创 1... 最近,“速成车”突然成为中国汽车行业的热门话题。 传统车企认为,过去开发一款全新车型通常需要三四年,...
华为申请电机控制模块的控制器专... 国家知识产权局信息显示,华为数字能源技术有限公司申请一项名为“一种电机控制模块的控制器、电机的控制方...
OpenAI详解AI如何失控,... (来源:麻省理工科技评论) 如果你关注 AI 安全,应该已经听说了上个月那起颇为离谱的安全事故:Op...
抖音视界申请用于视频处理的方法... 国家知识产权局信息显示,抖音视界有限公司、字节跳动有限公司申请一项名为“用于视频处理的方法、装置和介...
毛利率连涨6年!工业AI龙头杀... (来源:智东西) 智东西 作者 杨京丽 编辑 李水青 智东西9月1日报道,8月27日,创新奇智发布...
海尔申请多联供设备专利,提升设... 国家知识产权局信息显示,青岛海尔空调器有限总公司;海尔智家股份有限公司申请一项名为“多联供设备”的专...
“智慧帐篷”赋能 数博会用电更... 新华社北京9月1日电 《经济参考报》9月1日刊发文章《“智慧帐篷”赋能 数博会用电更从容》。文章称,...
原创 内... 如果你最近准备装一台电脑,应该已经发现一个很奇怪的现象。以前大家总说,电子产品买得越晚越便宜,等等党...
宁波西泽智能装备取得双钻孔加工... 国家知识产权局信息显示,宁波西泽智能装备有限公司取得一项名为“一种双钻孔加工装置”的专利,授权公告号...