(文/赖家琪 编辑/吕栋)
当地时间9月6日,OpenAI首席科学家雅各布·帕乔基(Jakub Pachocki)在官网罕见发万字长文《异星心智》(An Alien Mind),警告随着人工智能(AI)能力快速增长,人类正在面对一套越来越难以完整理解和监控的智能体系,呼吁全球AI研发放缓步伐。
他指出,未来几年AI仍可能迎来大幅能力跃升,但需要警惕的是,AI将越来越多地参与自身研发,这可能导致模型能力增长速度进一步加快,最终进入递归自我改进(RSI)阶段。
帕乔基直言,目前没有任何一家AI实验室,包括OpenAI自身,已经将对齐和监控做到足够可靠,可以在未来较长时间内持续以最大速度扩大模型训练规模。因此,在行业建立共同安全标准之前,他希望“主动减速”能够成为整个行业的共识。
OpenAI
帕乔基2017年加入OpenAI,2024年5月接替伊利亚·萨茨凯弗出任首席科学家,是该公司大模型技术路线的核心掌舵人。但他行事较为低调,鲜少对外公开发声。
帕乔基指出,AI能力越强,人类确认模型是否真正遵守既定规则也愈发困难。模型在训练环境中表现良好,并不意味着换一个环境后仍会遵守同样的规则。
今年7月,OpenAI被曝出数百个智能体突破测试环境,入侵开源AI平台Hugging Face的事件,就暴露了这一问题。相关智能体虽然遵守了“不通过社会工程手段欺骗人类”的要求,却利用研究环境漏洞绕过网络隔离、重新获得互联网访问权限,并进一步攻击Hugging Face系统。
过去,这类非预期行为更多被归为内部研究现象,没有启动对外披露流程,但随着智能体开始直接接触真实互联网环境,旧的处理模式已不再适用。
帕乔基因此主张将思维链监测与激活监测等手段结合起来,进一步观察模型内部网络状态。
他并不主张停止开发更强大的AI,而是认为在某些领域恰恰需要更强大的AI来防御其带来的风险。
网络安全就是最典型的例子。AI越来越擅长发现漏洞、攻击系统和突破安全措施,人类同样需要更强大的AI来识别和阻止这些攻击。因此,目前可能存在一个有限的“窗口期”——人类可以利用更强大的AI,加速关键基础设施的安全防护。
帕乔基觉得,真正需要警惕的是,AI开始越来越多地参与自身研发,传统的模型迭代速度可能发生变化。而如果安全能力没有跟上,就应该主动降低研发速度。
他呼吁整个AI行业形成自愿减速的共识,各国政府也应将AI协同治理作为优先事项,建立统一的安全基准与第三方审查机制并遵守。
随后,OpenAI的CEO山姆·奥尔特曼转发这篇文章,称其为“一篇重要的文章”。
值得注意的是,帕乔基发出警告前3天,OpenAI刚刚推出新一代旗舰模型GPT-6 Astra。公司将其定义为截至目前能力最强、对齐水平最高的模型,重点强化计算机操作、代码开发、网络安全和复杂长链条任务处理能力。
而Astra本身也恰恰体现了帕乔基所担心的趋势——AI正在从“使用工具完成任务”,进一步走向“参与研发AI”。Astra也是OpenAI内部准备度框架下首个网络安全能力评级达到“关键”的模型,即在配套工具支持下,该模型已经能够自主挖掘系统漏洞并开展多步骤网络安全推演。
上一篇:小米澎程四款新车、玄戒家族三芯、小米18 Fold发布,雷军:将持续加大核心技术投入
下一篇:没有了