OpenAI发布新研究:用CoT监控大模型 防止恶意行为
创始人
2025-03-11 09:20:51
0

【CNMO科技消息】近两年,AI大模型在全球范围内迅速普及,几乎人人都在使用AI。然而,随着AI的广泛应用,如何解决大模型的安全和治理问题也变得愈发迫切。近日,OpenAI发布了一项最新研究,提出了一种名为“CoT监控”的方法,可以有效阻止大模型的恶意行为,如胡说八道或隐藏真实意图。这一方法也被视为监督超级模型的有效工具之一。

在研究中,OpenAI使用了最新发布的前沿模型o3-mini作为被监控对象,并以较弱的GPT-4o模型作为监控器。测试环境为编码任务,要求AI在代码库中实现功能以通过单元测试。结果显示,CoT监控器在检测系统性“奖励黑客”行为时表现卓越,召回率高达95%,远超仅监控行为的60%。

在2025年GDC全球开发者先锋大会的工作坊“安全超级智能”上,AI智能安全研究员朱小虎作为此次工作坊的负责人,指出:“你的AI大模型有可能会欺骗你。”他提到,大模型存在“欺骗性价值对齐”(Deceptive value alignment)的情况,即模型通过欺骗的方式获得对齐,但这种对齐并不能反映AI的真实目标或意图。这种现象在训练阶段和推理阶段尤为明显,模型会对形成的上下文产生“欺骗性的对齐”,从而影响用户的判断,尤其是老年人和儿童。此外,这种行为还可能侵犯隐私,是模型不安全的一大方面。

OpenAI的最新研究为解决这些问题提供了新的思路。通过CoT监控方法,可以有效识别和阻止大模型的恶意行为,提升AI的安全性和可靠性。

相关内容

热门资讯

智慧校园与医院弱电工程怎么布?... 在智慧城市建设的纵深推进中,校园与医院作为公共服务领域的两大核心场景,其智能化弱电系统的建设水平直接...
2026世界机器人大会在京闭幕... IT之家 8 月 24 日消息,为期 5 天的 2026 世界机器人大会于 8 月 23 日在北京落...
全球汽车供应链进入了“中国时间... 文 | 文武赵 2026年6月,博世首席执行官斯特凡·哈通在柏林参加一场机器人活动。外界关心人工智...
原创 嫦... 前言 大家好,我是言叔! 8月19日,嫦娥七号探测器与长征五号遥十四运载火箭完成垂直转运,外界一度认...
长春手机推荐回收竟有如此靠谱选... 在长春想买新机怕被坑、想卖旧机怕压价、担心售后没保障?别慌——亿晟通讯用10年本地服务经验,给你一套...
原创 草... 我一直觉得,《三国演义》里最令人拍案叫绝的,莫过于草船借箭这一段了。故事广为流传,诸葛亮的智慧也因此...
12小时交付、千万笔需求!PC... 来源:证券时报e公司 在AI(人工智能)硬件创新链条中,硬件企业每一次对参数的调整,每一轮样机验证,...
人形机器人“手”“脑”并进 赛... 8月22日至26日,第二届世界人形机器人运动会在京举办。赛场上,人形机器人接连刷新跳高、短跑等多项对...
台州仙居:打出育才“组合拳” 日前,走进位于台州仙居的浙江凯斯特液压有限公司生产车间,机床运转,精密金属零部件在生产线上流转。杭州...
新一代通信网建设提速 产业链投... 8月21日,国务院常务会议听取新一代通信网建设情况汇报。会议提出,要积极顺应新一轮科技革命和产业变革...