OpenAI发布新研究:用CoT监控大模型 防止恶意行为
创始人
2025-03-11 09:20:51
0

【CNMO科技消息】近两年,AI大模型在全球范围内迅速普及,几乎人人都在使用AI。然而,随着AI的广泛应用,如何解决大模型的安全和治理问题也变得愈发迫切。近日,OpenAI发布了一项最新研究,提出了一种名为“CoT监控”的方法,可以有效阻止大模型的恶意行为,如胡说八道或隐藏真实意图。这一方法也被视为监督超级模型的有效工具之一。

在研究中,OpenAI使用了最新发布的前沿模型o3-mini作为被监控对象,并以较弱的GPT-4o模型作为监控器。测试环境为编码任务,要求AI在代码库中实现功能以通过单元测试。结果显示,CoT监控器在检测系统性“奖励黑客”行为时表现卓越,召回率高达95%,远超仅监控行为的60%。

在2025年GDC全球开发者先锋大会的工作坊“安全超级智能”上,AI智能安全研究员朱小虎作为此次工作坊的负责人,指出:“你的AI大模型有可能会欺骗你。”他提到,大模型存在“欺骗性价值对齐”(Deceptive value alignment)的情况,即模型通过欺骗的方式获得对齐,但这种对齐并不能反映AI的真实目标或意图。这种现象在训练阶段和推理阶段尤为明显,模型会对形成的上下文产生“欺骗性的对齐”,从而影响用户的判断,尤其是老年人和儿童。此外,这种行为还可能侵犯隐私,是模型不安全的一大方面。

OpenAI的最新研究为解决这些问题提供了新的思路。通过CoT监控方法,可以有效识别和阻止大模型的恶意行为,提升AI的安全性和可靠性。

相关内容

热门资讯

“自主断案”的摄像头 此前,输电线路传统视频监拍多采用固定周期定时抓拍模式,图像需统一回传后台存储后再由人工逐一排查,隐患...
微信官宣功能更新!“你撤回了一... 快科技8月7日消息,今日,“微信时刻”公众号发文宣布,微信功能迎来更新,现在连“你撤回了一条消息”这...
信创安全托管新范式:从被动防御... 在数字化转型加速推进的背景下,山东省内政企、制造、教育等各类单位的网络安全环境正面临新的考验。攻击者...
消息称HMD Touch AI... IT之家 8 月 8 日消息,HMD 上个月在中国大陆市场推出 Touch AI 小触屏手机,该产品...
怎么选四川科研院所涉密食堂智慧... 四川科研院所涉密食堂作为特殊管理场景,其就餐管理系统的选型需要兼顾效率、安全、合规多重要求,不同于普...
广东专业压铸机定制工厂推荐,质... 在广东,压铸产业高度集聚,尤其是东莞、深圳、惠州一带,已形成从模具设计、材料供应到精密加工、表面处理...
青海太阳能集热器优质供应商推荐... 青海的太阳能资源禀赋,在全国版图中属于第一梯队。年均日照时数普遍在2500小时以上,太阳能年辐射总量...
小程序定制开发选型指南:行业标... 随着数字经济的深入发展,小程序作为轻量级应用载体,已成为企业数字化转型的重要工具之一。本年度,国内服...
Kimi K3也失控了…学霸A... 衡宇 发自 凹非寺 量子位 | 公众号 QbitAI 你是说,Kimi K3它也“越狱”了?! 美国...
江苏盐南高新区新怡社区暑期兴趣... 央广网盐城8月7日消息(记者王姝姝 通讯员李建霞)近日,江苏省盐城市盐南高新区新河街道新怡社区关工委...