OpenAI发布新研究:用CoT监控大模型 防止恶意行为
创始人
2025-03-11 09:20:51
0

【CNMO科技消息】近两年,AI大模型在全球范围内迅速普及,几乎人人都在使用AI。然而,随着AI的广泛应用,如何解决大模型的安全和治理问题也变得愈发迫切。近日,OpenAI发布了一项最新研究,提出了一种名为“CoT监控”的方法,可以有效阻止大模型的恶意行为,如胡说八道或隐藏真实意图。这一方法也被视为监督超级模型的有效工具之一。

在研究中,OpenAI使用了最新发布的前沿模型o3-mini作为被监控对象,并以较弱的GPT-4o模型作为监控器。测试环境为编码任务,要求AI在代码库中实现功能以通过单元测试。结果显示,CoT监控器在检测系统性“奖励黑客”行为时表现卓越,召回率高达95%,远超仅监控行为的60%。

在2025年GDC全球开发者先锋大会的工作坊“安全超级智能”上,AI智能安全研究员朱小虎作为此次工作坊的负责人,指出:“你的AI大模型有可能会欺骗你。”他提到,大模型存在“欺骗性价值对齐”(Deceptive value alignment)的情况,即模型通过欺骗的方式获得对齐,但这种对齐并不能反映AI的真实目标或意图。这种现象在训练阶段和推理阶段尤为明显,模型会对形成的上下文产生“欺骗性的对齐”,从而影响用户的判断,尤其是老年人和儿童。此外,这种行为还可能侵犯隐私,是模型不安全的一大方面。

OpenAI的最新研究为解决这些问题提供了新的思路。通过CoT监控方法,可以有效识别和阻止大模型的恶意行为,提升AI的安全性和可靠性。

相关内容

热门资讯

中建海龙取得可调节的包管支架专... 国家知识产权局信息显示,中建海龙科技有限公司、广东海龙建筑科技有限公司取得一项名为“一种可调节的包管...
事关半导体、人工智能、商业航天... 新京报贝壳财经讯(记者潘亦纯)9月8日,赛迪顾问围绕太空算力、第四代半导体、人工智能、商业航天、脑机...
京津冀机器人整零对接活动天津举... 中新网天津9月8日电 (记者 周亚强)京津冀“一月一链、一季一群”机器人整零对接活动8日在天津河西空...
给国产农机装上“中国芯” (来源:当代农机) 田间展示的精密播种机在众人的注目下快速驶过,扒开表层土壤,一粒粒玉米种子像依尺子...
昆明国际科技合作“朋友圈”越来... 8月28日,2026年度金砖国家技术转移中心协作会议在昆明启幕,国内技术转移机构、科研院所、企业代表...
全国卫星导航定位基准站网服务数... 来源:自然资源部 本报讯 (记者 吕苑鹃)9月4日,由自然资源部、国家数据局联合主办的全国卫星导航定...
赛睿推出高端Aeon Pro无... IT之家 9 月 8 日消息,对于许多游戏玩家来说,SteelSeries(赛睿)早已是一个耳熟能详...
原创 济... 他叫张洪,是济南市安生学校初中部一名普通的初二学生。2026年的这个夏天,这个少年在模拟“火星”赛场...
变压器卡住AI算力的“最后一公... 来源:@经济观察报微博 记者 王雅洁 截至8月底,江苏南通一个智算项目里,一整批AI(人工智能)服务...
合肥小程序定制开发到底怎么收费... 在合肥,企业想开发一个小程序,问一圈价格,答案能从三千到十万。为什么差别这么大?因为“做小程序”这件...