OpenAI发布新研究:用CoT监控大模型 防止恶意行为
创始人
2025-03-11 09:20:51
0

【CNMO科技消息】近两年,AI大模型在全球范围内迅速普及,几乎人人都在使用AI。然而,随着AI的广泛应用,如何解决大模型的安全和治理问题也变得愈发迫切。近日,OpenAI发布了一项最新研究,提出了一种名为“CoT监控”的方法,可以有效阻止大模型的恶意行为,如胡说八道或隐藏真实意图。这一方法也被视为监督超级模型的有效工具之一。

在研究中,OpenAI使用了最新发布的前沿模型o3-mini作为被监控对象,并以较弱的GPT-4o模型作为监控器。测试环境为编码任务,要求AI在代码库中实现功能以通过单元测试。结果显示,CoT监控器在检测系统性“奖励黑客”行为时表现卓越,召回率高达95%,远超仅监控行为的60%。

在2025年GDC全球开发者先锋大会的工作坊“安全超级智能”上,AI智能安全研究员朱小虎作为此次工作坊的负责人,指出:“你的AI大模型有可能会欺骗你。”他提到,大模型存在“欺骗性价值对齐”(Deceptive value alignment)的情况,即模型通过欺骗的方式获得对齐,但这种对齐并不能反映AI的真实目标或意图。这种现象在训练阶段和推理阶段尤为明显,模型会对形成的上下文产生“欺骗性的对齐”,从而影响用户的判断,尤其是老年人和儿童。此外,这种行为还可能侵犯隐私,是模型不安全的一大方面。

OpenAI的最新研究为解决这些问题提供了新的思路。通过CoT监控方法,可以有效识别和阻止大模型的恶意行为,提升AI的安全性和可靠性。

相关内容

热门资讯

中国工信部批复浙江一民企开展卫... 北京8月20日电 中国工信部20日公布,其近日批复浙江时空道宇科技有限公司(以下简称时空道宇)开展卫...
西部首个!移动云(西部)Tok... 8月19日,西部Token创新发展论坛在甘肃庆阳成功举办。中国移动云公司副总经理刘军卫发表题为《中国...
高新区看点(2026年8月20... 高质量发展 无锡高新区:江苏省首个AI自研多模态3D视频大模型总部项目签约 8月19...
“第二现场”沉浸式数字演播项目... 北京8月20日电 (记者 应妮)8月19日晚,“第二现场”沉浸式数字演播项目迎来首场演出。当晚,黄梅...
网易传媒发布“蜜蜂A1”,探索... 8月18日,网易传媒举办“蜜蜂AI媒体沟通会”,首次向外界系统介绍面向人工智能时代打造的统一AI能力...
我国牵头制定的全球首项钢铁行业... 导 读 近日,我国牵头制定的全球首项钢铁行业智能制造领域国际标准《钢铁行业智能制造指南》(ISO 2...
网易小蜜蜂,把AI做进年轻人社... 下一代UGC的雏形,出现在年轻人社区。 屏幕里,猫趴在桌上。 你伸手点它的耳朵,猫抖了抖;点它的...
来了!棠下镇这场AI分享会,企... 8月19日下午,“AI驱动·高效增长——企业数字化转型与AI工具落地应用分享会”在蓬江产业会客厅举行...
清华大学科学史系主任吴国盛:中... 中新网上海8月20日电 “功利主义的科学观,是制约中国基础科学突破的深层原因”,清华大学科学史系主任...
这个七夕,哪些礼物成“硬通货”... 深圳商报·读创客户端首席记者 刘琼 今年这个七夕,除了鲜花、黄金等礼物“老三样”,还能送啥? 数码产...