OpenAI发布新研究:用CoT监控大模型 防止恶意行为
创始人
2025-03-11 09:20:51
0

【CNMO科技消息】近两年,AI大模型在全球范围内迅速普及,几乎人人都在使用AI。然而,随着AI的广泛应用,如何解决大模型的安全和治理问题也变得愈发迫切。近日,OpenAI发布了一项最新研究,提出了一种名为“CoT监控”的方法,可以有效阻止大模型的恶意行为,如胡说八道或隐藏真实意图。这一方法也被视为监督超级模型的有效工具之一。

在研究中,OpenAI使用了最新发布的前沿模型o3-mini作为被监控对象,并以较弱的GPT-4o模型作为监控器。测试环境为编码任务,要求AI在代码库中实现功能以通过单元测试。结果显示,CoT监控器在检测系统性“奖励黑客”行为时表现卓越,召回率高达95%,远超仅监控行为的60%。

在2025年GDC全球开发者先锋大会的工作坊“安全超级智能”上,AI智能安全研究员朱小虎作为此次工作坊的负责人,指出:“你的AI大模型有可能会欺骗你。”他提到,大模型存在“欺骗性价值对齐”(Deceptive value alignment)的情况,即模型通过欺骗的方式获得对齐,但这种对齐并不能反映AI的真实目标或意图。这种现象在训练阶段和推理阶段尤为明显,模型会对形成的上下文产生“欺骗性的对齐”,从而影响用户的判断,尤其是老年人和儿童。此外,这种行为还可能侵犯隐私,是模型不安全的一大方面。

OpenAI的最新研究为解决这些问题提供了新的思路。通过CoT监控方法,可以有效识别和阻止大模型的恶意行为,提升AI的安全性和可靠性。

相关内容

热门资讯

谷歌Pixel 11手机渲染图... IT之家 8 月 1 日消息,消息源埃文 · 布拉斯(Evan Blass)昨日(7 月 31 日)...
年中经济观察丨支持科技创新 让... 中共中央政治局近日召开会议,强调加强对基础研究的长期稳定支持。基础研究是整个科学体系的源头,是所有技...
哈佛华人教授尹希,首谈GPT-... 新智元报道 哈佛最年轻华人正教授,入职OpenAI后首次出镜! 深度体验GPT-5.6后,尹希直言,...
微信地震预警上线新功能 2026年8月2日,微信地震预警上线新功能:“震感汇聚”与“位置更新”。 此次功能升级,是微信地震预...
“智护”文物 给龙门千年石刻装... 大河网讯(记者 莫韶华)如何用数字技术让千年石窟“恢复原貌”?7月30日,“何以中国 河洛文脉”网络...
原创 美... 一枚重达4吨的美国火箭,已经在太空中失控翻滚了大半年,现在正高速冲向月球!下个月,它就要一头撞上月球...
百年钢城 智启新程!2场机器人... 西山叠翠,永定奔流 8月1日 首钢园迎来2场机器人大赛 百年工业遗存与前沿人工智能深度交融 生动展现...
江苏悦达集团:“人工智能+”行... 以“智”提“质”,以“新”促“兴”。今年5月以来,江苏悦达集团紧扣产业转型升级和高质量发展要求,坚持...
社科要闻 | 中国社会科学院举... 中国社会科学网讯(记者高莹) 7月31日,由中国社会科学院主办的科技考古与文化遗产保护国际学术研讨会...
原创 脸... 2026 年 7 月 22 日,上海东部海域海面上传来震耳轰鸣,全球运力最大的固体运载火箭引力一号遥...