OpenAI发布新研究:用CoT监控大模型 防止恶意行为
创始人
2025-03-11 09:20:51
0

【CNMO科技消息】近两年,AI大模型在全球范围内迅速普及,几乎人人都在使用AI。然而,随着AI的广泛应用,如何解决大模型的安全和治理问题也变得愈发迫切。近日,OpenAI发布了一项最新研究,提出了一种名为“CoT监控”的方法,可以有效阻止大模型的恶意行为,如胡说八道或隐藏真实意图。这一方法也被视为监督超级模型的有效工具之一。

在研究中,OpenAI使用了最新发布的前沿模型o3-mini作为被监控对象,并以较弱的GPT-4o模型作为监控器。测试环境为编码任务,要求AI在代码库中实现功能以通过单元测试。结果显示,CoT监控器在检测系统性“奖励黑客”行为时表现卓越,召回率高达95%,远超仅监控行为的60%。

在2025年GDC全球开发者先锋大会的工作坊“安全超级智能”上,AI智能安全研究员朱小虎作为此次工作坊的负责人,指出:“你的AI大模型有可能会欺骗你。”他提到,大模型存在“欺骗性价值对齐”(Deceptive value alignment)的情况,即模型通过欺骗的方式获得对齐,但这种对齐并不能反映AI的真实目标或意图。这种现象在训练阶段和推理阶段尤为明显,模型会对形成的上下文产生“欺骗性的对齐”,从而影响用户的判断,尤其是老年人和儿童。此外,这种行为还可能侵犯隐私,是模型不安全的一大方面。

OpenAI的最新研究为解决这些问题提供了新的思路。通过CoT监控方法,可以有效识别和阻止大模型的恶意行为,提升AI的安全性和可靠性。

相关内容

热门资讯

《世界文化遗产·元上都遗址》数... 8月21日,《世界文化遗产·元上都遗址》数字沉浸体验展在内蒙古博物院开展。 元上都遗址位于锡林郭勒盟...
智竞未来!中国联通全力护航第二... 8月22日,备受瞩目的第二届世界人形机器人运动会将在国家速滑馆(“冰丝带”)正式开幕。作为本届赛事全...
保山市第三届青少年科技创新大赛... 为推动我市青少年科技创新和科技教育活动的普及与发展,激发青少年科学兴趣,培养青少年创新精神和实践能力...
内存价格一年暴涨500%,20... 闻乐 发自 凹非寺 量子位 | 公众号 QbitAI 亏贼!内存价格涨疯了。 128GB的DDR5内...
聚焦柔性液晶显示新材料赛道 第... 深圳特区报讯(记者 杨丽萍)8月21日下午,第七期“人才推荐官”沙龙在前海五号楼举行。此次活动聚焦柔...
2026年中国科技馆筑梦星球夏... 中新网北京8月22日电 (记者 孙自法)作为大型综合性科学教育项目“科学方法特训营”的重要活动,为期...
Agent编译器有望破解企业A... 当前,大模型产业竞争正从基础模型比拼转向应用落地深水区。然而,企业级AI普遍面临高价值业务知识分散、...
台青在浙江绍兴研习AIGC:不... 中新网绍兴8月21日电 题:台青在浙江绍兴研习AIGC:不只“充电”,更探发展机遇 作者 项菁 “我...
原创 被... 前有华为、阿里,后有中芯、大疆,美西方针对中国科技企业的打压从未间断过。 就说无人机吧,大疆作为全球...
“京蒙同心・共铸华魂”研学让学... 8月20日,扎赉特旗600余名师生乘坐“京蒙同心·共铸华魂”研学专列踏上归途,车窗内欢声笑语,行囊里...