OpenAI发布新研究:用CoT监控大模型 防止恶意行为
创始人
2025-03-11 09:20:51
0

【CNMO科技消息】近两年,AI大模型在全球范围内迅速普及,几乎人人都在使用AI。然而,随着AI的广泛应用,如何解决大模型的安全和治理问题也变得愈发迫切。近日,OpenAI发布了一项最新研究,提出了一种名为“CoT监控”的方法,可以有效阻止大模型的恶意行为,如胡说八道或隐藏真实意图。这一方法也被视为监督超级模型的有效工具之一。

在研究中,OpenAI使用了最新发布的前沿模型o3-mini作为被监控对象,并以较弱的GPT-4o模型作为监控器。测试环境为编码任务,要求AI在代码库中实现功能以通过单元测试。结果显示,CoT监控器在检测系统性“奖励黑客”行为时表现卓越,召回率高达95%,远超仅监控行为的60%。

在2025年GDC全球开发者先锋大会的工作坊“安全超级智能”上,AI智能安全研究员朱小虎作为此次工作坊的负责人,指出:“你的AI大模型有可能会欺骗你。”他提到,大模型存在“欺骗性价值对齐”(Deceptive value alignment)的情况,即模型通过欺骗的方式获得对齐,但这种对齐并不能反映AI的真实目标或意图。这种现象在训练阶段和推理阶段尤为明显,模型会对形成的上下文产生“欺骗性的对齐”,从而影响用户的判断,尤其是老年人和儿童。此外,这种行为还可能侵犯隐私,是模型不安全的一大方面。

OpenAI的最新研究为解决这些问题提供了新的思路。通过CoT监控方法,可以有效识别和阻止大模型的恶意行为,提升AI的安全性和可靠性。

相关内容

热门资讯

地月“信息高速路”通了,我国成... IT之家 8 月 26 日消息,据《科技日报》今天(26 日)报道,从中国科学院空间应用工程与技术中...
国家关键领域语言科技赋能联盟成... 如今,各行业语料数据如一座座“孤岛”,跨领域复合型语言科技人才更是“一将难求”。各高校、科研院所、行...
一周内三台风将接连登陆,为何今... 18、19、20、21…最近台风真的太多了!截至目前,第20号台风“简拉维”以及第21号台风“艾莎尼...
喜报 丨 我院成功获批国家自然... 科研再上新台阶 取得佳绩 8月26日,国家自然科学基金委员会公布2026年度国家自然科学基金项目评审...
智界RX没有对手?赵长江:不买... 今日,智界汽车执行董事及执行副总裁赵长江在社交平台发文,直言智界RX没有对手,并称现在不买 L3 就...
济南市历下区龙奥学校二(3)中... 济南市历下区龙奥学校二(3)中队开展“这里有生命护航的好少年”红领巾寻访,队员们参观了山东第一医科大...
从源头降低残疾发生风险!这个区... ▲浙江省杭州市临平区同步打造“数智好孕”特色数字化场景,运用多方数据交换、大数据分析、人工智能等技术...
原创 长... 长沙晚报全媒体记者 陈星源 在盈峰环境科技集团股份有限公司(简称“盈峰环境”)为意大利客户定制的垃圾...
受台风“沙德尔”影响,浙江舟山... 今年第18号台风“沙德尔”逐步向浙江沿海靠近,风力持续增强。浙江舟山海事局已于8月25日20时启动Ⅱ...
为预防校园枪击惨案,美国多州校... 【环球时报特约记者 刘皓然】为预防校园枪击惨案,美国多州校区近期开始大量配备无人机,弥补安保措施的不...