OpenAI GPT-6 Astra发布,首次达到“关键”级网络安全能力门槛
创始人
2026-09-04 08:30:30
0

(来源:IT之家)

IT之家 9 月 4 日消息,当地时间 9 月 3 日,OpenAI 宣布推出新一代 GPT-6 Astra 模型,这是该公司迄今为止最强大、最广泛部署的大语言模型。

据介绍,Astra 是 OpenAI 旗下首个达到其“准备框架”(Preparedness Framework)中“关键”(Critical)网络安全能力门槛的模型。

据 OpenAI 介绍,Astra 在网络安全能力上实现了显著跃升。在配备适当工具和访问权限的情况下,该模型能够在无人逐步指导的条件下,发现许多防护严密的系统中此前未知的安全漏洞,并开发新的利用方式。

针对这一能力提升,OpenAI 已大幅强化了防止模型采取有害网络行动的保护措施,包括更严格的隔离、检查点加密、对包含思维链(CoT)在内的完整轨迹进行通用监控,以及内部使用前的阻断式对齐评估流程。

在安全性与对齐方面,OpenAI 表示 Astra 较前代产品更为出色。Astra 对越狱攻击的鲁棒性显著优于 GPT-5.6 Sol。在涉及超过 5.4 万个内部 Codex 任务的模拟测试中,Astra 在严重程度较高的不对齐行为标记数量上,约为 Sol 的一半。

OpenAI 在部署中广泛引入了不对齐行为监控系统,该系统在所有涉及工具调用的推理过程中运行,并耗费了大量计算资源。然而,OpenAI 也承认 Astra 的可监控性相较 GPT-5.6 Sol 有所下降。研究发现,Astra 控制自身思维链的能力更强,在对抗性条件下(即被推动去规避监控时),模型能够在评估中策略性表现不佳(即“沙袋”行为)而不被发现,有时还能规避内部监控。IT之家注:思维链是指模型在给出最终答案前,逐步展示其推理过程的方式,是可解释性研究的关键一环。

不过,OpenAI 目前尚未发现 Astra 具备隐写式思维链推理的证据,表明规避风险可能主要局限于不需要思维链就能完成的任务。OpenAI 表示严肃对待这一趋势,并正持续调查相关发现及其对未来可监控性的影响,同时强调发展思维链监控之外的对齐审计技术也同样重要。

在具体应用场景中,Astra 对提示注入攻击的鲁棒性显著优于 GPT-5.6 Sol,在真实浏览和专业计算机环境中的不对齐及潜在破坏性行为(如未经授权的交易、数据丢失、过度访问或规避控制)也大幅减少。此外,Astra 在高风险场景中的响应更为安全,且在 18 岁以下用户的年龄适配安全边界应用上更为一致。

OpenAI 首席科学家 Jakub Pachocki 在 9 月 3 日上午的简报会上表示:“随着模型能力增强,准确理解它们能做什么变得更困难了。这并不保证随着智能持续提升,我们的方法仍然足够有效,因为智能的进步并不能保证对齐的进步。”

相关内容

热门资讯

科普“再走长征路” 前沿科技直... (来源:和合承德网) 人民网北京9月3日电 (记者赵竹青)2026年全国科普月于9月1日正式启动。中...
HTC为旗下AI智能眼镜VIV... IT之家 9 月 4 日消息,HTC 宣布为旗下 AI 智能眼镜 VIVE Eagle 新增全新圆框...
原创 手... 9月3日,微博热搜出现了一个颇具讽刺意味的话题:手机涨价后以为会遭疯抢,但结果询价的人都没有。一些线...
OpenAI GPT-6 As... (来源:IT之家) IT之家 9 月 4 日消息,当地时间 9 月 3 日,OpenAI 宣布推出新...
中国电气装备研制成功全球功能最... (来源:电能革新) 近日,中国电气装备所属保变电气出口加拿大首台400兆伏安/230千伏移相变压器...
闯关夺隘,脑机接口的远征刚刚开... (来源:环球网资讯) 来源:科技日报 科技日报记者 房琳琳 陈春有 龙云 龚茜 策划 冯卫东 房琳琳...
机器人打乒乓球秀嗨全场!科技创... 以“万物皆媒Media未来”为主题的2026亚太媒体高端论坛·科技创新成果展将于9月5日举办。9月3...
20余家企业抱团!具身智能的“... 来源:智能制造网 从“单打独斗”到“企业抱团”,中国具身智能正在经历一场底层逻辑的切换。 2026年...
今年中秋月,将是“十七圆” 9月,昴星团伴月、月掩金星、中秋月、海王星冲日等天象将轮番登场。其中备受大家关注的中秋月,既不是“十...
2026精选杭州GEO优化服务... 随着生成式人工智能与大型语言模型全面渗透日常信息检索,企业的流量入口正在发生结构性迁移。当用户习惯通...