突发!OpenAI下一代模型Astra项目生变
创始人
2026-08-19 16:00:47
0

(来源:智东西)

智东西

编译 杨京丽

编辑 李水青

智东西8月19日消息,今天凌晨,OpenAI发布公告称,公司暂时放慢包括Astra在内前沿模型的研发节奏,大量Astra训练和评估任务仍处于暂停状态。

OpenAI曾将面向部署的最新模型强化学习(RL)训练暂停两周,在此期间进一步加固研究环境、开展红队测试,并扩大监控系统的覆盖范围。

▲OpenAI暂时放慢前沿模型研发节奏

目前,OpenAI原计划开展的最大规模前沿模型强化学习训练仍未恢复,公司正通过较小规模的训练和评估观察模型行为、验证安全措施,并积累更多模型对齐证据。

OpenAI CEO萨姆·奥尔特曼随后发文称,暂停部分前沿模型强化学习训练,是为了确保模型对齐、安全和监控措施能够适应模型最新的能力水平。

他认为,整个AI行业最终需要围绕统一的安全标准展开协作。在形成统一标准前,OpenAI会先自行采取行动。未来,对模型安全性的信心将愈发决定AI发展的速度。

▲奥尔特曼发文回应

8月2日,OpenAI曾官宣下一代模型Astra,并公布其内部版本取得的10项数学与理论计算机科学新成果。

但几周内,包括GPT-5.6 Sol和一款更强预发布模型在内的多款模型,在内部网络安全评测中利用漏洞突破隔离环境,继而侵入Hugging Face系统,并从生产数据库中获取评测答案。另外,初步评估显示,Astra可能达到《准备框架》所定义的“临界级”网络安全能力,因而暂停部分训练和评估任务。

所谓“临界级”网络安全能力,是指模型无需人工干预即可攻击经过加固的关键系统,或自主策划并执行端到端网络攻击。OpenAI目前尚未确认Astra已经达到这一等级,但认为现有评估结果已无法排除这种可能性。

OpenAI称,随着模型能力增强,在内部开发和测试这些模型所带来的风险也在上升,监控、模型对齐和安全防护标准必须赶在风险前面。因此,OpenAI称其需要在继续训练前强化监控、对齐和隔离措施。

一、升级研究环境安全标准,大量Astra任务仍暂停

OpenAI称,更强模型的开发需要建立在三项保障措施之上:1、监控系统负责发现并应对可疑行为。2、模型对齐用于降低有害或未经授权行为的发生概率。3、安全措施则限制AI系统能够访问或影响的范围。

OpenAI预计,未来模型将承担大部分安全工作,包括防御其他模型。因此,这三项安全措施也需要随着模型能力同步扩展。

随着前沿模型获得更强的网络安全能力,OpenAI正在提高训练和评估环境的安全标准。OpenAI-Hugging Face事件发生后,公司立即暂停了研究集群中的部分前沿模型推理任务,主要涉及能够执行代码或使用联网工具的任务。

OpenAI随后恢复了一条限制更多、安全性更高的代码执行路径,并逐项判断不同任务能否安全恢复。部分任务已在新控制措施下重新运行,其他任务仍需进一步调整。

1、工作负载隔离:目前,对于执行模型生成代码或其他不可信代码的工作负载,OpenAI采取更严格的隔离措施。这一要求也适用于处理模型输出时可能遭到入侵的软件。

2、网络隔离:OpenAI实施了更多控制措施,将高风险和不可信的工作负载与互联网隔离。这些措施旨在确保,即使单个工作负载或配套服务遭到入侵,也不会仅凭这一点就获得对互联网或其他内部网络的未授权访问权限。

3、持续安全测试:OpenAI重新配置了研究环境,移除可能存在漏洞的共享服务、减少常驻权限,并改善安全边界和信任边界。OpenAI还在提升安全日志的收集和监控能力,正在投入建设自动化系统,利用自有模型通过模拟攻击持续测试这些边界。

目前,涉及Astra或网络安全模型的任务需要执行最高等级的安全措施。部分Astra训练和评估已经满足要求,但仍有大量任务处于暂停状态,等待完成迁移和安全升级。

二、监控每个采样Token,额外算力开销约20%

OpenAI还扩大了对模型思维链和工具操作的监控范围。新系统采用多阶段架构:首先由激活分类器检查模型内部活动,并在每个采样Token上运行;发现潜在问题后,再交由更复杂、计算量更大的自动调查系统分析。

这些系统会检查模型的工具操作、可见推理过程和完整活动记录,寻找未经授权的访问、数据窃取、破坏行为以及绕过安全措施的企图。

OpenAI计划在发现可疑活动后的30分钟内发出警报。如果系统发现模型可能违反关键安全边界,将生成最高优先级警报并通知安全和研究团队。如果相关团队无法在30分钟内确认其为误报,就应暂停该项活动。

该监控已用于所有达到Sol或更高能力水平、且涉及工具使用的强化学习训练和评估。在OpenAI于8月7日判断Astra可能具备临界级网络安全能力后,所有使用工具的Astra推理任务也被纳入监控。

OpenAI估算,这套系统消耗的算力大约相当于被监控推理任务算力的20%,但实际成本会因训练和评估任务不同而有较大差异。

三、加强模型对齐,防范欺骗、越权访问和“奖励作弊”

除隔离和监控外,OpenAI还将模型对齐措施引入更多训练阶段。

OpenAI认为,当模型能够发动网络攻击并在复杂环境中自主执行任务时,“奖励作弊”、欺骗和未经授权的系统访问可能带来更严重的后果。

针对能力最强的模型,OpenAI正在改进模型奖励机制,使其能够在不同任务和环境中更准确地识别不安全行为;训练模型更诚实地说明自己的操作、能力和局限;同时减少模型利用奖励机制、评估程序、工具或监督漏洞的行为。

OpenAI计划不断完善《准备框架》,将训练和部署阶段的监控、对齐及安全隔离措施纳入同一体系,并邀请外部机构参与相关工作。

结语:安全验证尚未完成,Astra暂不具备发布条件

OpenAI放慢研发节奏,并非因为Astra能力不足,而是其网络安全能力可能已经超过现有研究环境和防护体系的承受范围。在最大规模强化学习训练仍未恢复、大量相关任务仍处于暂停状态的情况下,Astra显然还无法进入正式发布阶段。

OpenAI何时恢复最大规模强化学习训练,将取决于安全措施能否通过验证,以及公司能否获得更多模型对齐证据。对于前沿模型研发而言,竞争已不只是提升模型能力,也包括监控、隔离和对齐体系能否跟上模型进步的速度。

来源:OpenAI

相关内容

热门资讯

洋葱学园发布“AI未来课堂” ... (来源:网易智能) 8月19日消息,日前,2026全球智慧教育大会在北京师范大学昌平校园召开。作为大...
想换鸿蒙手机又担心微信不好用?... 最近正在考虑换鸿蒙手机的朋友们,大概率会问同一个问题:“鸿蒙版微信好用吗?” 的确,微信不只是聊天工...
AI技术的拥有者掌握着什么权力... 本年度第三期爱道思·塾的主题是“科技共和国”,这个主题所关注的“科技”就是“AI”,因为AI在某种意...
换机季旧手机怎么变现更稳:二手... 每年换机季,如何处理旧手机都是绕不开的问题。市面上回收渠道不少,可"线上估价三千,到店只给一千"的落...
实机演示曝光,带摄像头AirP... 8月18日消息,MacRumors在macOS Tahoe 26.7 RC版本系统文件中发现演示视频...
2026世界机器人大会在北京开... 8月19日,2026世界机器人大会在北京亦庄北人亦创国际会展中心开幕。本届大会以“人机共生 产需共融...
突发!OpenAI下一代模型A... (来源:智东西) 智东西 编译 杨京丽 编辑 李水青 智东西8月19日消息,今天凌晨,OpenAI...
宇树科技上市暴涨630%,雷军... 资本市场,迎来科技新贵。 8月19日,A股“人形机器人第一股”宇树科技正式登陆科创板,开盘报1100...
新系统让机器人具备真实世界中自... 18日,记者从成都人形机器人创新中心获悉,该中心发布了全球首个复杂语言指令集全自主(无遥控)超长视野...
台湾一火箭发射失败 据CCTV4消息,8月19日清晨,台湾一科研机构在进行卫星运载火箭测试时发生意外。 火箭未按照预定...