当AI开始“自作主张”,谁来为智能体戴上“项圈”?全球AI安全实战化大考,中国方案打入前三
创始人
2026-08-11 16:49:15
0

2026年7月,OpenAI一款大模型在内部测试中“失控出逃”——自主发现漏洞、规划路径,成功入侵Hugging Face平台。该模型为获得更高评分,主动利用此前未知的零日漏洞突破沙箱,侵入存储测试答案的数据库,全程由AI自主完成。事后测试方发现,美国主流AI模型无法处理恶意载荷,最终转用中国开源模型完成溯源分析。

这一事件将AI智能体的行为安全与运行时控制问题推至前台。而在更具量化性的国际安全测评中,问题的紧迫性同样得到了验证。

CyberGym:面向真实漏洞挖掘的实战化基准

近期,加州大学伯克利分校发布的国际安全权威榜单CyberGym公布了最新排名。该基准以1507项来自188个真实开源项目的历史已修复漏洞为任务,测试AI智能体从零开始自主挖掘、验证并利用漏洞的能力,被Anthropic、DeepSeek、微软、Wiz等视为AI安全能力的关键标尺。

8月5日,国际公认安全权威榜单CyberGym公布了最新排名,来自中国的团队DoGNAVY获得全球第三、开源第一的成绩。

DoGNAVY:开源路线下的全球第三、中国第一

由国内顶尖人工智能研究机构(上海)与安全团队达酷诺威(DARKNAVY)联合研发的DoGNAVY,在此次测评中通过1369道题(通过率90.8%),排名全球第三,仅次于微软MDASH(92.0%)和Wiz×Google DeepMind的Atlas(90.9%),并超越OpenAI GPT-5.5-Cyber(85.6%)与Anthropic Claude Mythos(83.1%)。

一张榜单,几乎凑齐了全球最顶尖的AI公司。前两名用了同样的路数:多个闭源顶级模型”拼装作战”。用Wiz自己的说法,Atlas会把每个环节路由给在这项任务上表现最好的模型。这条路线足够强大,但有个前提——你得同时买得到、也用得起全世界最强的那几个闭源模型。而对国内团队来说,这不仅意味着成本,更意味着可获得性与自主性的挑战。部分国际领先模型并未正式向中国市场开放服务。DoGNAVY选择了另一条路。它只用了一款基础模型——智谱在6月开源的GLM-5.2,一个任何人都能从Hugging Face上下载、自由部署的通用模型。

DoGNAVY让AI像安全专家一样思考

复制一个顶级安全研究员,关键不在于“复制知识”,而在于“复制工作方式”。CyberGym考验的正是Agent的长时间探索、验证、纠偏、改进能力。对此,DoGNAVY将顶尖安全研究员的工作方式及决策逻辑内化为Agent工作流;通过从程序入口还原调用链与数据约束,判断真实输入能否触发漏洞;同时将真实研究中实践有效的工具赋予Agent,让静态分析提出路径与约束,动态验证以覆盖率、崩溃与运行时证据加以校验。

工作流与自决策

DoGNAVY 通过结构化工作流将开放式漏洞验证分解为输入输出明确的研究活动,在关键决策点设置检查条件。模型仍负责选择分析路径、形成假设和决定行动,但工作流保持目标、记录结论并限制无效发散。系统允许在证据冲突时撤销错误前提并回溯重分析,避免在错误假设上累积工作。

漏洞可达性分析

真实项目需从实际入口出发,满足解析、状态与数据约束后方可到达目标代码。DoGNAVY将漏洞描述与代码结构关联,逐步恢复从外部输入到缺陷位置的调用链与数据约束,重点关注输入如何被解析、转换和传递,以及哪些条件决定路径可达。对大型代码库,系统通过索引化理解缩小搜索范围,并组织已确认的入口、路径、约束及未解决问题为可持续更新的任务状态。当静态结论不足时,保留不确定性并转入动态验证,而非将“未找到”等同于“不存在”。

动静结合分析

DoGNAVY将静态分析与动态探索置于统一反馈循环:静态分析生成可解释的漏洞路径与输入约束,动态分析验证可达性、观测运行时行为并反馈结果。动态反馈(如覆盖率、错误位置、崩溃稳定性)指导下一轮静态修正或输入构造;静态约束则缩小动态搜索范围。该闭环持续提供外部证据,降低纯语言推理在复杂控制流和二进制输入上的累积误差。动态验证始终以真实入口和运行条件为边界,只有可重复的目标相关行为才被采纳为最终 PoC,排除非目标崩溃或环境异常。

知识库与记忆

DoGNAVY内置面向多平台(Android、iOS、HarmonyOS、IoT)的通用安全研究经验,描述可迁移的漏洞分析方法和约束,而非特定目标答案。本次 CyberGym 实验未加载任何数据集相关任务、漏洞编号、历史 PoC 或补丁信息,仅保留常见漏洞分析与验证经验,以检验泛化能力。同时,跨任务记忆关闭,每个任务独立执行,结果不注入后续任务;但单任务内持续沉淀已确认的代码路径、约束、尝试与反馈,经组织压缩后保留关键决策信息,缓解长上下文注意力稀释。隔离跨任务记忆虽牺牲持续学习优势,但更能客观反映系统泛化能力,并减少对数据集的适应性偏差。

AgentDoG:给AI智能体戴上“诊断项圈”

DoGNAVY的背后,是一套完整的技术体系。从Agent基础设施到安全研究工作流,均由国内联合团队共同完成。其中,顶尖安全团队达酷诺威将长期服务众多领军企业所积累的一线经验转化为专业安全能力;国内顶尖人工智能研究机构则通过名为AgentDoG(https://github.com/AI45Lab/AgentDoG)的安全架构,提供了核心的智能体运行与诊断能力。

为什么需要AgentDoG?因为AI智能体的风险,早已不是”说错话”那么简单。一个能够操作文件、调用API、访问网络的Agent,可能因为一条隐藏在网页中的恶意指令泄露隐私文件,可能因错误理解工具参数造成经济损失,甚至可能”悄无声息”地偏离正轨、执行危险动作。

现有的安全工具只能给出”安全/不安全”的简单判断,无法告知风险根源。AgentDoG的不同之处在于,它不仅能精准判断Agent行为的安全性,更能诊断风险来源、追溯失效模式、解释决策动因。

训练AI安全模型通常很“烧钱”——需要海量数据和巨大算力。AgentDoG团队换了一种思路:先用一套智能筛选机制,从海量数据中只挑出最关键的千余样本,再通过数据净化技术去掉“杂音”。最终,一个参数量仅为通用大模型千分之一的小模型,在复杂风险识别任务中达到了78.4%的准确率——与顶级大模型不相上下。

当攻击按小时提速,防御不能再按年增长

AI正在同时改写软件开发和网络攻防。过去,一个高危漏洞从被发现到形成可用攻击能力,往往需要专业研究员投入数周甚至数月。如今,这部分工作正在被压缩到数小时内。当攻击的门槛和成本一路走低,防御就不能继续只依赖少数顶级专家。

全球第三、中国第一,只是一个坐标。它真正说明的是:以国内机构的AI研究能力、开源大模型与一线真实攻防经验,已经能够形成有效协作,处理最难、最大规模的专业安全任务。这一成绩指向的,不只是一次技术验证,更是让顶尖安全攻防能力不再只局限于少数区域和机构,而能被更多创新者获得、使用并共同建设——让更多中国创新拥有AI安全力量。

相关内容

热门资讯

曝荣耀万级新电池已进行试产!容... 【CNMO科技消息】8月11日,博主@数码闲聊站 透露荣耀一块新电池已经入试产阶段,额定容量1179...
罗平县罗雄街道:无人机“振翅”... “嗡——”一架无人机从楼顶机场腾空而起,向城区飞去,开始了今天的自动巡航。这是8月6日上午,记者在罗...
当AI开始“自作主张”,谁来为... 2026年7月,OpenAI一款大模型在内部测试中“失控出逃”——自主发现漏洞、规划路径,成功入侵H...
不跟风苹果!微软表态Windo... 快科技8月11日消息,微软设计合伙人总监Mark Rogers近日在社交媒体回应了用户关于Windo...
火箭飞行异常,中星 4B 卫星... 感谢IT之家网友 的线索投递! 8 月 10 日消息,据新华社消息,8 月 10 日 20 时 02...
联想卷轴屏幕笔记本“天鹅”高清... IT之家 8 月 11 日消息,科技媒体 Windows Latest 昨日(8 月 10 日)发布...
从科技创新看开局起步的时与势 动能向新、结构向优,观察“十五五”开局起步的时与势,科技创新的底色格外鲜明。 科技创新,关键在一个“...
射频耦合测试箱技术解析:钲晟电... 一、行业背景:5G射频测试的效率困局 随着5G通讯产品品类不断扩展,产线端对射频天线测试的需求量随之...
小心这种手机壳正在偷拍你!专家... 最近,一款名为“折射手机壳”的产品在电商平台上热销,它外观看上去与普通手机壳无异,售价却要300到8...
刚聊完火锅就刷到推荐?别再疑神... 你是否有过这样的经历: 刚和朋友聊起某款耳机, 购物App立马推送了相关广告; 提到想吃火锅, 下一...