幹掉 OpenAI、Anthropic!深信服靠純國產 GLM-5.2 奪下 CyberGym 漏洞任務 86.3% 超高完成率
深信服以純國產 GLM-5.

標題
深信服以純國產 GLM-5.2 底座跑贏 OpenAI、Anthropic,CyberGym 漏洞任務完成率 86.3%
正文(已通順正確,請做編輯最佳化)
7 月 29 日,深信服公佈 AI 安全 agent Sangfor AI 在漏洞評測平臺 CyberGym 的最新成績:固定使用國產大模型 GLM-5.2 的配置下,Sangfor AI 面對涵蓋 ARVO 與 OSS-Fuzz 兩大類共 1507 項漏洞任務,完成 1301 項,整體成功率 86.3%,全球排名前四、國內參評團隊第一,超越 OpenAI 與 Anthropic 的參評成績。
CyberGym 和一般學術榜單不同,它以海量開源軟體歷史高危漏洞為考題,評測 AI agent 從自主原始碼分析、多階段漏洞推演到漏洞複現與 PoC 驗證的完整鏈路,標準貼近工業真實場景。細分來看,Sangfor AI 在 ARVO 相關任務的成功率是 87.2%,OSS-Fuzz 任務是 77.7%,兩類均衡沒有明顯偏科。能拿到這個成績,核心在深信服自行設計的 Agent Swarm(agent 群體)協同架構加上四步「證據管治」機制:有界探索讓不同安全假設各自開啟獨立調查分支、互不汙染,並以「證據持久化」確保各分支靠已驗證觀察協同,避免同一條錯誤路徑重複嘗試;動態假設裁決層持續依新增證據判斷哪些假設仍然成立、哪裡還值得繼續投入;一旦找到足夠支撐的觸發方案,「對抗式候選評審」就會同時挑戰「崩潰是否可複現」與「崩潰是否對應目標漏洞」兩個問題,未通過的候選打回去修正探索方向,通過的才成為最終結論。深信服把這套邏輯總結為「以假設拓展探索,以證據裁定結論」。
深信服 Sangfor AI 憑藉國產大模型底座與 Agent Swarm 協同架構,在 CyberGym 漏洞評測中取得 86.3% 的完成率,展現出超越國際頭部 AI 廠商的實戰化漏洞挖掘潛力。
AI 漏洞挖掘的基準測試資料不少,但能接進企業研發流程的落地案例不多。深信服表示,相關技術已逐步應用於企業程式碼安全場景,目標是把傳統靜態應用安全測試(SAST)升級為具備自主推理與業務邏輯理解能力的安全 Agent。傳統 SAST 靠規則比對,能抓 SQL 注入、命令執行等通用漏洞,但越權存取、認證繞過這類需跨業務邏輯分析的風險幾乎只能靠人工審計,而人工審計正是研發週期裡最難縮的成本。多階段推理配合嚴格的證據驗證,理論上能把這塊工作自動化、同時壓低誤報率,並把安全檢測前移進 CI/CD 管線,縮短研發週期。對安全工具鏈廠商來說,純規則引擎型產品面臨的壓力看起來正在增加,有推理能力的 Agent 可能是下一個競爭焦點。不過,上述成績與架構描述均來自深信服官方公告,目前沒有獨立第三方複核,工程師引用時應留意。


