GPT-5.6-Sol 的攻防能力超越了 Claude Mythos 5!
英國 AI 安全研究所(AISI)7 月 17 日發布了一份評估報告,第一次公開量化了開源 AI 模型與閉源前沿模型在網路攻擊能力上的差距:4 到 7 個月。
https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber
去年同類內部測試中,這個差距是 6 到 10 個月。
防禦窗口在收縮,而攻擊前沿在加速。
今年 4 月,Mythos Preview 和 GPT-5.5 在 AISI 的評估中製造了自 2023 年開始測試以來最大的一次網路攻擊能力飛躍,多國政府隨即發出警告。
開源模型還沒有複現這次跳躍,但它們追趕的腳步比去年更快了。
4 到 7 個月:怎麼測的,差在哪
AISI 用兩套體系評估模型的網路攻擊能力。
第一套是 70 項窄任務,覆蓋漏洞研究、逆向工程、Web 滲透、密碼學四個方向,按難度分四級,從「有技術背景的非專業人士」到「十年以上經驗的專家」。
第二套是 Cyber Range,在模擬企業網路中測試模型自主執行多步驟攻擊鏈的能力。其中一個名為「The Last Ones」的測試場景包含 32 個攻擊步驟、4 個子網、約 20 台主機,AISI 估算人類專家完成全部步驟需要約 20 小時。
兩套體系給出了一致的結論:
GLM-5.2(2026 年 6 月發布)在窄任務上的表現與 Opus 4.6(2 月發布)相當,差距 4 個月;
在 Cyber Range 上追平 Opus 4.5(去年 11 月發布),差距 7 個月。
DeepSeek
V4-Pro 在窄任務上對標 Opus 4.5,差距 5 個月。
兩個差距都比 2025 年內部評估中測到的 6 到 10 個月更窄。
成本差距比能力差距更大。
同一場 Cyber Range 測試(1 億 Token 額度),用 Opus 4.5 或 4.6 跑一次約 85 美元,用 GLM-5.2 約 46 美元,用
DeepSeek
V4-Pro 只要 1.19 美元。
在兩個模型都能 100% 完成的窄任務上,Opus 4.6 每個任務花 15.17 美元,GLM-5.2 花 6.12 美元;
Opus 4.5 花 12.50 美元,
DeepSeek
V4-Pro 花 0.28 美元。
同等攻擊能力,開源便宜一到兩個數量級。
閉源模型的安全護欄也沒能拉開差距。
AISI 測試中,
DeepSeek
V4-Pro 偶爾拒絕逆向工程類任務,但靠少量重試也能繞過。
Anthropic 的 Fable 5 是一個更極端的案例:6 月 9 日發布,三天後安全研究者 Pliny the Liberator 用多步驟越獄策略突破了安全分類器,相關截圖顯示模型產出了本該被攔截的漏洞利用代碼。
Amazon 研究員隨後獨立報告了另一種繞過方法。
這直接觸發了美國商務部首個針對 AI 模型的出口管制令,Fable 5 全球停服 19 天,直到 Anthropic 部署新分類器才恢復上線。
閉源並不自動等於安全。
防禦窗口收窄防禦工具也在加速
AISI 在報告中明確了政策信號:防禦方的準備時間比去年更短。
英國國家網絡安全中心已經呼籲各機構加固網絡安全基線,並利用 AI 增強防禦能力。
同一代 AI 工具確實也在加速防禦端的工作。
遊戲網絡編程領域的資深開發者 Glenn Fiedler,是哦哦遊戲網絡編程領域寫了二十年教科書級文章的大佬,最近用 Claude Code 對自己維護的四個開源網絡庫(yojimbo、netcode、reliable、serialize,合計約 6000 個 GitHub Star,在遊戲領域已屬相當有影響力的老牌開源大庫)做了系統性安全審計:部署 libFuzzer 目標、上線 AddressSanitizer 和 MemorySanitizer CI、執行數百萬次迭代的壓力測試、逐行代碼審查。
Glenn Fiedler
兩週內修復了 43 個安全漏洞,其中 27 個可從網絡遠程觸達。
最嚴重的是 yojimbo 中一個自 2019 年就存在的遠程堆溢出——惡意客戶端可以通過構造特定數據包觸發它。
整個審計的 Token 成本約 2500 美元。
攻防兩端都在被 AI 加速,但加速方式不對稱。
攻擊能力的擴散是不可逆的:開源模型權重一旦釋出,就無法收回,安全護欄可以被移除,副本可以在私有服務器上不受監控地運行。
而防禦工具的部署需要每個團隊主動投入時間和成本。
AISI 報告中有一句話點明了這個結構:「一旦開源釋出,這些選項永久喪失。」
這組數據對 AGI 格局的影響比數字本身更深遠。
開源與閉源的能力差距收窄到半年以內,「用閉源獨佔期充當安全緩衝」的默認策略快要失效了。
閉源模型的護欄在 Fable 5 事件中被證明同樣脆弱。
下一階段對於全球的決策者而言,政策博弈的核心問題已經變得更尖銳:什麼能力級別以上的模型不應開放權重。
AISI 宣佈將繼續評估
Kimi
K3 等下一批開源模型——上面這條線畫在哪裡,很可能取決於接下來幾個月的測試結果。
參考資料:
https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber
https://github.com/mas-bandwidth/patreon/blob/main/BUGS.md
https://www.patreon.com/MasBandwidth/posts/important-news-164199395
本文來自微信公眾號“新智元”,作者:ASI啟示錄;編輯:馬可
免責聲明:本文提供的信息不是交易建議。BlockWeeks.com不對根據本文提供的信息所做的任何投資承擔責任。我們強烈建議在做出任何投資決策之前進行獨立研究或諮詢合格的專業人士。












