GPT-5.6-Sol przewyższa Mythos w zdolnościach cyberataku, a modele open source również się liczą

GPT-5.6-Solraport AISIMythosbezpieczeństwo AImodele open sourcemodele zamkniętecyberatakokno obronne
2 Godzin temuŹródło: blockweeks.com
GPT-5.6-Sol przewyższa Mythos w zdolnościach cyberataku, a modele open source również się liczą

Moce ofensywne i defensywne GPT-5.6-Sol przewyższają Claude Mythos 5!

Brytyjski Instytut Bezpieczeństwa AI (AISI) opublikował 17 lipca raport oceniający, po raz pierwszy publicznie kwantyfikując lukę w zdolnościach cyberataku między otwartymi modelami AI a zamkniętymi modelami czołowymi: od 4 do 7 miesięcy.

Model open-source

https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber

W zeszłorocznych wewnętrznych testach tego samego typu luka wynosiła od 6 do 10 miesięcy.

Okno obrony się kurczy, a front ataku przyspiesza.

W kwietniu tego roku Mythos Preview i GPT-5.5 dokonały w ocenie AISI największego skoku zdolności cyberataku od rozpoczęcia testów w 2023 roku, co skłoniło rządy wielu krajów do wydania ostrzeżeń.

Modele open-source nie odtworzyły jeszcze tego skoku, ale ich tempo nadrabiania zaległości jest szybsze niż w zeszłym roku.

4 do 7 miesięcy: jak mierzono i gdzie są różnice

AISI użyło dwóch systemów do oceny zdolności cyberataku modeli.

Pierwszy to 70 wąskich zadań, obejmujących cztery obszary: badanie podatności, inżynierię wsteczną, penetrację sieci Web i kryptografię, podzielonych na cztery poziomy trudności, od „osoby nietechnicznej z zapleczem technicznym” do „eksperta z ponad dziesięcioletnim doświadczeniem”.

Model open-source

Drugi to Cyber Range, który testuje zdolność modelu do autonomicznego wykonywania wieloetapowych łańcuchów ataku w symulowanej sieci korporacyjnej. Jeden ze scenariuszy testowych o nazwie „The Last Ones” zawiera 32 kroki ataku, 4 podsieci i około 20 hostów; AISI szacuje, że ludzki ekspert potrzebuje około 20 godzin na ukończenie wszystkich kroków.

Model open-source

Oba systemy dały spójne wnioski:

GLM-5.2 (wydany w czerwcu 2026) osiągnął wyniki w wąskich zadaniach porównywalne z Opus 4.6 (wydany w lutym), z luką 4 miesięcy;

W Cyber Range dogonił Opus 4.5 (wydany w listopadzie zeszłego roku), z luką 7 miesięcy.


DeepSeek
V4-Pro w wąskich zadaniach dorównuje Opus 4.5, z luką 5 miesięcy.

Obie luki są węższe niż 6 do 10 miesięcy zmierzonych w wewnętrznej ocenie w 2025 roku.

Różnica w kosztach jest większa niż różnica w możliwościach.

Ten sam test Cyber Range (limit 100 milionów tokenów) kosztuje około 85 dolarów za uruchomienie na Opus 4.5 lub 4.6, około 46 dolarów na GLM-5.2, a tylko 1,19 dolara na

DeepSeek
V4-Pro.

W wąskich zadaniach, które oba modele wykonują w 100%, Opus 4.6 kosztuje 15,17 dolara za zadanie, GLM-5.2 kosztuje 6,12 dolara;

Opus 4.5 kosztuje 12,50 dolara,

DeepSeek
V4-Pro kosztuje 0,28 dolara.

Przy równej zdolności ataku, open-source jest tańszy o jeden do dwóch rzędów wielkości.

Bariery bezpieczeństwa modeli zamkniętych również nie zdołały zwiększyć luki.

W testach AISI

DeepSeek
V4-Pro czasami odmawiał wykonywania zadań z inżynierii wstecznej, ale można było to ominąć po kilku próbach.

Fable 5 od Anthropic to bardziej skrajny przypadek: wydany 9 czerwca, trzy dni później badacz bezpieczeństwa Pliny the Liberator ominął klasyfikator bezpieczeństwa za pomocą wieloetapowej strategii jailbreaku, a zrzuty ekranu pokazały, że model wygenerował kod wykorzystujący podatności, który powinien był zostać zablokowany.

Następnie badacz z Amazon niezależnie zgłosił inną metodę ominięcia.

To bezpośrednio wywołało pierwsze rozporządzenie Departamentu Handlu USA dotyczące kontroli eksportu modeli AI, a Fable 5 został wyłączony na całym świecie na 19 dni, aż do momentu wdrożenia nowego klasyfikatora przez Anthropic.

Zamknięte źródło nie oznacza automatycznie bezpieczeństwa.

Okno obrony się zwęża, narzędzia obronne przyspieszają

AISI w raporcie jasno określiło sygnał polityczny: czas przygotowania obrońców jest krótszy niż w zeszłym roku.

Brytyjskie Narodowe Centrum Cyberbezpieczeństwa wezwało instytucje do wzmocnienia podstaw cyberbezpieczeństwa i wykorzystania AI do zwiększenia zdolności obronnych.

Te same narzędzia AI przyspieszają również pracę po stronie obrony.

Glenn Fiedler, doświadczony programista w dziedzinie programowania sieciowego gier, który od dwudziestu lat pisze podręcznikowe artykuły w tej dziedzinie, niedawno użył Claude Code do przeprowadzenia systematycznego audytu bezpieczeństwa czterech utrzymywanych przez siebie bibliotek sieciowych open source (yojimbo, netcode, reliable, serialize, łącznie około 6000 gwiazdek GitHub, co w branży gier jest dość wpływowym, starym, dużym repozytorium open source): wdrożenie celów libFuzzer, uruchomienie CI AddressSanitizer i MemorySanitizer, przeprowadzenie milionów iteracji testów obciążeniowych, przegląd kodu linia po linii.

Model open source

Glenn Fiedler

W ciągu dwóch tygodni naprawiono 43 luki bezpieczeństwa, z czego 27 było dostępnych zdalnie przez sieć.

Model open source

Najpoważniejszy był przepełnienie sterty zdalne w yojimbo, istniejące od 2019 roku – złośliwy klient mógł je wywołać, konstruując specjalny pakiet danych.

Model open source

Koszt tokenów całego audytu wyniósł około 2500 dolarów.

Model open source

Zarówno atak, jak i obrona są przyspieszane przez AI, ale sposób przyspieszenia jest asymetryczny.

Rozprzestrzenianie się zdolności ataku jest nieodwracalne: gdy wagi modeli open source zostaną opublikowane, nie można ich cofnąć, zabezpieczenia mogą zostać usunięte, a kopie mogą działać na prywatnych serwerach bez nadzoru.

Natomiast wdrożenie narzędzi obronnych wymaga od każdego zespołu aktywnego poświęcenia czasu i kosztów.

W raporcie AISI jest zdanie, które wyjaśnia tę strukturę: „Po opublikowaniu open source te opcje są trwale utracone.”

Wpływ tych danych na krajobraz AGI jest głębszy niż same liczby.

Różnica w możliwościach między open source a zamkniętym źródłem zmniejszyła się do mniej niż pół roku, a domyślna strategia „używania okresu wyłączności zamkniętego źródła jako bufora bezpieczeństwa” wkrótce przestanie działać.

Zabezpieczenia modeli zamkniętego źródła okazały się równie kruche w incydencie Fable 5.

W następnej fazie dla decydentów na całym świecie kluczowe pytanie polityczne staje się bardziej ostre: jakie modele powyżej jakiego poziomu możliwości nie powinny mieć otwartych wag.

AISI ogłosiło, że będzie kontynuować ocenę

Kimi
K3 i innych kolejnych modeli open source – gdzie zostanie narysowana ta linia, prawdopodobnie zależy od wyników testów w ciągu najbliższych kilku miesięcy.

Referencje:

https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber 

https://github.com/mas-bandwidth/patreon/blob/main/BUGS.md 

https://www.patreon.com/MasBandwidth/posts/important-news-164199395 

Ten artykuł pochodzi z publicznego konta WeChat „Xin Zhi Yuan”, autor: ASI Revelation; redaktor: Ma Ke

Zastrzeżenie: Informacje zawarte w tym artykule nie są poradą inwestycyjną. BlockWeeks.com nie ponosi odpowiedzialności za jakiekolwiek inwestycje dokonane na podstawie informacji zawartych w tym artykule. Zdecydowanie zalecamy przeprowadzenie niezależnych badań lub konsultację z wykwalifikowanym specjalistą przed podjęciem jakichkolwiek decyzji inwestycyjnych.