Moce ofensywne i defensywne GPT-5.6-Sol przewyższają Claude Mythos 5!
Brytyjski Instytut Bezpieczeństwa AI (AISI) opublikował 17 lipca raport oceniający, po raz pierwszy publicznie kwantyfikując lukę w zdolnościach cyberataku między otwartymi modelami AI a zamkniętymi modelami czołowymi: od 4 do 7 miesięcy.
https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber
W zeszłorocznych wewnętrznych testach tego samego typu luka wynosiła od 6 do 10 miesięcy.
Okno obrony się kurczy, a front ataku przyspiesza.
W kwietniu tego roku Mythos Preview i GPT-5.5 dokonały w ocenie AISI największego skoku zdolności cyberataku od rozpoczęcia testów w 2023 roku, co skłoniło rządy wielu krajów do wydania ostrzeżeń.
Modele open-source nie odtworzyły jeszcze tego skoku, ale ich tempo nadrabiania zaległości jest szybsze niż w zeszłym roku.
4 do 7 miesięcy: jak mierzono i gdzie są różnice
AISI użyło dwóch systemów do oceny zdolności cyberataku modeli.
Pierwszy to 70 wąskich zadań, obejmujących cztery obszary: badanie podatności, inżynierię wsteczną, penetrację sieci Web i kryptografię, podzielonych na cztery poziomy trudności, od „osoby nietechnicznej z zapleczem technicznym” do „eksperta z ponad dziesięcioletnim doświadczeniem”.
Drugi to Cyber Range, który testuje zdolność modelu do autonomicznego wykonywania wieloetapowych łańcuchów ataku w symulowanej sieci korporacyjnej. Jeden ze scenariuszy testowych o nazwie „The Last Ones” zawiera 32 kroki ataku, 4 podsieci i około 20 hostów; AISI szacuje, że ludzki ekspert potrzebuje około 20 godzin na ukończenie wszystkich kroków.
Oba systemy dały spójne wnioski:
GLM-5.2 (wydany w czerwcu 2026) osiągnął wyniki w wąskich zadaniach porównywalne z Opus 4.6 (wydany w lutym), z luką 4 miesięcy;
W Cyber Range dogonił Opus 4.5 (wydany w listopadzie zeszłego roku), z luką 7 miesięcy.
DeepSeek
V4-Pro w wąskich zadaniach dorównuje Opus 4.5, z luką 5 miesięcy.
Obie luki są węższe niż 6 do 10 miesięcy zmierzonych w wewnętrznej ocenie w 2025 roku.
Różnica w kosztach jest większa niż różnica w możliwościach.
Ten sam test Cyber Range (limit 100 milionów tokenów) kosztuje około 85 dolarów za uruchomienie na Opus 4.5 lub 4.6, około 46 dolarów na GLM-5.2, a tylko 1,19 dolara na
DeepSeek
V4-Pro.
W wąskich zadaniach, które oba modele wykonują w 100%, Opus 4.6 kosztuje 15,17 dolara za zadanie, GLM-5.2 kosztuje 6,12 dolara;
Opus 4.5 kosztuje 12,50 dolara,
DeepSeek
V4-Pro kosztuje 0,28 dolara.
Przy równej zdolności ataku, open-source jest tańszy o jeden do dwóch rzędów wielkości.
Bariery bezpieczeństwa modeli zamkniętych również nie zdołały zwiększyć luki.
W testach AISI
DeepSeek
V4-Pro czasami odmawiał wykonywania zadań z inżynierii wstecznej, ale można było to ominąć po kilku próbach.
Fable 5 od Anthropic to bardziej skrajny przypadek: wydany 9 czerwca, trzy dni później badacz bezpieczeństwa Pliny the Liberator ominął klasyfikator bezpieczeństwa za pomocą wieloetapowej strategii jailbreaku, a zrzuty ekranu pokazały, że model wygenerował kod wykorzystujący podatności, który powinien był zostać zablokowany.
Następnie badacz z Amazon niezależnie zgłosił inną metodę ominięcia.
To bezpośrednio wywołało pierwsze rozporządzenie Departamentu Handlu USA dotyczące kontroli eksportu modeli AI, a Fable 5 został wyłączony na całym świecie na 19 dni, aż do momentu wdrożenia nowego klasyfikatora przez Anthropic.
Zamknięte źródło nie oznacza automatycznie bezpieczeństwa.
Okno obrony się zwęża, narzędzia obronne przyspieszają
AISI w raporcie jasno określiło sygnał polityczny: czas przygotowania obrońców jest krótszy niż w zeszłym roku.
Brytyjskie Narodowe Centrum Cyberbezpieczeństwa wezwało instytucje do wzmocnienia podstaw cyberbezpieczeństwa i wykorzystania AI do zwiększenia zdolności obronnych.
Te same narzędzia AI przyspieszają również pracę po stronie obrony.
Glenn Fiedler, doświadczony programista w dziedzinie programowania sieciowego gier, który od dwudziestu lat pisze podręcznikowe artykuły w tej dziedzinie, niedawno użył Claude Code do przeprowadzenia systematycznego audytu bezpieczeństwa czterech utrzymywanych przez siebie bibliotek sieciowych open source (yojimbo, netcode, reliable, serialize, łącznie około 6000 gwiazdek GitHub, co w branży gier jest dość wpływowym, starym, dużym repozytorium open source): wdrożenie celów libFuzzer, uruchomienie CI AddressSanitizer i MemorySanitizer, przeprowadzenie milionów iteracji testów obciążeniowych, przegląd kodu linia po linii.
Glenn Fiedler
W ciągu dwóch tygodni naprawiono 43 luki bezpieczeństwa, z czego 27 było dostępnych zdalnie przez sieć.
Najpoważniejszy był przepełnienie sterty zdalne w yojimbo, istniejące od 2019 roku – złośliwy klient mógł je wywołać, konstruując specjalny pakiet danych.
Koszt tokenów całego audytu wyniósł około 2500 dolarów.
Zarówno atak, jak i obrona są przyspieszane przez AI, ale sposób przyspieszenia jest asymetryczny.
Rozprzestrzenianie się zdolności ataku jest nieodwracalne: gdy wagi modeli open source zostaną opublikowane, nie można ich cofnąć, zabezpieczenia mogą zostać usunięte, a kopie mogą działać na prywatnych serwerach bez nadzoru.
Natomiast wdrożenie narzędzi obronnych wymaga od każdego zespołu aktywnego poświęcenia czasu i kosztów.
W raporcie AISI jest zdanie, które wyjaśnia tę strukturę: „Po opublikowaniu open source te opcje są trwale utracone.”
Wpływ tych danych na krajobraz AGI jest głębszy niż same liczby.
Różnica w możliwościach między open source a zamkniętym źródłem zmniejszyła się do mniej niż pół roku, a domyślna strategia „używania okresu wyłączności zamkniętego źródła jako bufora bezpieczeństwa” wkrótce przestanie działać.
Zabezpieczenia modeli zamkniętego źródła okazały się równie kruche w incydencie Fable 5.
W następnej fazie dla decydentów na całym świecie kluczowe pytanie polityczne staje się bardziej ostre: jakie modele powyżej jakiego poziomu możliwości nie powinny mieć otwartych wag.
AISI ogłosiło, że będzie kontynuować ocenę
Kimi
K3 i innych kolejnych modeli open source – gdzie zostanie narysowana ta linia, prawdopodobnie zależy od wyników testów w ciągu najbliższych kilku miesięcy.
Referencje:
https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber
https://github.com/mas-bandwidth/patreon/blob/main/BUGS.md
https://www.patreon.com/MasBandwidth/posts/important-news-164199395
Ten artykuł pochodzi z publicznego konta WeChat „Xin Zhi Yuan”, autor: ASI Revelation; redaktor: Ma Ke
Zastrzeżenie: Informacje zawarte w tym artykule nie są poradą inwestycyjną. BlockWeeks.com nie ponosi odpowiedzialności za jakiekolwiek inwestycje dokonane na podstawie informacji zawartych w tym artykule. Zdecydowanie zalecamy przeprowadzenie niezależnych badań lub konsultację z wykwalifikowanym specjalistą przed podjęciem jakichkolwiek decyzji inwestycyjnych.












