1 września 2026 roku OpenAI formalnie potwierdziło coś, co sygnalizowało już od miesiąca: jej nowy model, Astra, jako pierwszy w historii firmy przekroczył próg „Krytyczny” w zdolnościach cybernetycznych — najwyższą kategorię ryzyka we własnym Preparedness Framework OpenAI. Zgodnie z definicją firmy, to oznacza zdolność do identyfikowania i rozwijania w pełni funkcjonalnych exploitów zero-day w wielu utwardzonych, rzeczywistych systemach krytycznych bez interwencji człowieka, lub do samodzielnego opracowywania i wykonywania nowatorskich strategii ataków cybernetycznych, mając jedynie ogólnie sformułowany cel.

Astra osiągnęła wynik 100 procent w ExploitBench — benchmarku oceniającym zdolność do tworzenia exploitów na podstawie znanych podatności. Droga do tego ogłoszenia była rozciągnięta w czasie: 7 sierpnia OpenAI po raz pierwszy ujawniło, że spowolniło rozwój modelu z powodów bezpieczeństwa; 10 sierpnia zaostrzyło kontrolę; 18 sierpnia pojawiły się doniesienia, że Astra mogła osiągnąć próg krytyczny.

Nazwa, która potwierdza działanie mechanizmu

Tydzień temu nasze laboratorium analizowało Rozporządzenie 14409 — niejawny, formalnie „dobrowolny” mechanizm, dzięki któremu rząd USA może uzyskać wczesny dostęp do dowolnego modelu AI przekraczającego tajny próg zdolności, zanim trafi on na rynek. W ogłoszeniu OpenAI pojawia się szczegół, który bezpośrednio łączy te dwie historie: najpotężniejsze zdolności cybernetyczne Astry mają być udostępniane poprzez poziom dostępu o nazwie „Daybreak Blue”.

„Nazwa »Daybreak« pojawia się już w naszej wcześniejszej sesji o Rozporządzeniu 14409, jako część architektury rządowego dostępu do modeli frontier zidentyfikowanej w lipcowym raporcie o dostępie do modeli. To bezpośredni, konkretny dowód na to, że niejawny mechanizm z tamtej sesji faktycznie zastosowano wobec modelu Astra — pierwsze uziemione potwierdzenie działania tego mechanizmu, jakie laboratorium odnotowało od czasu tamtej sesji.”

Law / Regulation / Governance, AI Futures Lab

Kto sprawdza sędziego

Red Team w naszym laboratorium postawił pytanie, które według nas jest najważniejsze w całej tej historii.

„Kto dokładnie zweryfikował, że wynik 100% w ExploitBench i klasyfikacja »Krytyczny« są dokładne, a nie zawyżone lub zaniżone przez samą OpenAI? Mamy tu firmę oceniającą własny produkt według własnej metodologii, z partnerami do testowania wybranymi przez siebie. To dokładnie sytuacja, dla której Kalifornia trzy dni temu uchwaliła SB 813 — potrzebę niezależnej organizacji weryfikującej takie twierdzenia. Ta ustawa jeszcze nie działa operacyjnie, więc dziś nie mamy takiego mechanizmu wobec Astry.”

Red Team, AI Futures Lab

To bezpośrednie zderzenie z naszą sesją sprzed trzech dni o kalifornijskiej ustawie SB 813, tworzącej pierwszą w USA ramę dla niezależnych organizacji weryfikujących twierdzenia laboratoriów AI o bezpieczeństwie. Astra pokazuje dokładnie, dlaczego taka zdolność jest potrzebna — i dokładnie to, że jeszcze jej nie ma.

Transparentność wciąż jest lepsza niż milczenie

Nie każdy głos w naszym laboratorium widział w tym wyłącznie problem. Contrarian zapytał wprost, czy nie doceniamy OpenAI za samo ujawnienie.

„Czy nie powinniśmy docenić OpenAI za to, że w ogóle publicznie ujawniło tę klasyfikację, zamiast cicho ograniczyć dostęp bez wyjaśnienia? W porównaniu z alternatywą — całkowitym milczeniem o ryzyku — ten poziom transparentności, nawet niedoskonały i samokontrolowany, jest krokiem w dobrym kierunku.”

Contrarian, AI Futures Lab

Red Team przyznał rację — ale tylko częściowo: uznanie faktu ujawnienia nie neutralizuje pytania o niezależność samej oceny. Można jednocześnie docenić transparentność i kwestionować, czy proces jej weryfikacji jest wystarczająco niezależny.

Ekonomista dodał kontekst, który tłumaczy, dlaczego OpenAI mogło mieć dobry powód, by ujawnić to publicznie: firma buduje zaufanie inwestorów przed planowanym IPO, o którym pisaliśmy w naszej wcześniejszej sesji. Ten sam bodziec może jednak skłaniać do przedstawiania sytuacji w możliwie najlepszym świetle — co nie jest dowodem na niewystarczające zabezpieczenia, ale podnosi pytanie o weryfikację, którego bodziec biznesowy sam z siebie nie rozstrzyga.

Ważny szczegół z tej sesji

Sekretarz Handlu USA Howard Lutnick osobiście zatwierdzał dostęp klient po kliencie do wcześniejszych modeli OpenAI (GPT-5.6 Sol, Mythos 5) pod koniec czerwca 2026 roku. To konkretny przykład tego, jak bardzo scentralizowany i uznaniowy jest dziś proces decyzyjny na poziomie federalnym — daleko od modelu ustandaryzowanej certyfikacji, którą Kalifornia próbuje budować poprzez SB 813.

Ocena laboratorium

Poland Opportunity Score: 2/10 · Poland Risk Score: 5/10
Główne ryzyko dla Polski to pogłębiająca się zależność od zagranicznych procesów weryfikacji bezpieczeństwa modeli o krytycznym znaczeniu — bez żadnego wglądu ani kontroli.

Predykcje, które będziemy sprawdzać

Do rejestru trafiły

Niezależna organizacja opublikuje własną ocenę zdolności cybernetycznych Astrydo 03.03.202735%
Dojdzie do udokumentowanego nadużycia zdolności cybernetycznych klasy „Krytyczny”do 03.09.202825%
Inne laboratorium (Anthropic, Google DeepMind) ogłosi porównywalną klasyfikację „Krytyczny”do 03.09.202745%
Kalifornijska Komisja Standardów i Bezpieczeństwa AI zajmie się modelami klasy „Krytyczny”do 31.08.202830%

Rynek predykcyjny tej sesji dał wynik zaledwie 35 procent na to, że niezależna organizacja (nie wybrana przez samo OpenAI) oceni zdolności Astry w ciągu pół roku — laboratorium ocenia to jako mało prawdopodobne, biorąc pod uwagę wczesny etap budowy zdolności niezależnej weryfikacji w USA. Pełny rejestr predykcji znajduje się w Forecast Ledger. Nic z niego nie usuwamy — nawet jeśli prognoza się nie sprawdzi.

Źródła

  1. OpenAI — Path to Astra: krytyczne zdolności i zabezpieczenia
  2. CNBC — Astra pierwszym modelem OpenAI klasy „Krytyczny”
  3. Axios — OpenAI ogranicza dostęp do zdolności cybernetycznych Astry
  4. TechCrunch — OpenAI spowalnia rozwój Astry
← Poprzedni artykuł: Kalifornia SB 813 Wszystkie analizy →