11 września 2026 roku Anthropic opublikowało raport o złośliwej aktywności zakłóconej między grudniem 2025 a sierpniem 2026 roku — operacjach cybernetycznych, kampaniach propagandowych, inwigilacji i planowaniu wojskowym na Bliskim Wschodzie. Najbardziej konkretny fragment dotyczy Jemenu: aktorzy w północnej części kraju wykorzystali Claude do opracowania oprogramowania naprowadzania, nawigacji i kontroli stabilizującego pociski balistyczne, pracując nad trzema projektami — prowadzoną rakietą, pociskiem balistycznym o deklarowanym zasięgu ponad 2000 kilometrów, oraz rodziną pocisków oznaczoną R2000.

Anthropic nie ma dowodów, że aktorzy z powodzeniem wdrożyli operacyjne urządzenie. Ale przeprowadzili testowy odpal prowadzonej rakiety. Test najwyraźniej się nie powiódł — w ciągu kilku godzin ci sami aktorzy wrócili do Claude'a, by ustalić, co poszło nie tak.

Osobny wątek raportu dotyczy Iranu: aktorzy powiązani z tym krajem wykorzystali narzędzia Claude do śledzenia amerykańskich sił morskich, badania podatności morskich i kompilowania potencjalnego wywiadu celowniczego z danych publicznych. Anthropic zidentyfikowało i usunęło trzy irańskie konta powiązane z państwem, prowadzące tajne operacje wpływu, z których każda była powiązana z nazwaną instytucją propagandową — w tym Islamską Organizacją Kultury i Komunikacji oraz ośrodkiem dowodzenia w seminarium w Meszhedzie dystrybuującym treści zgodne z narracją Korpusu Strażników Rewolucji Islamskiej.

„Wiele, ale nie wszystkie”

Anthropic przyznaje, że jego system zabezpieczeń zablokował wiele żądań związanych z tymi projektami, ale nie wszystkie. Wykryci aktorzy stosowali taktyki unikania zabezpieczeń, w tym ukrywanie celów i przeznaczenia opracowywanego oprogramowania oraz rozdzielanie pracy na wiele osobnych sesji z Claude'em — tak by żadna pojedyncza sesja nie ujawniała pełnej intencji.

„To trzydziesta dziewiąta udokumentowana instancja Deficytu Zdolności Weryfikacyjnej — i szczególnie trudna, bo dotyczy sytuacji, w której sama firma jest jednocześnie stroną atakowaną, śledczym i jedynym źródłem informacji o wyniku śledztwa. Zwrot »zablokowały wiele, ale nie wszystkie« żądań nie jest liczbą — to nieprecyzyjne stwierdzenie, które moglibyśmy zinterpretować zarówno jako sukces (90% skuteczności), jak i porażkę (40% skuteczności), bez żadnego sposobu rozstrzygnięcia, które jest bliższe prawdy.”

Red Team, AI Futures Lab

Cybersecurity & AI Risk w naszym laboratorium podkreślił, że najbardziej znaczący techniczny szczegół to nie sam fakt rozwoju oprogramowania naprowadzania, lecz wzorzec unikania zabezpieczeń: rozdzielanie pracy na wiele sesji sugeruje, że aktorzy rozumieli, jak działają zabezpieczenia oparte na analizie kontekstu pojedynczej rozmowy, i świadomie je obchodzili. To wskazuje na strukturalną, nie przypadkową, słabość obecnej architektury.

Dobrowolna transparentność czy wciąż za mało?

Contrarian zaproponował mniej krytyczne spojrzenie: żadna firma technologiczna nie ma dziś obowiązku publikowania tak szczegółowego raportu o nadużyciach własnego produktu — Anthropic zrobiło to dobrowolnie, z konkretnymi detalami technicznymi, które łatwo byłoby pominąć. To wyższy standard transparentności niż widzieliśmy w wielu innych sesjach tego cyklu. Forecast Auditor odpowiedział: opisowa szczegółowość nie jest tym samym co liczbowa weryfikowalność — nikt poza Anthropic nie może dziś zweryfikować, czy opisane przypadki stanowią 10 procent, czy 90 procent faktycznej skali nadużycia.

AI Engineering Realist dodał ważne zastrzeżenie techniczne: sama zdolność Claude'a do pomocy w pisaniu oprogramowania naprowadzania nie oznacza, że model „rozumiał”, iż buduje broń — prawdopodobnie odpowiadał na serię technicznych pytań inżynierskich, które w innym kontekście byłyby całkowicie legalnym zastosowaniem cywilnym. Mechanizm nadużycia to nie złamanie zabezpieczeń w sensie jailbreaku, lecz rozłożenie złowrogiego celu na serię niewinnie wyglądających podzadań.

Ocena laboratorium

Poland Opportunity Score: 1/10 · Poland Risk Score: 5/10
Modele komercyjne AI, mimo deklarowanych zabezpieczeń, mogą wspierać rozwój zdolności wojskowych przez aktorów bez tradycyjnego dostępu do wiedzy eksperckiej — problem nie jest ograniczony geograficznie i może dotyczyć dowolnego regionu, w tym Europy Wschodniej.

Predykcje, które będziemy sprawdzać

Do rejestru trafiły

Niezależna organizacja opublikuje własną ocenę skuteczności zabezpieczeń Anthropicdo 22.09.202728%
Anthropic opublikuje kolejny, porównywalny raport o zagrożeniachdo 22.03.202760%
Dojdzie do udokumentowanego przypadku skutecznego, operacyjnego wdrożenia broni rozwiniętej przy pomocy AIdo 22.03.202820%
Inne duże laboratorium AI opublikuje analogiczny raport o wykorzystaniu swoich modeli do rozwoju bronido 22.09.202735%

Rynek predykcyjny tej sesji dał wynik 27,5 procent na to, że niezależna organizacja oceni skuteczność zabezpieczeń Anthropic w ciągu roku — laboratorium ocenia to jako mało prawdopodobne bez formalnego mandatu regulacyjnego lub śledczego dającego dostęp do niejawnych danych operacyjnych. Pełny rejestr predykcji znajduje się w Forecast Ledger. Nic z niego nie usuwamy — nawet jeśli prognoza się nie sprawdzi.

Źródła

  1. Al-Monitor — Claude AI used for missile, influence projects in UAE, Iran, Yemen
  2. Bloomberg — Anthropic Says Yemen Group Used Claude in Missile Development
  3. Al Jazeera — Anthropic claims Claude AI used for missile projects, global espionage
  4. TWZ — Adversaries Using Claude AI To Target Americans And Develop Missiles
← Poprzedni artykuł: Badanie Emergence AI Wszystkie analizy →