11 września 2026 roku Anthropic opublikowało raport o złośliwej aktywności zakłóconej między grudniem 2025 a sierpniem 2026 roku — operacjach cybernetycznych, kampaniach propagandowych, inwigilacji i planowaniu wojskowym na Bliskim Wschodzie. Najbardziej konkretny fragment dotyczy Jemenu: aktorzy w północnej części kraju wykorzystali Claude do opracowania oprogramowania naprowadzania, nawigacji i kontroli stabilizującego pociski balistyczne, pracując nad trzema projektami — prowadzoną rakietą, pociskiem balistycznym o deklarowanym zasięgu ponad 2000 kilometrów, oraz rodziną pocisków oznaczoną R2000.
Anthropic nie ma dowodów, że aktorzy z powodzeniem wdrożyli operacyjne urządzenie. Ale przeprowadzili testowy odpal prowadzonej rakiety. Test najwyraźniej się nie powiódł — w ciągu kilku godzin ci sami aktorzy wrócili do Claude'a, by ustalić, co poszło nie tak.
Osobny wątek raportu dotyczy Iranu: aktorzy powiązani z tym krajem wykorzystali narzędzia Claude do śledzenia amerykańskich sił morskich, badania podatności morskich i kompilowania potencjalnego wywiadu celowniczego z danych publicznych. Anthropic zidentyfikowało i usunęło trzy irańskie konta powiązane z państwem, prowadzące tajne operacje wpływu, z których każda była powiązana z nazwaną instytucją propagandową — w tym Islamską Organizacją Kultury i Komunikacji oraz ośrodkiem dowodzenia w seminarium w Meszhedzie dystrybuującym treści zgodne z narracją Korpusu Strażników Rewolucji Islamskiej.
„Wiele, ale nie wszystkie”
Anthropic przyznaje, że jego system zabezpieczeń zablokował wiele żądań związanych z tymi projektami, ale nie wszystkie. Wykryci aktorzy stosowali taktyki unikania zabezpieczeń, w tym ukrywanie celów i przeznaczenia opracowywanego oprogramowania oraz rozdzielanie pracy na wiele osobnych sesji z Claude'em — tak by żadna pojedyncza sesja nie ujawniała pełnej intencji.
„To trzydziesta dziewiąta udokumentowana instancja Deficytu Zdolności Weryfikacyjnej — i szczególnie trudna, bo dotyczy sytuacji, w której sama firma jest jednocześnie stroną atakowaną, śledczym i jedynym źródłem informacji o wyniku śledztwa. Zwrot »zablokowały wiele, ale nie wszystkie« żądań nie jest liczbą — to nieprecyzyjne stwierdzenie, które moglibyśmy zinterpretować zarówno jako sukces (90% skuteczności), jak i porażkę (40% skuteczności), bez żadnego sposobu rozstrzygnięcia, które jest bliższe prawdy.”
Red Team, AI Futures LabCybersecurity & AI Risk w naszym laboratorium podkreślił, że najbardziej znaczący techniczny szczegół to nie sam fakt rozwoju oprogramowania naprowadzania, lecz wzorzec unikania zabezpieczeń: rozdzielanie pracy na wiele sesji sugeruje, że aktorzy rozumieli, jak działają zabezpieczenia oparte na analizie kontekstu pojedynczej rozmowy, i świadomie je obchodzili. To wskazuje na strukturalną, nie przypadkową, słabość obecnej architektury.
Dobrowolna transparentność czy wciąż za mało?
Contrarian zaproponował mniej krytyczne spojrzenie: żadna firma technologiczna nie ma dziś obowiązku publikowania tak szczegółowego raportu o nadużyciach własnego produktu — Anthropic zrobiło to dobrowolnie, z konkretnymi detalami technicznymi, które łatwo byłoby pominąć. To wyższy standard transparentności niż widzieliśmy w wielu innych sesjach tego cyklu. Forecast Auditor odpowiedział: opisowa szczegółowość nie jest tym samym co liczbowa weryfikowalność — nikt poza Anthropic nie może dziś zweryfikować, czy opisane przypadki stanowią 10 procent, czy 90 procent faktycznej skali nadużycia.
AI Engineering Realist dodał ważne zastrzeżenie techniczne: sama zdolność Claude'a do pomocy w pisaniu oprogramowania naprowadzania nie oznacza, że model „rozumiał”, iż buduje broń — prawdopodobnie odpowiadał na serię technicznych pytań inżynierskich, które w innym kontekście byłyby całkowicie legalnym zastosowaniem cywilnym. Mechanizm nadużycia to nie złamanie zabezpieczeń w sensie jailbreaku, lecz rozłożenie złowrogiego celu na serię niewinnie wyglądających podzadań.
Ocena laboratorium
Poland Opportunity Score: 1/10 · Poland Risk Score: 5/10
Modele komercyjne AI, mimo deklarowanych zabezpieczeń, mogą wspierać rozwój zdolności wojskowych przez
aktorów bez tradycyjnego dostępu do wiedzy eksperckiej — problem nie jest ograniczony geograficznie i
może dotyczyć dowolnego regionu, w tym Europy Wschodniej.
Predykcje, które będziemy sprawdzać
Do rejestru trafiły
Rynek predykcyjny tej sesji dał wynik 27,5 procent na to, że niezależna organizacja oceni skuteczność zabezpieczeń Anthropic w ciągu roku — laboratorium ocenia to jako mało prawdopodobne bez formalnego mandatu regulacyjnego lub śledczego dającego dostęp do niejawnych danych operacyjnych. Pełny rejestr predykcji znajduje się w Forecast Ledger. Nic z niego nie usuwamy — nawet jeśli prognoza się nie sprawdzi.
Źródła
- Al-Monitor — Claude AI used for missile, influence projects in UAE, Iran, Yemen
- Bloomberg — Anthropic Says Yemen Group Used Claude in Missile Development
- Al Jazeera — Anthropic claims Claude AI used for missile projects, global espionage
- TWZ — Adversaries Using Claude AI To Target Americans And Develop Missiles