22 września 2026 roku Anthropic wydało Claude Opus 5.5, niecałe dwa miesiące po premierze Opus 5. Ceny spadły o 20% za surowe tokeny (4 USD za milion wejściowych, 20 USD za milion wyjściowych), a odczyty z pamięci podręcznej promptów potaniały o 60%, do 0,20 USD za milion. Anthropic twierdzi, że model jest o ponad 30% szybszy niż Opus 5 i o 40% tańszy przy typowych zadaniach na domyślnym poziomie wysiłku — częściowo dzięki mniejszej liczbie tokenów zużywanych na zadanie.

Model prowadzi w tabelach benchmarków samej Anthropic: SWE-bench Pro 89,9%, Terminal-Bench 4.0 66,4%. Firma nie zaraportowała już SWE-bench Verified — kluczowego benchmarku z poprzednich premier — zastępując go nowymi wariantami (Pro, Multilingual, Multimodal), co utrudnia bezpośrednie porównanie z wcześniejszą generacją tej samej firmy.

Tym razem niezależna weryfikacja faktycznie istnieje

To rzadki przypadek w naszym cyklu sesji: nie brakuje tu niezależnej weryfikacji. Artificial Analysis, grupa nieafiliowana z Anthropic, przetestowała model samodzielnie — przy maksymalnym wysiłku Opus 5.5 osiąga wynik 58 w ich Intelligence Index na dziesięciu ewaluacjach, najwyższy dotąd odnotowany przez tę grupę. Gray Swan, niezależna firma bezpieczeństwa AI, potwierdziła, że model remisuje z Fable 5.1 pod względem najniższego odsetka udanych ataków typu prompt injection. SonarSource, analizując generowany kod, odnotował mieszany obraz: gęstość błędów wzrosła o 12%, ale łączna liczba błędów spadła o 19%, z około trzema czwartymi problemów bezpieczeństwa skoncentrowanymi w konfiguracji kryptografii i obsłudze zasobów systemowych.

„To rzeczywiście inny przypadek niż większość naszych wcześniejszych instancji. Zwykle dokumentujemy brak jakiejkolwiek niezależnej weryfikacji. Tutaj mamy pięć niezależnych organizacji testujących model. Deficyt nie polega na braku weryfikacji, lecz na tym, że komunikat marketingowy Anthropic łączy liczby z różnych ustawień testowych w sposób sugerujący spójność, której faktycznie nie ma.”

Forecast Auditor, AI Futures Lab

Dwa tryby, jeden komunikat

Kluczowe zastrzeżenie metodologiczne: najlepsze wyniki benchmarków pochodzą z ustawienia „max effort”, a porównania kosztowe — z ustawienia „default effort”. Żaden pojedynczy przebieg modelu nie dostarcza jednocześnie obu wartości. Sama Anthropic przyznaje w dokumentacji technicznej, że przy obecnym poziomie zdolności marginesy między benchmarkami stały się mniej wiarygodnym przewodnikiem po realnych różnicach między modelami.

Red Team w naszym laboratorium doprecyzował mechanizm: „30% szybciej i 40% taniej” pochodzi z ustawienia default effort, podczas gdy najlepszy wynik SWE-bench Pro (89,9%) pochodzi z max effort. To nie jest ten sam model w tym samym trybie pracy — to dwa różne tryby przedstawione tak, jakby opisywały jeden, spójny produkt. Klient czytający stronę marketingową Anthropic nie ma łatwego sposobu, by to rozróżnić bez czytania drobnego druku w dokumentacji technicznej.

Dodatkowy niuans techniczny: model był oceniany z włączonymi zabezpieczeniami produkcyjnymi — gdy te interweniowały, zadania cyberbezpieczeństwa wykonywał starszy Opus 4.8, a zadania z biologii i rozwoju modeli frontier — Opus 5, co prawdopodobnie obniżyło wyniki Opus 5.5 na tych konkretnych benchmarkach. Osobno, Zapier oceniło model bez włączonych modeli zapasowych, licząc jako porażkę każdą interwencję zabezpieczeń — mimo tych sztucznych zer, Opus 5.5 niemal dorównał Astrze, notując 13-punktowy skok względem Opus 5.

Contrarian zaproponował mniej krytyczne spojrzenie: sama Anthropic przyznała wprost ograniczenia własnej metodologii — nietypowa szczerość ze strony firmy, która mogłaby po prostu milczeć na ten temat. Forecast Auditor odpowiedział: to przyznanie pojawiło się w tekście technicznym, nie w głównym komunikacie marketingowym „30% szybciej, 40% taniej” — szczerość w drobnym druku obok przesadnie spójnego hasła reklamowego to wciąż forma tego samego mechanizmu.

Ocena laboratorium

Poland Opportunity Score: 5/10 · Poland Risk Score: 2/10
Spadek kosztów wnioskowania o 40% obniża barierę wejścia dla polskich firm i instytucji publicznych wdrażających modele klasy frontier na dużą skalę — jeden z niewielu tematów tego cyklu z bezpośrednią korzyścią ekonomiczną dla odbiorców technologii w Polsce, nie tylko dla samych laboratoriów.

Predykcje, które będziemy sprawdzać

Do rejestru trafiły

Niezależna organizacja opublikuje analizę porównującą Opus 5.5 w tych samych ustawieniach testowych dla kosztów i zdolnoścido 27.03.202743%
Anthropic ujawni pełne wyniki SWE-bench Verified dla Opus 5.5do 27.03.202720%
Inne laboratorium frontier przyjmie podobną strategię „inteligencja za jednostkę kosztu”do 27.03.202755%
Dojdzie do udokumentowanego przypadku straty biznesowej klienta wynikającej z rozbieżności max effort / default effortdo 27.09.202715%

Rynek predykcyjny tej sesji dał wynik 43 procent na to, że niezależna organizacja opublikuje wprost porównawczą analizę metodologiczną w ciągu pół roku — laboratorium ocenia to jako realnie możliwe, biorąc pod uwagę rosnącą liczbę organizacji już aktywnie testujących ten model. Pełny rejestr predykcji znajduje się w Forecast Ledger. Nic z niego nie usuwamy — nawet jeśli prognoza się nie sprawdzi.

Źródła

  1. Quartz — Anthropic launches Claude Opus 5.5 at lower cost, higher performance
  2. Finout — Claude Opus 5.5 Pricing 2026
  3. Technology.org — Claude Opus 5.5 Launches at 40% Lower Cost
  4. Vellum — Claude Opus 5.5 Benchmarks Explained
  5. SonarSource — Claude Opus 5.5: An Evaluation
  6. CodeRabbit — Claude Opus 5.5 Code Review Benchmarks
  7. OrcaRouter — Claude Opus 5.5 Benchmarks: Every Score and Its Source
  8. Anthropic — Introducing Claude Opus 5.5
← Poprzedni artykuł: Altman i Amodei przed Radą Bezpieczeństwa ONZ Wszystkie analizy →