Claude Haiku 5.5 obniża ceny API o 90% w obliczu rosnących kosztów inferencji
Anthropic wypuściło Claude Haiku 5.5 8 października, obniżając ceny tokenów o nawet 90 procent. Model ma obsługiwać zadania o dużej objętości. Ruch ten podkreśla rosnący podział na rynku: koszty małych modeli spadają, podczas gdy wydatki na sprzęt i pamięć wciąż rosną, zmuszając programistów do balansowania między prędkością a łącznymi kosztami obliczeniowymi.

Anthropic wypuściło Claude Haiku 5.5 8 października. To najszybszy i najtańszy mały model firmy. Wersja ta jest skierowana do zadań o dużej objętości, takich jak zapytania do danych i obsługa klienta.
Zdaniem The Decoder model jest o około 75 procent tańszy od swojego poprzednika, Haiku 4.5. Dla żądań z promptami do 100 000 tokenów, które według Anthropic stanowią około 90 procent poprzednich żądań do Haiku, ceny spadają o nawet 90 procent. Tokeny wejściowe kosztują teraz 0,10 dolara za milion, w dół z 1,00 dolara. Tokeny wyjściowe spadają do 0,50 dolara za milion z 5,00 dolara.
Obniżka cen następuje w momencie, gdy reszta stosu staje się droższa. Pavan Davuluri, szef Windows w Microsoft, przyznał w podcaście Inside Windows, że rosnący koszt pamięci zmusza firmę do skłaniania Windows 11 do używania mniej RAM. Davuluri opisał pamięć jako „główny problem” branży, zaznaczając, że producenci OEM wracają z laptopami 8GB na rynek. Microsoft uczynił „optymalizację pamięci dla 8GB i więcej” oficjalnym priorytetem na resztę 2026 roku, według Windows Latest.
Niższe ceny za token nie zawsze oznaczają niższe rachunki. Artificial Analysis klasyfikuje Haiku 5.5 jako wiodący model z klasy małych, z wynikiem 43 na swoim Indeksie Inteligencji. Jednak platforma wskazuje na znacznie wyższe zużycie tokenów. Na najwyższym poziomie wysiłku Haiku 5.5 używa około 162 000 tokenów wyjściowych na zadanie, co stanowi około trzy razy więcej niż 50 000 tokenów wymaganych przez GPT-6 Luna od OpenAI.
Wymiana wydajności
Nawet przy porównywalnych poziomach wydajności luka pozostaje. Ustawieniu „wysoki” wysiłek Haiku 5.5 osiąga wynik 38, używając około 55 000 tokenów na zadanie, podczas gdy GPT-6 Luna osiąga ten sam wynik z około 50 000 tokenów. W sensie wydajności Pareto, czyli stosunku wydajności do zużycia zasobów, model OpenAI wychodzi na prowadzenie. Skok z „xhigh” na „max” wysiłek w GPT-6 Luna dodaje tylko dwa punkty, zwiększając jednocześnie zużycie tokenów o 1,8 raza.
Anthropic zwraca uwagę, że Haiku 5.5 używa zaktualizowanego tokenizera, który zużywa nieco więcej tokenów na zadanie niż jego poprzednik. To samo wydarzyło się z modelami Opus 4.x, gdzie zużycie tokenów skoczyło o około 30 procent wyłącznie przez zmianę tokenizera. Rzeczywiste oszczędności są prawdopodobnie mniejsze niż sugerują ceny za token, co komplikuje narrację o czystej wojnie cenowej.
Presja sprzętowa i infrastrukturalna
Po tym, jak dostawcy API rywalizują ceną, fizyczna infrastruktura wymagana do obsługi tych modeli pozostaje wąskim gardłem. HPCwire zauważa, że systemy inferencji AI zawadzają inaczej niż tradycyjne usługi webowe. Średnie opóźnienie może wyglądać dobrze, podczas gdy użytkownicy są już niezadowoleni, ponieważ żądania czekają w kolejkach na utworzenie paczek. Zachowanie przy zimnym starcie to kolejny problem; uruchomienie pracownika inferencji wymaga pobrania modeli, załadowania wag do pamięci i zainicjowania stanu akceleratora. Kubernetes może pokazywać pod jako uruchomiony, ale nie oznacza to, że system ma jeszcze rzeczywistą pojemność obsługi.
Ta złożoność napędza popyt na specjalizowany sprzęt i optymalizacje programowe. Magnitude, otwarty silnik inferencji uruchomiony we wrześniu, twierdzi, że optymalizuje jądra dla konkretnego sprzętu, aby uruchamiać otwarte modele nawet 2 razy szybciej niż llama.cpp. Narzędzie kompiluje i stroi jądra na urządzeniu użytkownika, celując w Apple Silicon, NVIDIA, AMD lub środowiska tylko z CPU. Dąży do zmniejszenia zużycia pamięci o 27 procent na agenta, co jest kluczowym czynnikiem, gdy koszty RAM rosną.
Lokalizacja również ma znaczenie. Data Center Knowledge donosi o propozycji 20-piętrowego centrum danych w centrum Kansas City, zaprojektowanego, aby wykorzystywać gęste połączenia operacyjne dla inferencji o niskim opóźnieniu. Steve Austin, założyciel Revitalization Unlimited, argumentuje, że inferencja musi następować blisko użytkownika, ponieważ opóźnienie ma znaczenie. Projekt mierzy się z wyższymi kosztami budowy, szacowanymi na 183 000 000 dolarów, czyli około 1 300 dolarów za stopę kwadratową, w porównaniu z obiektami przedmiejskimi. Ta premia jest uzasadniona tylko dla konkretnych obciążeń, takich jak transakcje finansowe lub interakcje AI w czasie rzeczywistym.
Dostrzegany nadzór regulacyjny również się nasila wokół praktyk cenowych. FTC wysłała listy do 24 dużych firm usługowych w opiece zdrowotnej 5 października, ostrzegając je przed wprowadzającymi w błąd cenami. Choć nie jest to bezpośrednio związane z AI, ruch ten sygnalizuje szersze zainteresowanie rządu przejrzystością cen. Podobnie McDonald’s został pozwany 2 października za rzekome użycie narzędzia AI do ustalania cen w całej sieci franczyzowej, co powództwo twierdzi, narusza prawo antymonopolowe, ułatwiając algorytmiczne ustalanie cen.
Szerszy kontekst rynkowy
Pościg za tańszą inferencję nie ogranicza się do Anthropic. Badacze na arXiv publikują artykuły na temat łagodzenia nadużycia czasu inferencji i efektywnej oceny strategii. Artykuł złożony 7 października proponuje ramkę tylko próbkową do oceny strategii Best-of-N, która pomaga wybrać najbardziej efektywne budżety próbkowania bez potrzeby pełnego dostępu do prawdopodobieństwa. Ta praca akademicka podbudowuje wysiłki inżynieryjne, aby uczynić inferencję tańszą i bardziej niezawodną.
Dostawcy chmury również dostosowują swoje strategie. AWS rzekomo podniósł ceny pojemności GPU o 15 procent pod koniec września, co kontrastuje z obniżkami API Anthropic. Ta rozbieżność sugeruje, że podczas gdy surowe koszty obliczeniowe rosną, konkurencja na warstwie aplikacji zmusza dostawców do szukania efektywności gdzie indziej. Wynikiem jest rynek, w którym koszt inteligencji jest odłączany od kosztu krzemenu, które ją napędza.
Dla programistów wniosek jest jasny: najtańszy token nie zawsze jest najskuteczniejszym kosztowo rozwiązaniem. Całkowity koszt posiadania zależy teraz od efektywności tokenów, wykorzystania sprzętu i konkretnych wymagań dotyczących opóźnień obciążenia. Gdy inferencja staje się głównym polem bitwy AI, nacisk przesuwa się z surowej zdolności modelu na ekonomię dostawy.
Źródła
9- 01Claude Haiku 5.5 arrives with massive price cutsEN
- 02Rising cost of memory, Microsoft explains why Windows 11 will use less RAMEN
- 03Why AI Inference Infrastructure Fails Differently From Traditional ServicesEN
- 04Launch HN: Magnitude (YC S25) – Self-optimizing inference engineEN
- 05Vertical Data Centers Face Cost-Proximity Trade-OffsEN
- 06FTC Issues Letters Warning Hospitals Against Deceptive Pricing PracticesEN
- 07McDonald’s sued for allegedly using AI tool to determine pricingEN
- 08Efficient Best-of-N policy evaluation for inference-time alignmentEN
- 09Understanding and Mitigating Inference-Time Overreliance Using Agentic MemoryEN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.