Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

Claude Haiku 5.5 senkt API-Preise um 90 Prozent

Anthropic hat am 8. Oktober Claude Haiku 5.5 veröffentlicht. Die Token-Preise fallen um bis zu 90 Prozent, um hochvolumige Inferenz-Aufgaben zu bedienen. Der Schritt verdeutlicht die wachsende Spaltung im Markt: Während die Kosten für kleine Modelle sinken, steigen die Ausgaben für Hardware und Speicher, was Entwickler vor die Wahl zwischen roher Geschwindigkeit und Gesamtausgaben für die Rechenleistung stellt.

KI & ModelleAnalyseLena BrandtVeröffentlicht: 8. Oktober 20265 Min. LesezeitQuellen 9
Claude Haiku 5.5 senkt API-Preise um 90 Prozent

Anthropic hat Claude Haiku 5.5 am 8. Oktober veröffentlicht. Es ist das schnellste und günstigste kleine Modell des Unternehmens. Der Release zielt auf hochvolumige Aufgaben wie Datenabfragen und Kundensupport.

Laut The Decoder kostet das Modell etwa 75 Prozent weniger als sein Vorgänger, Haiku 4.5. Für Anfragen mit Prompts bis zu 100.000 Tokens, die laut Anthropic rund 90 Prozent der früheren Haiku-Anfragen ausmachen, sinken die Preise um bis zu 90 Prozent. Eingabe-Tokens kosten jetzt 0,10 US-Dollar pro Million, zuvor 1,00 US-Dollar. Ausgabe-Tokens fallen von 5,00 US-Dollar auf 0,50 US-Dollar pro Million.

Der Preiskampf kommt zu einem Zeitpunkt, an dem der Rest des Stacks teurer wird. Pavan Davuluri, Chef für Windows bei Microsoft, gab im Inside Windows Podcast zu, dass die steigenden Speicherkosten das Unternehmen dazu zwingen, Windows 11 sparsamer im RAM-Verbrauch zu gestalten. Davuluri bezeichnete Speicher als "Top of Mind" der Branche und stellte fest, dass OEMs Laptops mit 8GB wieder auf den Markt bringen. Laut Windows Latest hat Microsoft "Speicheroptimierung für 8GB und mehr" für den Rest des Jahres 2026 zu einer offiziellen Priorität erklärt.

Niedrigere Preise pro Token bedeuten nicht automatisch niedrigere Gesamtrechnungen. Artificial Analysis stuft Haiku 5.5 als führendes Modell der kleinen Klasse mit einem Score von 43 auf dem Intelligence Index ein. Die Plattform weist jedoch auf einen deutlich höheren Token-Verbrauch hin. Auf dem höchsten Effizienzniveau verwendet Haiku 5.5 etwa 162.000 Ausgabe-Tokens pro Aufgabe, was rund dem Dreifachen der 50.000 Tokens entspricht, die OpenAIs GPT-6 Luna benötigt.

Der Effizienz-Kompromiss

Selbst bei vergleichbaren Leistungsniveaus bleibt die Lücke bestehen. Auf der "High"-Einstellung erreicht Haiku 5.5 einen Score von 38 mit etwa 55.000 Tokens pro Aufgabe, während GPT-6 Luna denselben Score mit rund 50.000 Tokens holt. In puncto Pareto-Effizienz, also dem Verhältnis von Leistung zu Ressourceneinsatz, liegt das Modell von OpenAI vorn. Der Sprung von "xhigh" auf "Max" bei GPT-6 Luna fügt nur zwei Punkte hinzu, erhöht den Token-Verbrauch aber um das 1,8-Fache.

Anthropic weist darauf hin, dass Haiku 5.5 einen aktualisierten Tokenizer verwendet, der pro Aufgabe leicht mehr Tokens verbraucht als sein Vorgänger. Ähnliches geschah bei den Opus-4.x-Modellen, wo der Token-Verbrauch allein durch die Tokenizer-Änderung um etwa 30 Prozent stieg. Die Ersparnisse in der Praxis sind wahrscheinlich kleiner, als die Preise pro Token vermuten lassen. Eine Nuance, die das Narrativ eines reinen Preiskriegs kompliziert.

Druck durch Hardware und Infrastruktur

Während API-Anbieter bei den Preisen konkurrieren, bleibt die physische Infrastruktur, die diese Modelle bedient, eine Engstelle. HPCwire merkt an, dass KI-Inferenzsysteme anders ausfallen als traditionelle Webdienste. Die durchschnittliche Latenz kann gut aussehen, während Nutzer bereits unzufrieden sind, weil Anfragen in Warteschlangen auf die Bildung von Batches warten. Das Kaltstart-Verhalten ist ein weiteres Problem; das Starten eines Inferenz-Workers umfasst das Herunterladen von Modellen, das Laden der Gewichte in den Speicher und die Initialisierung des Accelerator-Zustands. Kubernetes kann einen Pod als laufend anzeigen, was aber nicht bedeutet, dass das System bereits tatsächliche Kapazität für die Bedienung hat.

Diese Komplexität treibt die Nachfrage nach spezialisierter Hardware und Software-Optimierungen. Magnitude, eine Open-Source-Inferenz-Engine, die im September gestartet wurde, behauptet, Kernels für spezifische Hardware zu optimieren, um offene Modelle bis zu 2x schneller als llama.cpp auszuführen. Das Tool kompiliert und justiert Kernels auf dem Gerät des Nutzers, mit Fokus auf Apple Silicon, NVIDIA, AMD oder rein CPU-basierte Umgebungen. Es zielt darauf ab, den Speicherverbrauch pro Agenten um 27 Prozent zu senken, ein entscheidender Faktor, da die RAM-Kosten steigen.

Auch der Standort spielt eine Rolle. Data Center Knowledge berichtet über ein vorgeschlagenes 20-stöckiges Rechenzentrum im Zentrum von Kansas City, das dichte Carrier-Anbindungen für Inferenz mit niedriger Latenz nutzen soll. Steve Austin, Gründer von Revitalization Unlimited, argumentiert, dass Inferenz nahe am Nutzer stattfinden muss, weil Latenz wichtig ist. Das Projekt steht vor höheren Baukosten, geschätzt auf 183.000.000 US-Dollar oder rund 1.300 US-Dollar pro Quadratfuß, im Vergleich zu Vorort-Einrichtungen. Diese Prämie ist nur für spezifische Workloads wie Finanztransaktionen oder Echtzeit-KI-Interaktionen gerechtfertigt.

Die regulatorische Beobachtung von Preispraktiken wird ebenfalls intensiver. Die FTC schickte am 5. Oktober Briefe an 24 große Gesundheitsdienstleistungsunternehmen und warnte sie vor irreführenden Preisen. Obwohl dies nicht direkt mit KI zusammenhängt, signalisiert der Schritt ein breiteres staatliches Interesse an Preistransparenz. Ähnlich wurde McDonalds am 2. Oktober verklagt, weil es angeblich ein KI-Tool zur Preisgestaltung über Franchises hinweg einsetzt. Die Kläger behaupten, dies verstoße gegen Kartellgesetze, da es algorithmische Preisabsprachen erleichtert.

Der breitere Marktzusammenhang

Der Druck auf günstigere Inferenz beschränkt sich nicht auf Anthropic. Forscher auf arXiv veröffentlichen Papiere zur Minderung der Überabhängigkeit zur Inferenzzeit und zur effizienten Policy-Evaluation. Ein am 7. Oktober eingereichtes Papier schlägt ein rein samples-basiertes Framework vor, um Best-of-N-Policies zu evaluieren. Dies hilft, die effektivsten Sampling-Budgets auszuwählen, ohne vollen Likelihood-Zugang zu benötigen. Diese akademische Arbeit untermauert die Engineering-Bemühungen, Inferenz günstiger und zuverlässiger zu machen.

Auch Cloud-Anbieter passen ihre Strategien an. AWS hat die GPU-Kapazitätspreise Ende September angeblich um 15 Prozent erhöht, ein Schritt, der im Kontrast zu den API-Kürzungen von Anthropic steht. Diese Divergenz deutet darauf hin, dass die Kosten für rohe Rechenleistung steigen, während der Wettbewerb auf der Anwendungsebene Anbieter zwingt, Effizienz woanders zu finden. Das Ergebnis ist ein Markt, in dem die Kosten für Intelligenz sich von den Kosten des Siliziums, das sie antreibt, entkoppeln.

Für Entwickler ist die Botschaft klar: Das günstigste Token ist nicht immer die kosteneffektivste Lösung. Die Gesamtbesitzkosten hängen jetzt von der Token-Effizienz, der Hardware-Auslastung und den spezifischen Latenzanforderungen der Aufgabe ab. Da Inferenz zum Hauptkampfplatz für KI wird, verschiebt sich der Fokus von der rohen Modellkapazität hin zur Ökonomie der Bereitstellung.

Kommentare 0

Quellen

9
  1. 01Claude Haiku 5.5 arrives with massive price cutsEN
  2. 02Rising cost of memory, Microsoft explains why Windows 11 will use less RAMEN
  3. 03Why AI Inference Infrastructure Fails Differently From Traditional ServicesEN
  4. 04Launch HN: Magnitude (YC S25) – Self-optimizing inference engineEN
  5. 05Vertical Data Centers Face Cost-Proximity Trade-OffsEN
  6. 06FTC Issues Letters Warning Hospitals Against Deceptive Pricing PracticesEN
  7. 07McDonald’s sued for allegedly using AI tool to determine pricingEN
  8. 08Efficient Best-of-N policy evaluation for inference-time alignmentEN
  9. 09Understanding and Mitigating Inference-Time Overreliance Using Agentic MemoryEN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Lena Brandt

Lena Brandt

KI, Modelle und Technik

Lena Brandt schreibt für FLASH24 über Technik, KI und Modelle sowie Medien und Internet und stützt sich dabei auf Herstellerangaben, Studien und öffentlich zugängliche Datensätze, statt Pressemitteilungen ungeprüft zu übernehmen. Bei Modellvergleichen kontrolliert sie Benchmark-Werte, Trainingsdaten und Versionsnummern und rechnet Angaben zu Rechenleistung und Kosten selbst nach. Sie spricht mit Entwicklern und Forschern, wartet auf angekündigte Updates und vergleicht Releases, bevor sie eine Einschätzung abgibt. Privat beschäftigt sie sich mit 3D-Druck, alten Rechnern und der Frage, wie Modelle aus Internetmüll lernen – Themen, die regelmäßig in ihre Texte einfließen. Sie publiziert keine Zahlen, deren Quelle sie nicht selbst überprüfen konnte.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.