Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

Inference-Preise splittern: Cache-Treffer, Sprachlatenz und Selbsthosting

Anfragen an DeepSeek V4 Flash mit 100k Eingabe-Tokens kosten in einer kontrollierten Stichprobe 14,9-mal weniger, wenn der Cache warm ist, als wenn er kalt ist. Das geht aus einem Benchmark hervor, den inference.academy am 7. September 2026 veröffentlicht hat.

KI & ModelleAnalyseLena BrandtVeröffentlicht: 27. September 20265 Min. LesezeitQuellen 3
Inference-Preise splittern: Cache-Treffer, Sprachlatenz und Selbsthosting

Dieses eine Verhältnis, gemessen über 14 Routen, fasst zusammen, was in diesem Jahr mit den Inference-Preisen passiert ist. Der ausgewiesene Preis pro Million Tokens entscheidet die Rechnung nicht mehr. Cache-Zustand, Anfrageform und der Upstream, der antwortet, verschieben die Kosten inzwischen um eine Größenordnung.

Der Aufbau von inference.academy war bewusst eng gefasst. Gemessen wurde bei 1.000, 10.000 und 100.000 Eingabe-Tokens, jeweils mit einem Budget von 100 oder 1.000 Ausgabe-Tokens, Temperatur 0 und ohne Reasoning. Kalte Anfragen trugen ein eindeutiges Präfix, warme Anfragen wiederholten denselben Prompt. Der Autor bezeichnete das als Serving-Messungen, nicht als Bewertung der Aufgabenqualität. Die Kosten berechnete er als gesamte Anfragegebühren geteilt durch Eingabe-Tokens, multipliziert mit 1M, einschließlich der Ausgabegebühren. Es ist also nicht der gelistete Preis für Eingabe-Tokens.

Der Cache-Anteil ist die Summe der gecachten Eingabe-Tokens geteilt durch die Summe der Eingabe-Tokens bei erfolgreichen Anfragen, die beides melden. Es ist ein Token-Anteil, nicht der Prozentsatz der Anfragen, die den Cache treffen. Die warme Sequenz enthält ihre erste Anfrage.

Das Routing brachte eine zweite Variable ins Spiel, die die Untersuchung nicht vollständig erklären konnte. Bei 1.000 Eingabe- und 100 Ausgabe-Tokens mit kaltem Cache gab OpenRouter 20 Upstream-Namen zurück, mit Baidu bei 18 Aufrufen, Relace bei 14 und AkashML bei 13. Dieselbe Anfrageform warm ergab 14 Namen, angeführt von Relace mit 24, CoreWeave mit 16 und DeepSeek mit 11. Der Bericht merkt an, dass ein wiederholter Prompt einen anderen Upstream erreichen kann, was dessen Cache-Verhalten ändert. Die Verteilung allein belegt nicht, warum sich das Routing ändert.

Telnyx führte die mittlere Generierungsgeschwindigkeit in 12 von 12 Bedingungen an, so der Benchmark. Das schnellste erste Token hing von der Anfrageform ab. Ein Modell, das bei einem kurzen Prompt schnell wirkt, hält diese Position bei einem langen also nicht zwingend.

Sprachmodelle konkurrieren um Millisekunden, dann um den Preis

Latenz-Benchmarks in der Sprachverarbeitung folgen einem ähnlichen Muster. Nari Labs schrieb am 14. September 2026, das Unternehmen führe Mitte September sowohl die Speech-to-Text- als auch die Text-to-Speech-Benchmarks von Coval an: Platz eins bei der Latenz und Platz zwei bei der Wortfehlerrate für STT, Platz zwei bei der Latenz und Platz eins bei der WER für TTS. Es fügt einen Vorbehalt hinzu, den man behalten sollte: Die Werte von Coval können sich alle 30 Minuten ändern.

Der Fast-Endpunkt Qwen3-ASR des Unternehmens liegt bei der Zeit bis zum finalen Segment auf Platz eins, mit einem p50 von 44 ms und einer WER von 3,6%. Damit steht er hinter AssemblyAIs Universal 3.5 Pro mit 3,5% auf Platz zwei. Nari sagt, der Fast-Endpunkt teile sich bei 0,12 US-Dollar pro Stunde den zweitniedrigsten Preis unter den Modellen mit bekannten öffentlichen Tarifen in Covals Preisverzeichnis. Universal 3.5 Pro koste 3,75-mal mehr, Deepgram Nova 3 2,4-mal mehr. Der Standard-Endpunkt wäre mit 0,06 US-Dollar pro Stunde am günstigsten.

Auf der Synthese-Seite liegt Naris Qwen3-TTS Fast bei der Zeit bis zum ersten Audio auf Platz zwei, mit einem p50 von 63 ms und einer WER von 3,8%, was laut Unternehmen Platz eins bei der Qualität bedeutet. Nur vui von Fluxions erreicht eine niedrigere mediane TTFA, nämlich 49 ms, mit einem 300M-Parameter-Modell im Vergleich zum 1,7B Qwen3-TTS, den Nari betreibt.

Bei 10 US-Dollar pro 1M Zeichen teilt sich der Fast-Endpunkt laut Nari den niedrigsten Preis in Covals Verzeichnis. ElevenLabs Eleven v3 Conversational kostet 5-mal mehr, Cartesia Sonic 3.6 6,5-mal mehr.

Der schärfste Vergleich im Beitrag betrifft Endpunkte, die dieselben Gewichte bedienen. Nari berichtet, der offizielle Qwen3 TTS Flash Realtime-Endpunkt liege bei 8,8% WER und einer medianen TTFA im Bereich von Hunderten Millisekunden. Basetens dedizierter Qwen3-TTS-Endpunkt kommt auf 6,0% WER und eine mediane TTFA im niedrigen Hunderterbereich. Dasselbe Modell, anderer Serving-Stack, andere Zahlen.

Selbsthosting hat auch einen Preis, und der liegt im Betrieb

Nexlabs Erhebung vom 20. September 2026 zu selbstgehosteten Orchestratoren behandelt LocalAI, exo, GPUStack, Xinference, Ollama, vLLM und CoderAI, mit GitHub-Sternzahlen, die an dem Tag über die API abgerufen wurden. Die nützliche Spalte sind nicht die Sterne, sondern das, was jedes Werkzeug über mehrere Maschinen hinweg leistet.

  • Ollama, 181.000 Sterne, ist eine Maschine und ein Modell zur Zeit, ohne Cluster-Geschichte über das Round-Robin mehrerer Ollama-URLs hinaus.
  • vLLM, 92.000 Sterne, beherrscht Tensor- und Pipeline-Parallelität über Ray, verwaltet aber keine Modelle, Nutzer oder Platzierung.
  • LocalAI, 49.000 Sterne, ergänzte im Juni 2026 einen verteilten Modus mit libp2p-Discovery und einem Router, der VRAM und Präfix-Caches kennt; der rohe LLM-Durchsatz bleibt laut Erhebung um einige zehn Prozent hinter einer dedizierten Engine zurück.
  • exo, 47.000 Sterne, skaliert auf Apple Silicon mit MLX und RDMA über Thunderbolt 5 und meldet 3,2x auf vier Geräten, ist im September 2026 unter Linux aber CPU-only.
  • GPUStack, 5.700 Sterne, bietet Nutzer, Schlüssel, Messung und Prometheus und unterstützt neun Beschleuniger-Anbieter.

LiteLLM, 59.000 Sterne, routet zwischen Endpunkten und Clouds, betreibt aber kein Modell. Eine Unterscheidung, die laut Erhebung oft übersehen wird.

Das Muster über alle drei Quellen ist, dass Kosten keine einzelne veröffentlichte Rate mehr sind. Ein Gateway, das den Cache-Zustand ignoriert, ein Sprach-Endpunkt, der die Tail-Latenz ignoriert, oder ein Orchestrator, der Ausfallraten ignoriert, erzeugen jeweils eine Rechnung oder ein Nutzererlebnis, das der Listenpreis nicht vorhergesagt hat.

Was keine dieser Quellen klärt, ist, wie dauerhaft die Lücken sind. Cache-Rabatte hängen vom Routing ab, das Routing ändert sich zwischen Aufrufen, und Benchmark-Positionen verschieben sich innerhalb einer Stunde. Wer zwei Anbieter anhand einer einzigen Zahl vergleicht, vergleicht das Falsche.

Kommentare 0

Quellen

3
  1. 01DeepSeek V4 Flash across 14 providers: cost, speed and cachingEN
  2. 02Show HN: Nari Qwen3-TTS and Qwen3-ASREN
  3. 03Self-hosted inference orchestrators compared: LocalAI, exo, GPUStack, vLLMEN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Lena Brandt

Lena Brandt

KI, Modelle und Technik

Lena Brandt schreibt für FLASH24 über Technik, KI und Modelle sowie Medien und Internet und stützt sich dabei auf Herstellerangaben, Studien und öffentlich zugängliche Datensätze, statt Pressemitteilungen ungeprüft zu übernehmen. Bei Modellvergleichen kontrolliert sie Benchmark-Werte, Trainingsdaten und Versionsnummern und rechnet Angaben zu Rechenleistung und Kosten selbst nach. Sie spricht mit Entwicklern und Forschern, wartet auf angekündigte Updates und vergleicht Releases, bevor sie eine Einschätzung abgibt. Privat beschäftigt sie sich mit 3D-Druck, alten Rechnern und der Frage, wie Modelle aus Internetmüll lernen – Themen, die regelmäßig in ihre Texte einfließen. Sie publiziert keine Zahlen, deren Quelle sie nicht selbst überprüfen konnte.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.