Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

Benchmark der Inference Academy: DeepSeek V4 Flash kostet bei kalten Anfragen 14,9-mal mehr

Wer denselben Prompt zweimal an DeepSeek V4 Flash schickt, zahlt beim zweiten Mal unter Umständen 14,9-mal weniger. Das zeigt ein Serving-Benchmark, den inference.academy am 7. September veröffentlicht hat. Er umfasst 14 Anbieter und drei Eingabegrößen.

KI & ModelleNachrichtLena BrandtVeröffentlicht: 28. September 20263 Min. LesezeitQuellen 1
Benchmark der Inference Academy: DeepSeek V4 Flash kostet bei kalten Anfragen 14,9-mal mehr

Gemessen wurde nicht die Qualität der Antworten. Inference.academy baute einen kontrollierten Aufbau und testete Eingabegrößen von 1.000, 10.000 und 100.000 Token, jeweils mit einem Budget von 100 oder 1.000 Ausgabe-Token. Die Temperatur lag bei null, das Reasoning war abgeschaltet. Kalte Anfragen nutzten ein eindeutiges Präfix, warme Anfragen wiederholten denselben Prompt. Die Seite nennt die Ergebnisse Serving-Messungen, keine Bewertung der Aufgabequalität.

Die Kosten ergeben sich aus den gesamten Anfragekosten geteilt durch die Eingabe-Token, multipliziert mit 1M; die Ausgabekosten sind eingerechnet. Das ist wichtig, weil der auf einer Anbieterseite genannte Eingabepreis nicht das ist, was der Benchmark vergleicht. Die Studie nennt Kostenpunkte über 13 Routen für die Bedingung 10.000 Eingabe, 100 Ausgabe-Token, kalter Cache.

Die 14,9-mal sind der größte Abstand, den der Benchmark hervorhebt. Bei DeepSeeks Anfragen mit 100.000 Eingabe- und 100 Ausgabe-Token kosteten warme Aufrufe in dieser Stichprobe 14,9-mal weniger als kalte. Warm heißt, der Prompt wurde wiederholt. Der gemessene Cache-Anteil bestimmt, wie viel Eingabearbeit tatsächlich zum nicht gecachten Satz abgerechnet wurde.

Geschwindigkeit ist eine eigene Achse

Telnyx lag bei der mittleren Generierungsgeschwindigkeit in allen 12 getesteten Bedingungen vorn. Die Latenz bis zum ersten Token folgte nicht demselben Muster. Laut Benchmark hing das schnellste erste Token von der Form der Anfrage ab. Ein Anbieter, der bei einem 1.000-Token-Prompt bei der Zeit bis zum ersten Token gewinnt, muss also nicht der sein, der bei 100.000 gewinnt.

"Where you send a prompt changes what you pay, how long you wait, and whether the call succeeds."

Mit diesem Zitat umreißt inference.academy die Übung. Die Zeitmessungs-Panels nutzen kalte Anfragen mit einem Ausgabe-Budget von 100 Token und einer gemeinsamen Achsenskala. TTFT läuft vom Start der Anfrage bis zum ersten Inhalts- oder Reasoning-Delta, das der Client empfängt, und schließt Netzwerk- und Wartezeit ein. P90 verwendet lineare Interpolation zwischen geordneten Beobachtungen. Die Dekodiergeschwindigkeit wird nach Beginn des Streamings gemessen und als abgeschlossene Token geteilt durch die verstrichene Zeit vom ersten bis zum letzten Ausgabe-Delta angegeben. Nicht gestreamte Antworten erhalten gar keine Messung der Dekodiergeschwindigkeit.

Das Routing ist eine weitere Variable. Der Benchmark protokollierte die Upstream-Namen, die OpenRouter für jede Anfrageform und Cache-Bedingung zurückgab. Er merkt an, dass ein wiederholter Prompt einen anderen Upstream erreichen kann, was dessen Cache-Verhalten ändert.

In der warmen Bedingung 10.000 auf 100 entfielen 29 Aufrufe auf Together, 20 auf Novita und 17 auf CoreWeave. In der kalten Bedingung 10.000 auf 100 erschien Baidu 15-mal und Relace 13-mal. Die Seite stellt ausdrücklich klar, dass die Segmentbreite der Anteil der Aufrufe ist und dass die Namen gemeldete Upstreams sind, keine verifizierten Maschinen. Sie schreibt auch, dass die Verteilung allein nicht belegt, warum sich das Routing geändert hat.

Die Ausfallraten sind nach Eingabeziel und Ausgabe-Budget aufgeschlüsselt, kalt und warm getrennt verglichen. Der Benchmark warnt, dass eine Route anders reagieren kann, wenn derselbe Prompt eine längere Antwort verlangt. HTTP-, Transport- und Antwortfehler zählen alle als Ausfälle, die genauen Zahlen stehen in Tabellen unter den Grafiken. Null bedeutet, dass in dieser Stichprobe kein Ausfall beobachtet wurde, keine Garantie.

Die praktische Lehre für alle, die Inferenzrechnungen bezahlen, ist enger als die Schlagzeile. Caching verändert die Rechnung bei langen Eingaben um mehr als eine Größenordnung, und der Anbieter, den man über einen Router erreicht, ist nicht fest. Der Benchmark deckt in seinem Kosten-Streudiagramm 14 Anbieter und 13 Routen ab. Seine eigene Einordnung ist die sicherste Zusammenfassung: Es sind Serving-Messungen, und sie beschreiben, was in dieser Stichprobe geschah.

Kommentare 0

Quellen

1
  1. 01DeepSeek V4 Flash across 14 providers: cost, speed and cachingEN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Lena Brandt

Lena Brandt

KI, Modelle und Technik

Lena Brandt schreibt für FLASH24 über Technik, KI und Modelle sowie Medien und Internet und stützt sich dabei auf Herstellerangaben, Studien und öffentlich zugängliche Datensätze, statt Pressemitteilungen ungeprüft zu übernehmen. Bei Modellvergleichen kontrolliert sie Benchmark-Werte, Trainingsdaten und Versionsnummern und rechnet Angaben zu Rechenleistung und Kosten selbst nach. Sie spricht mit Entwicklern und Forschern, wartet auf angekündigte Updates und vergleicht Releases, bevor sie eine Einschätzung abgibt. Privat beschäftigt sie sich mit 3D-Druck, alten Rechnern und der Frage, wie Modelle aus Internetmüll lernen – Themen, die regelmäßig in ihre Texte einfließen. Sie publiziert keine Zahlen, deren Quelle sie nicht selbst überprüfen konnte.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.