Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

Immer mehr Rechner für Inferenzkosten, GPU-Preise bleiben undurchsichtig

Ein browserbasierter Rechner vom 23. September vergleicht die Inferenzkosten von 27 Modellen. Sein Autor warnt selbst: Das Ergebnis ist eine Planungsgröße, kein Angebot eines Anbieters. Wenige Tage später rückte ein separates Benchmark die Kosten für eine Stunde Betrieb eines Modells ins gleiche Licht.

KI & ModelleAnalyseLena BrandtVeröffentlicht: 28. September 20263 Min. LesezeitQuellen 5
Immer mehr Rechner für Inferenzkosten, GPU-Preise bleiben undurchsichtig

Der jüngste Beitrag zur Debatte um Inferenzkosten ist keine Preisankündigung, sondern ein Rechner. Flavio Copes veröffentlichte am 23. September einen Inference Cost Calculator. Er vergleicht 27 Modelle von OpenAI, Anthropic, Google, xAI, Mistral, OpenRouter und Workers AI unter identischen Annahmen.

Man gibt täglich aktive Nutzer ein, Aufrufe pro Nutzer, Eingabe- und Ausgabe-Token pro Aufruf und optional eine Trefferquote des Prompt-Caches. Der Rechner liefert eine Monatsrechnung. Zugleich weist er darauf hin, dass die Zahlen aus veröffentlichten API-Preisen stammen. Batch-Preise, Unternehmensrabatte, Zuschläge für Bilder oder Tools und selbst gebaute Caching-Schichten bleiben außen vor.

Dieser Vorbehalt wiegt schwerer als die Rangliste.

Das Benchmark, das eine Stunde Denken bepreist

Am 26. September veröffentlichte StarSkirmish einen anderen Kostenvergleich. Jedes LLM bekommt eine Stunde Zeit, einen Protoss-Bot in C++ für StarCraft: Brood War zu schreiben. Danach treten die Bots gegeneinander an und gegen Gegner, die Menschen geschrieben haben. Das Feld umfasst 50 LLM-Bots aus 10 Modellen, dazu 3 Demo-Bots und 9 kompetitive Bots von Menschen, insgesamt 62 Teilnehmer. Sie laufen auf Prime-Intellect-Sandboxes.

GPT-6 Astra und Claude Opus 5.5 liegen laut der eigenen Auswertung des Projekts funktional gleichauf an der Spitze. GPT-6 Sol steht zusammen mit ihnen klar über dem Rest. Das Benchmark trägt zudem den Score gegen die durchschnittlichen API-Kosten eines einstündigen Laufs auf einer logarithmischen Skala auf. In diesem Vergleich, so die Autoren, biete GPT-6 Sol ein einzigartig gutes Preis-Leistungs-Verhältnis.

Das ist eine Betrachtung der Kosten pro Fähigkeit, nicht pro Token. Das Benchmark räumt auch eine Grenze ein: Moderne Reasoning-Modelle profitieren inzwischen deutlich von Denkphasen, die länger als eine Stunde dauern. Längere Varianten sind geplant.

Warum öffentliche Zahlen schwer zu vertrauen sind

Keine dieser beiden Quellen nennt einen GPU-Preis. Dafür enthält das Dossier eine Übersicht, die am 20. September bei Nexlab erschien. Sie vergleicht selbst gehostete Orchestratoren wie LocalAI, exo, GPUStack, vLLM, Ollama, Xinference und CoderAI. Die Sternzahlen stammen aus der GitHub-API vom 20. September. Wo ein Merkmal nicht bestätigt werden konnte, sagt die Tabelle das ausdrücklich, statt zu raten.

Die nützlichen Unterscheidungen der Übersicht drehen sich überhaupt nicht um den Preis. Sie trennt drei Fragen: Kann ein Modell über mehr als eine Maschine laufen? Wird eine Folgerunde dorthin geleitet, wo ihr KV- oder Prefix-Cache bereits liegt? Kann der Server selbst eine GPU mieten? vLLM unterstützt bei 92.000 Sternen in dieser Momentaufnahme Tensor- und Pipeline-Parallelität über Ray sowie Prefix-Caching pro Instanz. Ollama ist bei 181.000 Sternen eine Maschine und ein Modell zur Zeit. Eine Cluster-Geschichte gibt es dort nicht, außer dem Round-Robining mehrerer URLs hinter Open WebUI.

Das Geld steckt in der Hardware, nicht in der Software. Brasiliens PV-Markt ist keine KI-Geschichte, doch pv magazine berichtete am 26. September, dass die durchschnittlichen Preise für PV-Anlagen im Land zwischen Januar und Juni 2026 für Projekte bis 300 kW um 7% stiegen. Grundlage ist die Studie Distributed Energy Solutions von Greener. Die Kit-Kosten für 4-kW-Anlagen stiegen um 18,3%, von BRL 1,42/W auf BRL 1,68/W.

Anderes Gut, gleiches Problem: Die Schlagzeilenzahl bewegt sich, weil sich die Komponenten bewegen.

Was die Forschung zur Ausgabeseite sagt

Ein weiteres Puzzleteil der Kostenbetrachtung liegt auf der Nachfrageseite. Ein am 14. September bei arXiv eingereichtes und am 17. September überarbeitetes Paper, SlopShape, beschreibt ein Instrument mit 214 Merkmalen. Es erkennt KI-generierte kommerzielle Webinhalte allein anhand struktureller Signaturen. Von einem LLM angewendet und gegen menschliche Annotation validiert, erreichte es 98,0 Macro-F1 auf zurückgehaltenen Unternehmen und 98,1, als jeder KI-Beitrag von seinem eigenen Modell umformuliert wurde. Autor ist Jochen Madler von Sitefire.

Günstigere Inferenz erzeugt mehr Text. Diesen Text zu erkennen ist inzwischen eine messbare Aufgabe mit veröffentlichter Genauigkeit. Das ist eine eigene Art von Infrastrukturkosten.

Keine dieser Quellen ist sich einig, was Inferenz kosten sollte, weil keine dasselbe misst. Der Rechner misst eine hypothetische Rechnung. Das Benchmark misst Fähigkeit pro Stunde API-Ausgaben. Die Orchestrator-Übersicht misst Merkmale, nicht Rechnungen. Behandeln Sie jede einzelne Zahl als Ausgangsannahme.

Kommentare 0

Quellen

5
  1. 01Inference Cost CalculatorEN
  2. 02StarSkirmish BenchEN
  3. 03Self-hosted inference orchestrators compared: LocalAI, exo, GPUStack, vLLMEN
  4. 04PV system costs increase by 7% in Brazil in H1EN
  5. 05SlopShape: Identifying AI-Generated Commercial Web ContentEN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Lena Brandt

Lena Brandt

KI, Modelle und Technik

Lena Brandt schreibt für FLASH24 über Technik, KI und Modelle sowie Medien und Internet und stützt sich dabei auf Herstellerangaben, Studien und öffentlich zugängliche Datensätze, statt Pressemitteilungen ungeprüft zu übernehmen. Bei Modellvergleichen kontrolliert sie Benchmark-Werte, Trainingsdaten und Versionsnummern und rechnet Angaben zu Rechenleistung und Kosten selbst nach. Sie spricht mit Entwicklern und Forschern, wartet auf angekündigte Updates und vergleicht Releases, bevor sie eine Einschätzung abgibt. Privat beschäftigt sie sich mit 3D-Druck, alten Rechnern und der Frage, wie Modelle aus Internetmüll lernen – Themen, die regelmäßig in ihre Texte einfließen. Sie publiziert keine Zahlen, deren Quelle sie nicht selbst überprüfen konnte.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.