Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

Chinesische offene Modelle: Der Preisvorteil ist real, reicht aber nicht

Chinesische Open-Weight-Modelle verkleinern den Leistungsabstand zu geringeren Kosten. Doch der tatsächliche Aufwand pro erledigter Aufgabe kann steigen, und das amerikanische Ökosystem bleibt bei Cloud und proprietären Daten stark.

TechnologieAnalyseLena BrandtVeröffentlicht: 26. September 20265 Min. LesezeitQuellen 3
Chinesische offene Modelle: Der Preisvorteil ist real, reicht aber nicht

Kaum etwas hat den Markt für künstliche Intelligenz in den vergangenen zwei Jahren so stark verändert wie die Verbreitung chinesischer Modelle mit offenen Gewichten. Die Analyse der Bank Lombard Odier, die CorCom aufgegriffen hat, räumt ein: Diese Modelle haben den Leistungsabstand zu westlichen Alternativen verkleinert, und das zu deutlich niedrigeren Kosten. Zugleich warnt sie, dass ihre Vorteile teilweise überschätzt werden.

Die Kosten pro Aufgabe, nicht pro Token

Der Preis pro Token misst nicht den tatsächlichen Aufwand. Destillation und die Auswahl des für die einzelne Aufgabe passendsten Modells können die Kosten pro abgeschlossener Tätigkeit und die dafür nötige Zeit in die Höhe treiben. Ein Teil der anfänglichen Ersparnis ist damit wieder weg. Gleichzeitig weitet ein sinkender Preis die Nutzung eher aus, statt die Gesamtausgaben zu senken. Das ist das Jevons-Paradox: Eine billigere Ressource wird in größerer Menge verbraucht.

In der Analyse behalten die Vereinigten Staaten dank Cloud-Infrastruktur und proprietärer Daten eine solide Position. Frontier-Modelle rechtfertigen bei komplexen Aufgaben weiterhin einen Preisaufschlag. Bei der Hardware bleibt die amerikanische Dominanz bei fortgeschrittenen Beschleunigern der wichtigste Vorteil. China gleicht das mit reichlich Energie aus und mit dem Tempo, in dem es verfügbare Rechenleistung in Betrieb nimmt.

Ein konkretes Beispiel

Das jüngste Beispiel kommt von DeepSeek. Das Modell V4.1 Flash wurde am 10. September 2026 auf das nationale Supercomputernetz Chinas aufgeschaltet und ist über die API von der Dienstseite des Modells aus erreichbar. Es verwendet eine Mixture-of-Experts-Architektur mit 552 Milliarden Parametern und einer asymmetrischen Causal-Encoder-Decoder-Struktur. Am Eingang werden 8 Milliarden Parameter aktiviert, am Ausgang 16 Milliarden. Das offizielle Datenblatt nennt eine Verringerung des Cache-Speichers auf ein Viertel des HBM-Bedarfs und auf ein Achtel des Bedarfs auf SSD gegenüber der vorigen Generation. Der Cache fasst 890 Byte pro Token, der Kontext bis zu einer Million Token. Veröffentlicht ist das Modell unter MIT-Lizenz und in den Quantisierungsformaten FP8, BF16, GPTQ, AWG und GGUF.

„Das günstigste Modell ist nicht das, das pro Token am wenigsten kostet, sondern das, das das Problem beim ersten Versuch löst.“ So lautet die operative Regel, die aus der Analyse hervorgeht.

Was noch zu tun bleibt

Für Unternehmen folgt daraus eine methodische Konsequenz: Kosten pro Ergebnis messen, nicht pro Volumen. Das Modell an der konkreten Arbeitslast bewerten, nicht an allgemeinen Benchmarks. Und die Portabilität zwischen Anbietern erhalten, um bei Preisänderungen nicht gebunden zu sein. Die Verfügbarkeit von Modellen mit offenen Gewichten ist unter diesem Gesichtspunkt eine Versicherung gegen das Risiko der Abhängigkeit.

Kommentare 0

Quellen

3
  1. 01CorCom — AI, la Cina sfida i big USA sui prezzi ma l'ecosistema americano tieneIT
  2. 02IT之家 — DeepSeek V4.1 Flash sulla rete nazionale dei supercomputerZH
  3. 03DeepSeek — V4.1 Flash release notes (architettura, cache, licenza MIT)EN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Lena Brandt

Lena Brandt

KI, Modelle und Technik

Lena Brandt schreibt für FLASH24 über Technik, KI und Modelle sowie Medien und Internet und stützt sich dabei auf Herstellerangaben, Studien und öffentlich zugängliche Datensätze, statt Pressemitteilungen ungeprüft zu übernehmen. Bei Modellvergleichen kontrolliert sie Benchmark-Werte, Trainingsdaten und Versionsnummern und rechnet Angaben zu Rechenleistung und Kosten selbst nach. Sie spricht mit Entwicklern und Forschern, wartet auf angekündigte Updates und vergleicht Releases, bevor sie eine Einschätzung abgibt. Privat beschäftigt sie sich mit 3D-Druck, alten Rechnern und der Frage, wie Modelle aus Internetmüll lernen – Themen, die regelmäßig in ihre Texte einfließen. Sie publiziert keine Zahlen, deren Quelle sie nicht selbst überprüfen konnte.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.