Chinesische offene Modelle: Der Preisvorteil ist real, reicht aber nicht
Chinesische Open-Weight-Modelle verkleinern den Leistungsabstand zu geringeren Kosten. Doch der tatsächliche Aufwand pro erledigter Aufgabe kann steigen, und das amerikanische Ökosystem bleibt bei Cloud und proprietären Daten stark.

Kaum etwas hat den Markt für künstliche Intelligenz in den vergangenen zwei Jahren so stark verändert wie die Verbreitung chinesischer Modelle mit offenen Gewichten. Die Analyse der Bank Lombard Odier, die CorCom aufgegriffen hat, räumt ein: Diese Modelle haben den Leistungsabstand zu westlichen Alternativen verkleinert, und das zu deutlich niedrigeren Kosten. Zugleich warnt sie, dass ihre Vorteile teilweise überschätzt werden.
Die Kosten pro Aufgabe, nicht pro Token
Der Preis pro Token misst nicht den tatsächlichen Aufwand. Destillation und die Auswahl des für die einzelne Aufgabe passendsten Modells können die Kosten pro abgeschlossener Tätigkeit und die dafür nötige Zeit in die Höhe treiben. Ein Teil der anfänglichen Ersparnis ist damit wieder weg. Gleichzeitig weitet ein sinkender Preis die Nutzung eher aus, statt die Gesamtausgaben zu senken. Das ist das Jevons-Paradox: Eine billigere Ressource wird in größerer Menge verbraucht.
In der Analyse behalten die Vereinigten Staaten dank Cloud-Infrastruktur und proprietärer Daten eine solide Position. Frontier-Modelle rechtfertigen bei komplexen Aufgaben weiterhin einen Preisaufschlag. Bei der Hardware bleibt die amerikanische Dominanz bei fortgeschrittenen Beschleunigern der wichtigste Vorteil. China gleicht das mit reichlich Energie aus und mit dem Tempo, in dem es verfügbare Rechenleistung in Betrieb nimmt.
Ein konkretes Beispiel
Das jüngste Beispiel kommt von DeepSeek. Das Modell V4.1 Flash wurde am 10. September 2026 auf das nationale Supercomputernetz Chinas aufgeschaltet und ist über die API von der Dienstseite des Modells aus erreichbar. Es verwendet eine Mixture-of-Experts-Architektur mit 552 Milliarden Parametern und einer asymmetrischen Causal-Encoder-Decoder-Struktur. Am Eingang werden 8 Milliarden Parameter aktiviert, am Ausgang 16 Milliarden. Das offizielle Datenblatt nennt eine Verringerung des Cache-Speichers auf ein Viertel des HBM-Bedarfs und auf ein Achtel des Bedarfs auf SSD gegenüber der vorigen Generation. Der Cache fasst 890 Byte pro Token, der Kontext bis zu einer Million Token. Veröffentlicht ist das Modell unter MIT-Lizenz und in den Quantisierungsformaten FP8, BF16, GPTQ, AWG und GGUF.
„Das günstigste Modell ist nicht das, das pro Token am wenigsten kostet, sondern das, das das Problem beim ersten Versuch löst.“ So lautet die operative Regel, die aus der Analyse hervorgeht.
Was noch zu tun bleibt
Für Unternehmen folgt daraus eine methodische Konsequenz: Kosten pro Ergebnis messen, nicht pro Volumen. Das Modell an der konkreten Arbeitslast bewerten, nicht an allgemeinen Benchmarks. Und die Portabilität zwischen Anbietern erhalten, um bei Preisänderungen nicht gebunden zu sein. Die Verfügbarkeit von Modellen mit offenen Gewichten ist unter diesem Gesichtspunkt eine Versicherung gegen das Risiko der Abhängigkeit.
Quellen
3- 01CorCom — AI, la Cina sfida i big USA sui prezzi ma l'ecosistema americano tieneIT
- 02IT之家 — DeepSeek V4.1 Flash sulla rete nazionale dei supercomputerZH
- 03DeepSeek — V4.1 Flash release notes (architettura, cache, licenza MIT)EN
Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.
Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.
Kommentare
0- Noch keine Kommentare — seien Sie der Erste.