Chinesische Anbieter von Rechenleistung setzen auf Software
„Anderthalb Karten 6000D schlagen eine B300“, so fasst ein chinesischer Cloud-Anbieter die Optimierung seiner Inferenz zusammen. Inspur beziffert die Lücke bei der Rechenleistung bis 2030 auf 381 Milliarden Dollar.

In der Diskussion über die Kosten von KI geht es fast immer um den Preis der Grafikkarten. Der chinesische Infrastrukturanbieter METASTONE hält dagegen: Die größeren Reserven stecken in der Software. Das Team hat den Betrieb des Modells DeepSeek-V4.1-Flash so umgebaut, dass es auf acht Karten läuft, die nur über PCIe verbunden sind. Eine schnelle Verbindung zwischen den Prozessoren braucht es dafür nicht.
Der Eingangsdurchsatz stieg von 1932 auf 13 274 Token pro Sekunde, also um das 6,87-Fache. Möglich wurde das durch einen ergänzten Rechenkern, eine neue Kommunikation zwischen den Karten und die erneute Nutzung des Kontext-Caches. Das Unternehmen fasst den Effekt in einem Satz zusammen: „Anderthalb Karten 6000D schlagen eine B300.“ Günstigere, langsamere Hardware gewinnt also gegen teurere, wenn die Verarbeitung gut aufgeteilt ist. METASTONE verwaltet mehr als 20 000 P Rechenleistung in mehreren Rechenzentren und gibt eine Verfügbarkeit seiner Dienste von über 99,95 Prozent an.
Die zweite Stimme kommt von Inspur. Auf der Konferenz AICC 2026 stützte sich das Unternehmen auf Daten von IDC. Demnach ist die weltweite Nachfrage nach Rechenleistung für KI im Jahr 2024 zu 79 Prozent gedeckt, 2027 zu 71 Prozent und 2030 zu etwa 77 Prozent. Die Lücke zwischen Bedarf und Angebot erreicht 380,9 Milliarden Dollar, zehnmal mehr als 2024. Der Token-Verbrauch soll kumuliert um mehr als das 48-Fache pro Jahr wachsen. Die Inferenzaufgaben sollen 2030 bei 4000 Billionen pro Jahr liegen.
Inspur antwortet mit Hardware. Das System SD200 Ultra fasst 128 Chips, 8 TB Speicher und 64 TB Festplattenplatz in einer Maschine. Damit sollen sich Modelle mit einer Billion Parametern betreiben lassen, ohne sie auf viele Schränke zu verteilen. Die Latenz der Kommunikation von allen zu allen sinkt auf 0,69 Mikrosekunden.
Für Käufer von Rechenleistung heißt das: Der Preis pro Token ist nicht mehr allein eine Funktion des Hardwarepreises. Immer häufiger entscheidet, wie gut ein Anbieter nutzt, was er schon hat. Das verändert die Regeln für Ausschreibungen von Cloud-Diensten.
Die praktische Folge: Wenn schon das Umschreiben der Cache-Verwaltung und die Verteilung der Arbeit auf die vorhandenen Chips einen mehrfachen Durchsatzgewinn bringen, sollte dem Kauf einer neuen Hardware-Generation ein Software-Audit vorausgehen. Ein Anbieter, der gemessene Werte auf derselben Infrastruktur vorlegen kann, verkauft heute keine Rechenleistung, sondern Einsparung. Zugleich ist das die einfachste Antwort chinesischer Rechenzentrumsbetreiber auf Exportbeschränkungen: Wo die stärksten Karten nicht nachgekauft werden können, zählt vor allem die Effizienz dessen, was bereits im Serverraum steht.
Quellen
2Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.
Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.
Kommentare
0- Noch keine Kommentare — seien Sie der Erste.