Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

Chinesische Anbieter von Rechenleistung setzen auf Software

„Anderthalb Karten 6000D schlagen eine B300“, so fasst ein chinesischer Cloud-Anbieter die Optimierung seiner Inferenz zusammen. Inspur beziffert die Lücke bei der Rechenleistung bis 2030 auf 381 Milliarden Dollar.

WirtschaftAnalyseDr. Miriam SeidelVeröffentlicht: 26. September 20265 Min. LesezeitQuellen 2
Chinesische Anbieter von Rechenleistung setzen auf Software

In der Diskussion über die Kosten von KI geht es fast immer um den Preis der Grafikkarten. Der chinesische Infrastrukturanbieter METASTONE hält dagegen: Die größeren Reserven stecken in der Software. Das Team hat den Betrieb des Modells DeepSeek-V4.1-Flash so umgebaut, dass es auf acht Karten läuft, die nur über PCIe verbunden sind. Eine schnelle Verbindung zwischen den Prozessoren braucht es dafür nicht.

Der Eingangsdurchsatz stieg von 1932 auf 13 274 Token pro Sekunde, also um das 6,87-Fache. Möglich wurde das durch einen ergänzten Rechenkern, eine neue Kommunikation zwischen den Karten und die erneute Nutzung des Kontext-Caches. Das Unternehmen fasst den Effekt in einem Satz zusammen: „Anderthalb Karten 6000D schlagen eine B300.“ Günstigere, langsamere Hardware gewinnt also gegen teurere, wenn die Verarbeitung gut aufgeteilt ist. METASTONE verwaltet mehr als 20 000 P Rechenleistung in mehreren Rechenzentren und gibt eine Verfügbarkeit seiner Dienste von über 99,95 Prozent an.

Die zweite Stimme kommt von Inspur. Auf der Konferenz AICC 2026 stützte sich das Unternehmen auf Daten von IDC. Demnach ist die weltweite Nachfrage nach Rechenleistung für KI im Jahr 2024 zu 79 Prozent gedeckt, 2027 zu 71 Prozent und 2030 zu etwa 77 Prozent. Die Lücke zwischen Bedarf und Angebot erreicht 380,9 Milliarden Dollar, zehnmal mehr als 2024. Der Token-Verbrauch soll kumuliert um mehr als das 48-Fache pro Jahr wachsen. Die Inferenzaufgaben sollen 2030 bei 4000 Billionen pro Jahr liegen.

Inspur antwortet mit Hardware. Das System SD200 Ultra fasst 128 Chips, 8 TB Speicher und 64 TB Festplattenplatz in einer Maschine. Damit sollen sich Modelle mit einer Billion Parametern betreiben lassen, ohne sie auf viele Schränke zu verteilen. Die Latenz der Kommunikation von allen zu allen sinkt auf 0,69 Mikrosekunden.

Für Käufer von Rechenleistung heißt das: Der Preis pro Token ist nicht mehr allein eine Funktion des Hardwarepreises. Immer häufiger entscheidet, wie gut ein Anbieter nutzt, was er schon hat. Das verändert die Regeln für Ausschreibungen von Cloud-Diensten.

Die praktische Folge: Wenn schon das Umschreiben der Cache-Verwaltung und die Verteilung der Arbeit auf die vorhandenen Chips einen mehrfachen Durchsatzgewinn bringen, sollte dem Kauf einer neuen Hardware-Generation ein Software-Audit vorausgehen. Ein Anbieter, der gemessene Werte auf derselben Infrastruktur vorlegen kann, verkauft heute keine Rechenleistung, sondern Einsparung. Zugleich ist das die einfachste Antwort chinesischer Rechenzentrumsbetreiber auf Exportbeschränkungen: Wo die stärksten Karten nicht nachgekauft werden können, zählt vor allem die Effizienz dessen, was bereits im Serverraum steht.

Kommentare 0

Quellen

2
  1. 01PCIe显卡被低估了!内核补齐+通信重构,DeepSeek推理吞吐翻近7倍ZH
  2. 02AI算力之争不靠堆卡!浪潮信息捅破智算能力天花板ZH

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Dr. Miriam Seidel

Dr. Miriam Seidel

Wirtschaft, Business und Welt

Dr. Miriam Seidel schreibt für FLASH24 über Wirtschaft, Weltpolitik und Konjunktur und stützt sich dabei auf Geschäftsberichte, Notenbankdaten und Handelsregisterauszüge, statt auf Pressemitteilungen zu warten. Sie prüft Bilanzen Zeile für Zeile, gleicht Kennzahlen mit Vorquartalen ab und rechnet Wachstumsraten selbst nach. Für ihre Analysen spricht sie mit Analysten, verfolgt die Quartalszahlen der Tech-Konzerne und wartet auf die Konjunkturumfragen des Ifo-Instituts. Dass sie privat Bilanzen von Tech-Konzernen liest und Lastenräder testet, passt zu ihrer Deck: Kapitalströme und Stadtverkehr prüft sie mit derselben Genauigkeit. Sie veröffentlicht keine Zahlen, deren Quelle sie nicht selbst eingesehen hat.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.