Rechenleistung: Warum Karten stapeln nicht mehr reicht
Auf der AICC 2026 hat der IDC-Bericht die Rechenlücke in zwei Größen zerlegt: die Obergrenze der Fähigkeit und den Umfang der Intelligenz. Bis 2030 könnte die absolute Lücke 380,9 Milliarden US-Dollar erreichen. Karten stapeln allein deckt die unterschiedlichen Lasten von Prefill und Decode kaum noch ab.

Im Wettbewerb um KI-Rechenleistung galt jahrelang nur ein Wort: stapeln. Karten stapeln, Racks stapeln, Generatoren stapeln. Auf der AICC 2026 hat der IDC-Bericht zur Bewertung der KI-Rechenleistung in China 2026 das Problem in zwei Ebenen zerlegt: die Obergrenze der Intelligenz und den Umfang der Intelligenz.
Zuerst die Nachfrage. Dem Bericht zufolge wächst die Zahl der weltweiten KI-Inferenzaufgaben bis 2030 jährlich um 4000 Billionen. Der Token-Verbrauch einer einzelnen mehrstufigen Aufgabe steigt von früher einigen Dutzend auf mehrere hunderttausend. Die Zusammenarbeit mehrerer Agenten verstärkt beide Effekte. IDC-Daten zeigen: Die weltweite Token-Menge wächst von diesem Jahr bis 2030 mit einer jährlichen Rate von 4822,6 Prozent.
Das Angebot kommt nicht mit. Die Deckungsrate des weltweiten KI-Rechenleistungsbedarfs sinkt laut Bericht von 79 Prozent im Jahr 2024 stetig und fällt 2027 voraussichtlich auf 71 Prozent. Selbst wenn der Druck in der vorgelagerten Halbleiterlieferkette nachlässt, ist 2030 nur eine Erholung auf etwa 77 Prozent möglich. Bis 2030 erreicht die absolute Rechenlücke 380,9 Milliarden US-Dollar, fast das Zehnfache von 2024.
Warum hilft Karten stapeln nicht mehr? Weil die Inferenzlast im Agent-Zeitalter sehr gemischt ist. Prefill ist eine Aufgabe mit hoher Parallelität und hoher Rechendichte. Decode muss Token für Token seriell verarbeitet werden und verlangt mehr Speicherbandbreite. Attention greift häufig auf einen ständig wachsenden KV-Cache zu. MoE bringt zusätzlich dünn besetzte Berechnungen und eine groß angelegte Routing-Steuerung mit sich. Dieselbe Art von Rechenleistung zu stapeln, führt eher zu einem Missverhältnis bei der Ressourcenverteilung.
Die Hardwarehersteller antworten mit zwei Wegen. Der eine ist der Fähigkeitstyp, etwa der Superknoten-KI-Server Yuanbrain SD200 Ultra. Die Zahl der Chips pro Gerät steigt von 64 auf 128, Grafikspeicher und erweiterbarer Speicher wachsen auf 8 TB und 64 TB. Laut Hersteller kann ein einzelnes Gerät das Modell Kimi K3 mit 2,8 Billionen Parametern aufnehmen und betreiben, sogar ein Modell mit 10 Billionen Parametern lässt sich auf einem einzigen Gerät bereitstellen. Über einheitliche Adressierung und symmetrische Direktverbindungen drückt er die All-to-All-Kommunikationslatenz auf 0,69 Mikrosekunden und senkt mit einem Superoperator die Zahl der Operatoren auf ein Zehntel. Für den Betrieb von Kimi K3 nennt der Hersteller eine Steigerung der Inferenzleistung um mehr als das Dreifache.
Der andere ist der Kapazitätstyp, etwa die Rechenleistungseinheit Yuanbrain HC2000 mit gemischter Rechenleistung. Sie setzt auf vollständige Flüssigkühlung und eine Stromversorgung mit hohem Durchfluss. Die Stromversorgungsleistung eines einzelnen Schranks liegt über 300 Kilowatt, er trägt bis zu 256 KI-Beschleunigungskarten. Die Rechendichte erreicht das Vierfache eines traditionellen luftgekühlten Schranks, die aggregierte Bandbreite im Schrank beträgt 200 Tbps. Sie lässt verschiedene Chiptypen nach Inferenzphase arbeiten: Prefill mit Chips hoher Rechenleistung, Decode mit HBM-Chips großer Kapazität.
Beide Wege haben eine gemeinsame Voraussetzung: Rechenleistung muss besser ausgelastet werden. Auch das von DeepSeek veröffentlichte DSec-Papier weist in dieselbe Richtung. Das Training von Agenten erfordert, jede Sekunde eine große Zahl von Sandboxen zu erzeugen, der Druck auf die Cluster-Steuerung liegt weit über dem des traditionellen Vortrainings. Für die heimische KI-Infrastruktur geht es im kommenden Wettbewerb nicht nur darum, wer mehr Karten hat, sondern darum, wer heterogene Ressourcen feiner steuern kann.
Quellen
2Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.
Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.
Kommentare
0- Noch keine Kommentare — seien Sie der Erste.