Alibaba zeigt den Chip Zhenwu V900 und öffnet den T-Head-SAIL-Stack
Am 22. September wurde auf der Konferenz Yunqi ein Chip angekündigt, der als der stärkste in China beworben wird. Einen Tag später erweiterte die Firma T-Head die offenen Quellen um Migrationswerkzeuge und Beschleunigungsbibliotheken.

Chinas Cloud-Konzerne wechseln von der Phase „wir liefern Chips“ zur Phase „wir bauen gemeinsam ein Ökosystem darum herum“. So beschreibt es das Portal qbitai in seinem Bericht über den Auftritt des Generaldirektors der Alibaba-Gruppe, Wu Yongming, auf der Konferenz Yunqi am 22. September. Bei der Vorstellung des neuen KI-Chips Zhenwu V900 nannte er ihn den stärksten Rechenchip Chinas. Er solle dreimal leistungsfähiger sein als der Vorgänger M890.
Einen Tag später kündigte die Sparte T-Head den nächsten Schritt bei der Öffnung des Software-Stacks T-Head SAIL an, des Gegenstücks zu CUDA für die Zhenwu-Chips. In die offenen Quellen kamen unter anderem die Anpassung PyTorch-for-sail, das Migrationswerkzeug sailify, eine Umgebung zum Schreiben von Operatoren namens Triton-for-sail sowie die Bibliotheken DeepGEMM-for-sail und FlashAttention-for-sail. Die ersten Elemente wurden im Juli auf der Messe WAIC vorgestellt, als SDK, Treiber und Werkzeuge zur Leistungsanalyse und Fehlersuche freigegeben wurden.
Das Problem, das gelöst werden soll
Das Argument klingt vertraut für jeden, der eine Produktion auf eine andere Hardware-Plattform umgestellt hat: Am wichtigsten sind die Migrationskosten. Der altgediente Direktor Lu Shenghua von T-Head sagte offen, die Kunden fragten vor allem, wie viel sie umschreiben müssten. Das zweite Problem zeigt sich nach dem Start des Modells. Wenn die Leistung nach dem Hardwarewechsel auf 30 bis 40 Prozent des vorherigen Werts fällt, nimmt niemand eine solche Migration an. Das dritte ist das Tempo: Modelle erscheinen alle paar Wochen, und die Kunden erwarten, dass ein neues Modell spätestens am Tag der Premiere läuft.
Die Öffnung des Codes der Beschleunigungsbibliotheken verschiebt die Kräfteverhältnisse auch aus einem anderen Grund. Ein Kunde, der eigene Operatoren schreiben will, müsste mitunter Details des Algorithmus an den Chip-Lieferanten verraten, und das will er nicht. Der Zugang zu Architektur und Code erlaubt es, das im eigenen Haus zu erledigen, innerhalb des Unternehmens. T-Head beschreibt auch den Prozess für Änderungsvorschläge: Vorschlag, Codeänderung, automatische Tests und Prüfung durch die Betreuer, danach die Veröffentlichung. Nach Angaben des Unternehmens kamen die ersten Beiträge sowohl aus dem Inneren von Alibaba als auch von externen Kunden.
Wer es bereits nutzt
Den Daten aus dem Vortrag zufolge bedienen die Zhenwu-Chips mehr als 650 Kunden in über 20 Branchen. Ant Group hat die Anpassung der wichtigsten Modelle für die Inferenz auf den Chips Zhenwu 810E und M890 abgeschlossen und arbeitet an Quantisierung und Experten-Parallelität. XPeng hat das Training der Modelle für autonomes Fahren auf einen Zhenwu-Cluster verlagert und nutzt Profiling-Werkzeuge, um Engpässe zu finden. Xiaohongshu ging weiter und baute auf Basis des offenen Codes von SAIL einen eigenen Agenten zur Migration und Optimierung von Operatoren. Damit beschleunigte das Unternehmen die Einführung generativer Empfehlungsmodelle.
Eine Ergänzung des Ökosystems ist der Modellkatalog: Bis September 2026 wurden auf der Plattform ModelScope 39 quantisierte Modelle bereitgestellt, die die Familien Qwen, DeepSeek und Kimi abdecken und insgesamt mehr als 348 Tausend Mal heruntergeladen wurden. Die Geschichte der Produktlinie zeigt die Richtung: vom Chip Hanguang 800 aus dem Jahr 2019 über Yitian 710 aus dem Jahr 2021 bis zur heutigen Serie Zhenwu. Der Druck zur Offenheit ist kein Altruismus. Ohne übertragbaren Code haben ausländische und einheimische Kunden keinen Grund, die Plattform zu wechseln.
Quellen
2Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.
Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.
Kommentare
0- Noch keine Kommentare — seien Sie der Erste.