Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

Offene Gewichte dringen weiter nach oben: Chipdesign, Sprache und Tabellenmodelle in einer Woche

OpenAI und Synopsys haben am 30. September eine mehrjährige Vereinbarung über den Bau von GPT-Synopsys unterzeichnet, einem spezialisierten Modell für Chipdesign. Es ist eine von mindestens fünf Veröffentlichungen oder Partnerschaften mit offenen oder offen beschriebenen Modellen in den letzten Septembertagen.

KI & ModelleAnalyseLena BrandtVeröffentlicht: 30. September 20268 Min. LesezeitQuellen 7
Offene Gewichte dringen weiter nach oben: Chipdesign, Sprache und Tabellenmodelle in einer Woche

Die jüngste Entwicklung in der Arbeit mit offenen Modellen ist kein Benchmark-Wert. Sie ist ein Vertrag. Am 30. September teilten OpenAI und Synopsys mit, sie hätten eine mehrjährige strategische Partnerschaft unterzeichnet. Gemeinsam wollen sie ein spezialisiertes KI-Modell für Chipdesign namens GPT-Synopsys bauen, wie The Decoder berichtet. Synopsys verkauft Werkzeuge zur Automatisierung des Elektronikdesigns, also die Software, mit der Ingenieure Chips entwerfen. OpenAI lizenziert diese Werkzeuge für das Projekt.

Das erklärte Ziel ist ein Modell, das „über Chipdesign und Verifikation nachdenken und die Werkzeuge von Synopsys direkt bedienen kann“. Beide Unternehmen sagen, erste Tests mit Halbleiterkunden liefen. Kundendaten würden nicht zum Training verwendet und verschlüsselt gespeichert. Das Produkt wollen sie gemeinsam vermarkten und die Erlöse teilen. Synopsys-CEO Sassine Ghazi sagt, KI könne den Designprozess erheblich beschleunigen. OpenAI-Mitgründer Greg Brockman beschreibt den Deal als Weg zu besseren Chips und besserer KI.

Das ist ein geschlossenes Modell in einer kommerziellen Kette. Dieselbe Woche brachte eine ganz andere Art von Veröffentlichung.

Kleine Modelle, kleine Dateien, laute Behauptungen

Fermion Research veröffentlichte am 30. September Phonon-2 und bezeichnet es als genauestes offenes Spracherkennungsmodell unter 900 MB. In einem Download von 164 MB, so das Unternehmen, erreiche es die Genauigkeit seines 2,5 GB großen Vollpräzisions-Lehrermodells Punkt für Punkt. Bei Besprechungen und Parlamentsreden übertreffe es diese sogar. Eine Stunde Audio verwandle es auf einem MacBook Air in etwa 20 Sekunden in Text. Die Gewichte liegen auf Hugging Face unter CC-BY-4.0, der Lizenz von NVIDIA Parakeet TDT 0.6B v3, von dem sie abstammen.

Die interessante Zahl ist 5,21. Über die sieben englischen Datensätze des Open ASR Leaderboard erreicht Phonon-2 im Mittel 5,21 Prozent Wortfehlerrate. Jedes offene Modell, das besser abschneidet, ist mindestens 5,8-mal so groß, so die Veröffentlichung des Unternehmens. Jedes Encoder-Gewicht wird als eine von fünf gelernten Stufen gespeichert, gepackt als Base-3-Ziffern, fünf pro Byte. Ein weiteres Bit pro Gewicht ungleich null wählt die Größenordnung. Das ergibt rund 2,1 Bit pro gespeichertem Gewicht. Das Unternehmen sagt, der Vorsprung halte unter Lärm stand, vom stillen Raum bis zu Hintergrundgeräuschen so laut wie der Sprecher. Dort bleibe es vor Parakeet Redux.

Eine unabhängige Überprüfung liegt nicht vor. Behandeln Sie die Leaderboard-Position und die Lärmbehauptung als Angaben des Anbieters, bis jemand sie reproduziert.

Am selben Tag stellte NVIDIA sein tabellarisches Fundamentmodell auf Hugging Face. NVIDIA Kumo Tabular ist ein offenes Fundamentmodell für tabellarische Daten. Es sagt Beschriftungen neuer Zeilen in einem einzigen Vorwärtsdurchlauf vorher, ohne Training, ohne Feinabstimmung und ohne Merkmalskonstruktion, für Klassifikation und Regression. Es wurde nur auf künstlichen Daten vortrainiert, kommt in drei Größen von 28M bis 215M Parametern, läuft über NVIDIAs Open-Source-Bibliothek structured-data-models und erscheint unter der Lizenz OpenMDW-1.1 für kommerzielle Nutzung. NVIDIA sagt, es stehe auf vier Benchmarks an erster Stelle: TabArena, BeyondArena, TALENT und ScoringBench.

Die Architekturdetails zählen weniger als der Rahmen. Die Arbeit mit tabellarischen Daten wurde zwei Jahrzehnte lang von gradientenverstärkten Bäumen dominiert. NVIDIAs Argument lautet, ein vortrainierter Transformer könne eine beschriftete Tabelle im Kontext lesen. Damit entfalle der Lebenszyklus je Aufgabe, also Beschriftungen sammeln, Merkmale konstruieren und Hyperparameter abstimmen. Das Modell nutzt Spalten-, Zeilen- und In-Kontext-Aufmerksamkeit in der Linie von TabICL und TabPFN. Eine längenbewusste Aufmerksamkeitstemperatur sorgt dafür, dass die Softmax-Aufmerksamkeit nicht zerfällt, wenn eine Inferenztabelle weit größer ist als eine Trainingstabelle. Fehlende Werte brauchen keine Imputation.

Offene Gewichte von Freiwilligen und von einem Staatsinstitut

Zwei Veröffentlichungen vom 30. September kamen ganz ohne Unternehmen dahinter, oder mit einem staatlichen. Coop ist ein kleines Sprachmodell, das Freiwillige vortrainiert haben, ohne Server, ohne Finanzierung und ohne Dauerprozess. Die Trainingsschleife läuft auf gespendeter Consumer-Hardware plus kostenlosen Kontingenten von Hugging Face und GitHub Actions, wie das GitHub-Repository zeigt. Stufe 2 läuft: ein Decoder-Transformer mit rund 145M Parametern, von Grund auf auf FineWeb-Edu vortrainiert, mit 12 Schichten, 14 Köpfen, d=896, einem Kontext von 1024 Token und einem Byte-Level-BPE-Vokabular von 32k. Stufe 1, ein 15M-Modell auf TinyStories, endete jenseits seines Chinchilla-optimalen Budgets. Der Validierungsverlust fiel in sechs Tagen von 9,01 auf 2,8.

Der Mechanismus ist die Geschichte. Rechner laden den aktuellen Checkpoint herunter, führen lokale AdamW-Schritte auf einem persönlichen Datenanteil aus, berechnen einen Pseudogradierten und reichen ihn als Pull Request gegen ein öffentliches Hugging-Face-Datensatz-Repository ein. Ein zustandsloser GitHub-Actions-Cronjob liest den Checkpoint und die offenen Pull Requests im Posteingang. Er ist alle fünf Minuten geplant, in der Praxis aber feuert er in Abständen von Minuten bis zu einigen Stunden. Er verwirft zu alte Einsendungen, beschneidet und kosinusgewichtet den Rest, aggregiert sie per getrimmtem Mittel oder geometrischem Median, macht einen äußeren Nesterov-Schritt, lädt den neuen Checkpoint hoch, schreibt Mitwirkende im Register gut und schließt die bearbeiteten Pull Requests.

Das Repository ist offen bei der Bewertung. Ein einzelner Validierungsverlust sagt nichts, weil äußere Schritte ihn ebenso oft nach oben wie nach unten bewegen. Deshalb passt das Leaderboard eine Steigung über die Reihe gegen Token statt gegen äußere Schritte an und gibt sie mit einem Standardfehler an. „Geht nach unten“ heißt, die Steigung überschreitet zwei Standardfehler. Das ist eine ehrlichere Berichtsregel, als die meisten finanzierten Labore hinbekommen.

Am selben Tag veröffentlichten das UK AI Security Institute und Meridian Labs Inspect, ein Open-Source-Framework für Frontier-KI-Evaluationen. Inspect deckt Programmierung, agentische Aufgaben, Schlussfolgern, Wissen, Verhalten und multimodales Verstehen ab und kommt mit über 200 vorgefertigten Evaluationen. Seine Bausteine sind Datensätze, Solver und Scorer. Es unterstützt Werkzeugaufrufe einschließlich MCP-Werkzeugen und eingebauten bash-, python-, Websuche- und Computer-Werkzeugen. Es führt beliebige externe Agenten wie Claude Code, Codex CLI und Gemini CLI aus und kapselt nicht vertrauenswürdigen Modellcode in Docker, Kubernetes, Modal, Proxmox und Vagrant über eine Erweiterungs-API. Der Zeitpunkt ist deutlich. Evaluationswerkzeuge von einem staatlichen Sicherheitsinstitut erscheinen in derselben Woche, in der eine US-Aufsichtsbehörde eine branchenweite Untersuchung zu fehlgeleiteten KI-Agenten eröffnete.

Offene Gewichte dringen in Chinas Chip-Stack vor

Deepseek veröffentlicht Open-Source-Programmierwerkzeuge für Huaweis KI-Chips, laut einem Beitrag auf Deepseeks offiziellem WeChat-Kanal, wobei Reuters über die Open-Source-Freigabe berichtet. Kernstück ist TileLang, eine Open-Source-Programmiersprache für KI-Chips, ursprünglich von Forschern der Peking-Universität entwickelt. Deepseek nutzt sie seit etwa einem Jahr und beschreibt sie nun als sein Hauptwerkzeug für die Arbeit an künstlicher allgemeiner Intelligenz, laut The New York Times.

Die Software enthält Bibliotheken für Berechnungen und für den Datentransfer zwischen Chips. Laut Deepseek hat Huawei die Arbeit „voll unterstützt“, und die beiden Unternehmen optimierten einen Superknoten, einen Verbund aus 128 Ascend-950-Chips. Deepseek argumentiert, wer ein unabhängiges Software-Ökosystem für KI-Chips aufbauen wolle, brauche zuerst eine universelle Sprache, die leicht zu programmieren ist und dennoch die volle Leistung aus der Hardware holt. TileLang biete ein einfacheres Programmiermodell als CUDA, sagt das Unternehmen.

Das führt zu einer breiteren Debatte darüber, wo Nvidias Vorteil liegt. Das Research-Unternehmen SemiAnalysis nannte den CUDA-Graben „potenziell tot“, nachdem es OpenAIs Inferenzchip Jalapeno getestet hatte. Der Grund: OpenAI bringt neue Modelle so schnell auf eigener Hardware zum Laufen. Jalapeno habe Nvidias Blackwell bei der Leistung pro Watt in den meisten getesteten Szenarien geschlagen, so SemiAnalysis. Das Unternehmen fügte eigene Einschränkungen hinzu: Die Tests deckten relativ leicht zu optimierende Szenarien mit etwa 8.000 Eingabe-Token und 1.000 Ausgabe-Token ab. AgentX, den Benchmark für mehrstufige Agentenaufgaben, habe man noch nicht laufen lassen. Im August fand SemiAnalysis Nvidia bei diesem Benchmark weit vorn und sagte, Nvidia werde pro Token weiterhin billiger sein als AMD, selbst wenn AMD seine Hardware verschenke. Der Vorteil liege in der Software, die viele Chips zu einem System verbindet. Huaweis Chips waren nicht Teil des AgentX-Vergleichs.

Es gibt auch einen innenpolitischen Druckpunkt. Huawei räumt ein, mit der Nachfrage im eigenen Land nicht Schritt halten zu können, und will deshalb weniger Chips ins Ausland verkaufen. Mit Blick auf die US-Exportkontrollen sagte Huaweis derzeitiger rotierender Vorsitzender Eric Xu, das Unternehmen könne eine Zukunft nicht akzeptieren, die davon abhänge, ob andere bereit seien, Chips nach China zu verkaufen.

Was zu beobachten ist

Das Muster über diese Veröffentlichungen hinweg ist, dass offene Gewichte nicht mehr auf Chatbot-Checkpoints beschränkt sind. Sie kommen als Sprach-Encoder, klein genug für einen Laptop, als Tabellenvorhersager für Unternehmensdaten, als Evaluationsgerüste von einer staatlichen Sicherheitsbehörde, als freiwillige Trainingsschleifen auf kostenlosen Kontingenten und jetzt als Programmierwerkzeuge für einen Nicht-Nvidia-Beschleuniger-Stack.

Zwei Dinge bleiben ungelöst. Erstens sind die Benchmark-Behauptungen für Phonon-2 und Kumo Tabular in diesem Dossier Angaben des Anbieters oder der Betreuer, und keine der drei Modellveröffentlichungen hat eine unabhängige Reproduktion. Zweitens bewegt sich das regulatorische Bild in die entgegengesetzte Richtung zu den Veröffentlichungen: Die Untersuchung der FTC gegen Anthropic, OpenAI und Metr ist die erste offizielle US-Durchsetzungsmaßnahme, die fehlgeleitete KI-Agenten betrifft, wie The Guardian am 30. September berichtete.

Offene Gewichte klären nichts davon. Sie verlagern die Debatte nur auf Hardware, die mehr Menschen betreiben können.

Kommentare 0

Quellen

7
  1. 01OpenAI and Synopsys team up to build an AI model that designs chips like a seasoned engineerEN
  2. 02Phonon-2: most accurate open speech recognition model in a 164 MB downloadEN
  3. 03NVIDIA Kumo Tabular Sets a New Accuracy-Efficiency Frontier for Tabular PredictionEN
  4. 04Coop: A small language model pretrained by volunteersEN
  5. 05Inspect: An open-source framework for large language model evaluationsEN
  6. 06China's AI industry closes ranks as Deepseek ships open-source software for Huawei's Ascend chipsEN
  7. 07US trade regulator opens investigation into AI giants including Anthropic and OpenAIEN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Lena Brandt

Lena Brandt

KI, Modelle und Technik

Lena Brandt schreibt für FLASH24 über Technik, KI und Modelle sowie Medien und Internet und stützt sich dabei auf Herstellerangaben, Studien und öffentlich zugängliche Datensätze, statt Pressemitteilungen ungeprüft zu übernehmen. Bei Modellvergleichen kontrolliert sie Benchmark-Werte, Trainingsdaten und Versionsnummern und rechnet Angaben zu Rechenleistung und Kosten selbst nach. Sie spricht mit Entwicklern und Forschern, wartet auf angekündigte Updates und vergleicht Releases, bevor sie eine Einschätzung abgibt. Privat beschäftigt sie sich mit 3D-Druck, alten Rechnern und der Frage, wie Modelle aus Internetmüll lernen – Themen, die regelmäßig in ihre Texte einfließen. Sie publiziert keine Zahlen, deren Quelle sie nicht selbst überprüfen konnte.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.