Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

Offene Gewichte schließen auf: neue Ranglisten, neue Hardware und ein Chip-Deal

Am 1. Oktober setzte der Artificial Analysis Intelligence Index in der Fassung von The Open Weights Zhipu AIs GLM-5.3 mit 44,8 Punkten an die Spitze seiner Tabelle mit 20 offenen Modellen. Moonshot AIs Kimi K3 folgt mit 43,6. Neue Veröffentlichungen kommen weiterhin laufend dazu.

KI & ModelleAnalyseLena BrandtVeröffentlicht: 30. September 20264 Min. LesezeitQuellen 14
Offene Gewichte schließen auf: neue Ranglisten, neue Hardware und ein Chip-Deal

Am 1. Oktober setzte der Artificial Analysis Intelligence Index in der Fassung von The Open Weights Zhipu AIs GLM-5.3 mit 44,8 Punkten an die Spitze seiner Tabelle mit 20 offenen Modellen. Moonshot AIs Kimi K3 folgt mit 43,6. Neue Veröffentlichungen kommen weiterhin laufend dazu.

Die Ranglisten widersprechen einander, und das sollte man deutlich sagen. Die Open-Weights-Liste von BenchLeader, aktualisiert 12 Stunden vor Redaktionsschluss, führt Moonshot AIs Kimi K3 mit 66,2 auf Platz eins. Dahinter liegen Zhipus GLM 5.3 max mit 64,7 und Xiaomis MiMo-V2.6-Pro mit 64,5. Die Liste von BenchLM.ai mit 94 Modellen führt dagegen MiMo-V2.6-Pro mit einem BenchAlign-v5.8-Wert von 75,5 an, dahinter Qwen3.8 Max und MiMo-V2.6-Flash. LMMarketCap veröffentlichte am 1. Oktober um 06:00 Uhr ein Update und setzt Alibabas Qwen3.8 27B unter 175 offenen Modellen auf Platz eins. Googles Gemma 4 26B A4B und Gemma 4 31B teilen sich Platz zwei.

Verschiedene Gremien, verschiedene Sieger. Eines haben die vier Listen gemeinsam: In den obersten Zeilen stehen chinesische Labore und Google, Nvidia, Meta und Mistral weiter unten.

Die letzten 72 Stunden brachten außerdem mehrere neue offene Modelle, die auf diesen Listen noch fehlen. Nvidia veröffentlichte am 29. September Kumo Tabular, ein Foundation Model für tabellarische Klassifikation und Regression in drei Größen von 28M bis 215M Parametern. Es wurde ausschließlich auf künstlichen Daten vortrainiert und steht unter der Lizenz OpenMDW-1.1 für kommerzielle Nutzung zur Verfügung. Laut Nvidia steht es auf TabArena, BeyondArena, TALENT und ScoringBench an erster Stelle und braucht weder Training noch Feature Engineering pro Aufgabe.

Fermion Research veröffentlichte am 30. September Phonon-2, ein englisches Spracherkennungsmodell als 164 MB großer Download, dessen Encoder jedes Gewicht in etwa 2,1 Bit speichert. Das Unternehmen sagt, es erreiche im Schnitt 5,21 Prozent Wortfehler über die sieben englischen Sets des Open ASR Leaderboard. Jedes besser abschneidende offene Modell sei mindestens 5,8-mal größer, und eine Stunde Audio werde auf einem MacBook Air in etwa 20 Sekunden transkribiert. Die Gewichte stehen unter CC-BY-4.0 und stammen von Nvidias Parakeet TDT 0.6B v3 ab. Bespoke Labs veröffentlichte am 30. September Nimble, ein 9B-Modell auf Basis von Qwen3.5-9B, das typisierte Entscheidungen mit Wahrscheinlichkeiten statt freiem Text zurückgibt. Das README erklärt, die Trainings- und Holdout-Beispiele seien am 20. September veröffentlicht worden, nachdem sie in der ersten Version fehlten.

Zwei offene Projekte testen, ob sich die Trainingsschleife selbst verteilen lässt. Das Repository coop von Commonsense AI, aktualisiert am 30. September, beschreibt ein Modell mit rund 145M Parametern, das von Grund auf auf FineWeb-Edu vortrainiert wird. Freiwillige führen lokale AdamW-Schritte auf gespendeter Hardware aus und reichen Pseudo-Gradienten als Hugging-Face-Pull-Requests ein. Ein zustandsloser GitHub-Actions-Cron führt sie alle fünf Minuten mit einem getrimmten Mittel oder geometrischen Median zusammen. Stufe 1, ein 15M-Modell auf TinyStories, lief über sein Chinchilla-optimales Budget hinaus. Unabhängig davon behauptet PSSA, ein Nicht-Transformer-Sprachmodell in Rust ohne ML-Framework darunter, es lerne bei gleicher Parameterzahl schneller als ein Transformer und generiere auf derselben CPU etwa zwölfmal schneller.

Auch die kommerzielle Seite bewegte sich. OpenAI und Synopsys erklärten am 30. September, sie hätten eine mehrjährige Partnerschaft geschlossen, um GPT-Synopsys zu bauen. Das Modell für Chipdesign und Verifikation soll Synopsys' EDA-Werkzeuge direkt bedienen und auf OpenAIs Infrastruktur laufen. Kundendaten werden nicht zum Training verwendet, der Umsatz wird zwischen beiden geteilt. The Register berichtete am 30. September, OpenAI beschuldige Personen mit Verbindungen zu Moonshot AI einer Destillationskampagne ab dem 1. Juli. Am 24. und 25. Juli gab es Spitzen von 16.000 Anfragen von über 4.000 Nutzern und verwandte Aktivitäten über mehr als 15.000 Konten, unterbrochen am 28. Juli. Moonshot antwortete nicht auf die Anfrage von The Register um eine Stellungnahme.

Auf dieselben Labore richtet sich auch die Aufsicht. Die FTC hat eine branchenweite Untersuchung gegen OpenAI, Anthropic und andere eröffnet, wie CNBC am 30. September bestätigte. The Guardian berichtete am selben Tag, die Behörde plane förmliche Auskunfts- und Zeugenaufforderungen, auch an die Forschungsgruppe Metr. Weder OpenAI noch Anthropic äußerten sich gegenüber CNBC; die New York Post berichtete zuerst über die Untersuchung. Am 29. September verklagte die gemeinnützige Organisation Legal Advocates for Safe Science & Technology OpenAI vor dem Superior Court von San Francisco County wegen des Hugging-Face-Hacks im Juli und verlangt eine Unterlassungsverfügung statt Schadenersatz, wie Ars Technica berichtete. Darin wird OpenAI mit den Worten zitiert, die Klage sei "completely without merit".

Wer heute ein offenes Modell auswählt, zieht aus dieser Woche die praktische Lehre, dass keine einzelne Rangliste die Frage entscheidet: Die Listen bewerten unterschiedliche Modellgruppen, und ein 164 MB großes Sprachmodell oder ein Tabellenmodell mit 215M Parametern kann für einen Einsatz wichtiger sein als der Platz eins.

Kommentare 0

Quellen

14
  1. 01LLM Intelligence leaderboard - The Open WeightsEN
  2. 02Best open weights AI models ranked (2026) - BenchLeaderEN
  3. 03Open-Source LLM Leaderboard 2026: 94 Models Ranked - BenchLM.aiEN
  4. 04Best Open Source AI Models & LLM Leaderboard (2026) - LMMarketCapEN
  5. 05Nvidia Kumo Tabular: Open Foundation Model for Tabular PredictionEN
  6. 06Phonon-2: most accurate open speech recognition model in a 164 MB downloadEN
  7. 07Nimble: Data, Model, Recipe for an Open Jev (From Bespoke Labs)EN
  8. 08Coop: A small language model pretrained by volunteersEN
  9. 09PSSA: A non-transformer language model written from scratch in RustEN
  10. 10OpenAI and Synopsys team up to build an AI model that designs chips like a seasoned engineerEN
  11. 11Irony alert: OpenAI whines that Chinese model stole its special IP that it stole from everybody elseEN
  12. 12FTC is investigating OpenAI, Anthropic and other AI companies over product risksEN
  13. 13US trade regulator opens investigation into AI giantsEN
  14. 14"An AI did it" is no defense, says nonprofit suing OpenAI over Hugging Face hackEN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Lena Brandt

Lena Brandt

KI, Modelle und Technik

Lena Brandt schreibt für FLASH24 über Technik, KI und Modelle sowie Medien und Internet und stützt sich dabei auf Herstellerangaben, Studien und öffentlich zugängliche Datensätze, statt Pressemitteilungen ungeprüft zu übernehmen. Bei Modellvergleichen kontrolliert sie Benchmark-Werte, Trainingsdaten und Versionsnummern und rechnet Angaben zu Rechenleistung und Kosten selbst nach. Sie spricht mit Entwicklern und Forschern, wartet auf angekündigte Updates und vergleicht Releases, bevor sie eine Einschätzung abgibt. Privat beschäftigt sie sich mit 3D-Druck, alten Rechnern und der Frage, wie Modelle aus Internetmüll lernen – Themen, die regelmäßig in ihre Texte einfließen. Sie publiziert keine Zahlen, deren Quelle sie nicht selbst überprüfen konnte.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.