Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

Phonon-2, Coop und Kumo Tabular: die Woche der kleinen offenen Modelle

Fermion Research hat am 30. September Phonon-2 veröffentlicht, ein offenes Modell für englische Spracherkennung. Es passt in einen Download von 164 MB und kommt über die sieben englischen Datensätze des Open ASR Leaderboard hinweg auf eine durchschnittliche Wortfehlerrate von 5,21 Prozent. Die Veröffentlichung fiel in eine Woche, in der offene Gewichte die Schlagzeilen machten, nicht die Frontier-Modelle.

KI & ModelleErklärtKatrin HoffmannVeröffentlicht: 30. September 20264 Min. LesezeitQuellen 14
Phonon-2, Coop und Kumo Tabular: die Woche der kleinen offenen Modelle

Der Reiz liegt in der Größe. Fermion Research zufolge speichert der Encoder jedes Gewicht als eine von fünf erlernten Stufen mit etwa 2,1 Bit. Die Gewichte stehen unter CC-BY-4.0, und dieselbe Datei läuft auf Macs, Linux, Windows und NVIDIA-GPUs. Auf einem MacBook Air wird nach Angaben des Unternehmens eine Stunde Audio in rund 20 Sekunden zu Text.

Zwei weitere offene Veröffentlichungen kamen am selben Tag. NVIDIA stellte auf Hugging Face Kumo Tabular vor, ein offenes Grundlagenmodell für tabellarische Vorhersagen. Und ein Freiwilligenprojekt namens Coop veröffentlichte ein Repository, das ein kleines Sprachmodell beschreibt. Es wurde ohne Server, ohne Finanzierung und ohne Daemon vortrainiert.

Was die Zahlen tatsächlich sagen

Die zentrale Behauptung von Phonon-2 ist Genauigkeit pro Byte. Fermion zufolge erreicht das Modell über die sieben englischen Datensätze des Open ASR Leaderboard hinweg durchschnittlich 5,21 Prozent Wortfehler. Jedes offene Modell mit besserem Wert ist mindestens 5,8-mal so groß. Bei Parlamentsreden erreicht es 100,8 Prozent der Wortgenauigkeit seines Lehrers und übertrifft diesen Lehrer bei Meetings, und das bei einem 15-mal kleineren Download, so das Unternehmen. Vergleichspunkt ist NVIDIAs Parakeet TDT 0.6B v3, den Fermion als Lizenzquelle für die eigenen Gewichte nennt. Das Unternehmen erklärt außerdem, Phonon-2 liege bei jedem getesteten Rauschniveau vor Parakeet Redux, beschrieben als das andere Low-Bit-Modell seiner Größe. Das sind Herstellerangaben, veröffentlicht mit dem Modell. Die schnellen Pfade werden nur ausgeliefert, wenn die Wortfehlerrate im Rauschen des exakten Pfads bleibt, heißt es in Fermions Text.

NVIDIAs Tabellenmodell setzt anders an. Kumo Tabular sagt Beschriftungen für neue Zeilen in einem einzigen Vorwärtsdurchlauf voraus, ohne Training, ohne Abstimmung und ohne Feature Engineering, für Klassifikation und Regression. Es wurde ausschließlich auf künstlichen Daten vortrainiert, kommt in drei Größen von 28M bis 215M Parametern und erscheint unter der OpenMDW-1.1-Lizenz für kommerzielle Nutzung, so das Unternehmen. NVIDIA beansprucht Platz eins in vier Benchmarks: TabArena, BeyondArena, TALENT und ScoringBench.

Eine Trainingsschleife ohne Eigentümer

Coop ist das seltsamste der drei Projekte. Die GitHub-Seite beschreibt Pseudo-Gradienten, die als Hugging-Face-Pull-Requests eintreffen und von einem zustandslosen GitHub-Actions-Cronjob mit DiLoCo zusammengeführt werden, während Gewichte und Optimizer-Zustand nur auf Hugging Face liegen. Gespendete Consumer-Hardware und kostenlose Tarife erledigen die Arbeit. Stufe 2 ist ein Modell mit rund 145M Parametern, das von Grund auf auf FineWeb-Edu vortrainiert wird; Stufe 1, ein 15M-Modell auf TinyStories, hat sein Chinchilla-optimales Budget überschritten, heißt es im Repository.

Das Projekt behauptet, mehrere Freiwillige auf verschiedenen Rechnern, Apple Silicon und einfacher CPU, hätten denselben äußeren Schritt trainiert und seien zu einem Update gemittelt worden. Es dokumentiert auch den Umgang mit Fehlern: Eine Einsendung, die einem Tick zuvorkam, wurde einen Schritt später mit reduziertem Staleness-Gewicht akzeptiert, wiederholte Runden eines Nutzers wurden zu einer einzigen Stimme zusammengeführt, und eine halb fertige Runde wurde geleert statt verworfen. Nichts davon ist Frontier-Arbeit. Das ist der Punkt. Am selben Tag veröffentlichten das UK AI Security Institute und Meridian Labs Inspect, ein offenes Framework für Frontier-Evaluierungen mit mehr als 200 vorgefertigten Evaluierungen und Unterstützung für über 20 Modellanbieter, dazu Sandboxing in Docker, Kubernetes und Modal.

Andernorts wird die Linie zwischen offen und geschlossen öffentlich verhandelt. The Register berichtete am 30. September, OpenAI habe Einzelpersonen mit Verbindungen zu Chinas Moonshot AI eines Destillationsangriffs beschuldigt, der am 1. Juli begann, mit starken Ausschlägen am 24. und 25. Juli in Höhe von 16.000 Anfragen von über 4.000 Nutzern. OpenAI erklärte, die Kampagne am 28. Juli unterbrochen zu haben. Moonshot reagierte nicht sofort auf die Anfrage von The Register nach einer Stellungnahme. Am selben Tag berichtete The Decoder, DeepSeek habe quelloffene Programmierwerkzeuge für Huaweis Ascend-Chips veröffentlicht, im Zentrum TileLang, eine offene Sprache, die ursprünglich von Forschern der Peking-Universität entwickelt wurde. Reuters, zitiert in diesem Bericht, stellte die Veröffentlichung neben Bibliotheken für Berechnung und Datenbewegung zwischen Chips. DeepSeek erklärte, Huawei habe die Arbeit voll unterstützt, und die beiden hätten einen Superknoten aus 128 Ascend-950-Chips optimiert. Auch die Regulierer bewegen sich. The Guardian berichtete am 30. September, die FTC habe eine branchenweite Untersuchung gegen Anthropic und OpenAI eröffnet, mit förmlichen Auskunfts- und Zeugenaufforderungen, die erste offizielle US-Durchsetzungsmaßnahme mit Bezug zu unkontrollierten KI-Agenten. CNBC bestätigte die Prüfung und erklärte, die FTC habe es abgelehnt, weitere untersuchte Unternehmen zu nennen.

Die oben genannten offenen Veröffentlichungen haben mit diesem Fall nichts zu tun. Doch sie teilen eine Prämisse: dass Fähigkeit, zumindest nützliche Fähigkeit, zu Gewichten driftet, die jeder herunterladen kann. Die Belege dieser Woche sind kleine Modelle mit engen Aufgaben, eine Freiwilligen-Trainingsschleife und eine Benchmark-Tabelle eines Herstellers. Ob daraus ein Wandel wird, werden die nächsten Veröffentlichungszyklen zeigen.

Kommentare 0

Quellen

14
  1. 01Phonon-2: most accurate open speech recognition model in a 164 MB downloadEN
  2. 02Nvidia Kumo Tabular: Open Foundation Model for Tabular PredictionEN
  3. 03Coop: A small language model pretrained by volunteersEN
  4. 04Inspect: An open-source framework for large language model evaluationsEN
  5. 05Irony alert: OpenAI whines that Chinese model stole its special IP that it stole from everybody elseEN
  6. 06China's AI industry closes ranks as Deepseek ships open-source software for Huawei's Ascend chipsEN
  7. 07US trade regulator opens investigation into AI giantsEN
  8. 08FTC is investigating OpenAI, Anthropic and other AI companies over product risksEN
  9. 09OpenAI delays IPO over AI safety concernsEN
  10. 10OpenAI unveils AI assistant 'dots' while safety worries delay new modelEN
  11. 11"An AI did it" is no defense, says nonprofit suing OpenAI over Hugging Face hackEN
  12. 12"We're not going to shoot ourselves in the foot" over hack fallout, says OpenAI's chief research officerEN
  13. 13OpenAI's Jev clone could help the frontier lab stop its swarming agentsEN
  14. 14Google drops Gems for Skills, joining OpenAI and Anthropic in the shift to agent-ready prompt formatsEN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Katrin Hoffmann

Katrin Hoffmann

KI, Modelle und Technik

Katrin Hoffmann schreibt für FLASH24 über Technik, KI und Modelle sowie Medien und Internet und stützt sich dabei auf Primärquellen wie Herstellerangaben, Studien und Protokolle statt auf Pressemitteilungen. Bei Benchmarks prüft sie Messmethoden, Testumgebungen und Reproduzierbarkeit, bevor sie Zahlen übernimmt. Für ihre Artikel spricht sie mit Entwicklern und Forschern, wartet auf Konferenzankündigungen und vergleicht Versionsstände von Modellen und Standards. Privat betreibt sie Selfhosting und Heimnetze und dokumentiert ihre eigene Infrastruktur, was ihrer Redaktionsarbeit zugutekommt. Sie veröffentlicht keine Zahlen ohne nachvollziehbare Quelle.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.