Phonon-2, Coop und Kumo Tabular: die Woche der kleinen offenen Modelle
Fermion Research hat am 30. September Phonon-2 veröffentlicht, ein offenes Modell für englische Spracherkennung. Es passt in einen Download von 164 MB und kommt über die sieben englischen Datensätze des Open ASR Leaderboard hinweg auf eine durchschnittliche Wortfehlerrate von 5,21 Prozent. Die Veröffentlichung fiel in eine Woche, in der offene Gewichte die Schlagzeilen machten, nicht die Frontier-Modelle.

Der Reiz liegt in der Größe. Fermion Research zufolge speichert der Encoder jedes Gewicht als eine von fünf erlernten Stufen mit etwa 2,1 Bit. Die Gewichte stehen unter CC-BY-4.0, und dieselbe Datei läuft auf Macs, Linux, Windows und NVIDIA-GPUs. Auf einem MacBook Air wird nach Angaben des Unternehmens eine Stunde Audio in rund 20 Sekunden zu Text.
Zwei weitere offene Veröffentlichungen kamen am selben Tag. NVIDIA stellte auf Hugging Face Kumo Tabular vor, ein offenes Grundlagenmodell für tabellarische Vorhersagen. Und ein Freiwilligenprojekt namens Coop veröffentlichte ein Repository, das ein kleines Sprachmodell beschreibt. Es wurde ohne Server, ohne Finanzierung und ohne Daemon vortrainiert.
Was die Zahlen tatsächlich sagen
Die zentrale Behauptung von Phonon-2 ist Genauigkeit pro Byte. Fermion zufolge erreicht das Modell über die sieben englischen Datensätze des Open ASR Leaderboard hinweg durchschnittlich 5,21 Prozent Wortfehler. Jedes offene Modell mit besserem Wert ist mindestens 5,8-mal so groß. Bei Parlamentsreden erreicht es 100,8 Prozent der Wortgenauigkeit seines Lehrers und übertrifft diesen Lehrer bei Meetings, und das bei einem 15-mal kleineren Download, so das Unternehmen. Vergleichspunkt ist NVIDIAs Parakeet TDT 0.6B v3, den Fermion als Lizenzquelle für die eigenen Gewichte nennt. Das Unternehmen erklärt außerdem, Phonon-2 liege bei jedem getesteten Rauschniveau vor Parakeet Redux, beschrieben als das andere Low-Bit-Modell seiner Größe. Das sind Herstellerangaben, veröffentlicht mit dem Modell. Die schnellen Pfade werden nur ausgeliefert, wenn die Wortfehlerrate im Rauschen des exakten Pfads bleibt, heißt es in Fermions Text.
NVIDIAs Tabellenmodell setzt anders an. Kumo Tabular sagt Beschriftungen für neue Zeilen in einem einzigen Vorwärtsdurchlauf voraus, ohne Training, ohne Abstimmung und ohne Feature Engineering, für Klassifikation und Regression. Es wurde ausschließlich auf künstlichen Daten vortrainiert, kommt in drei Größen von 28M bis 215M Parametern und erscheint unter der OpenMDW-1.1-Lizenz für kommerzielle Nutzung, so das Unternehmen. NVIDIA beansprucht Platz eins in vier Benchmarks: TabArena, BeyondArena, TALENT und ScoringBench.
Eine Trainingsschleife ohne Eigentümer
Coop ist das seltsamste der drei Projekte. Die GitHub-Seite beschreibt Pseudo-Gradienten, die als Hugging-Face-Pull-Requests eintreffen und von einem zustandslosen GitHub-Actions-Cronjob mit DiLoCo zusammengeführt werden, während Gewichte und Optimizer-Zustand nur auf Hugging Face liegen. Gespendete Consumer-Hardware und kostenlose Tarife erledigen die Arbeit. Stufe 2 ist ein Modell mit rund 145M Parametern, das von Grund auf auf FineWeb-Edu vortrainiert wird; Stufe 1, ein 15M-Modell auf TinyStories, hat sein Chinchilla-optimales Budget überschritten, heißt es im Repository.
Das Projekt behauptet, mehrere Freiwillige auf verschiedenen Rechnern, Apple Silicon und einfacher CPU, hätten denselben äußeren Schritt trainiert und seien zu einem Update gemittelt worden. Es dokumentiert auch den Umgang mit Fehlern: Eine Einsendung, die einem Tick zuvorkam, wurde einen Schritt später mit reduziertem Staleness-Gewicht akzeptiert, wiederholte Runden eines Nutzers wurden zu einer einzigen Stimme zusammengeführt, und eine halb fertige Runde wurde geleert statt verworfen. Nichts davon ist Frontier-Arbeit. Das ist der Punkt. Am selben Tag veröffentlichten das UK AI Security Institute und Meridian Labs Inspect, ein offenes Framework für Frontier-Evaluierungen mit mehr als 200 vorgefertigten Evaluierungen und Unterstützung für über 20 Modellanbieter, dazu Sandboxing in Docker, Kubernetes und Modal.
Andernorts wird die Linie zwischen offen und geschlossen öffentlich verhandelt. The Register berichtete am 30. September, OpenAI habe Einzelpersonen mit Verbindungen zu Chinas Moonshot AI eines Destillationsangriffs beschuldigt, der am 1. Juli begann, mit starken Ausschlägen am 24. und 25. Juli in Höhe von 16.000 Anfragen von über 4.000 Nutzern. OpenAI erklärte, die Kampagne am 28. Juli unterbrochen zu haben. Moonshot reagierte nicht sofort auf die Anfrage von The Register nach einer Stellungnahme. Am selben Tag berichtete The Decoder, DeepSeek habe quelloffene Programmierwerkzeuge für Huaweis Ascend-Chips veröffentlicht, im Zentrum TileLang, eine offene Sprache, die ursprünglich von Forschern der Peking-Universität entwickelt wurde. Reuters, zitiert in diesem Bericht, stellte die Veröffentlichung neben Bibliotheken für Berechnung und Datenbewegung zwischen Chips. DeepSeek erklärte, Huawei habe die Arbeit voll unterstützt, und die beiden hätten einen Superknoten aus 128 Ascend-950-Chips optimiert. Auch die Regulierer bewegen sich. The Guardian berichtete am 30. September, die FTC habe eine branchenweite Untersuchung gegen Anthropic und OpenAI eröffnet, mit förmlichen Auskunfts- und Zeugenaufforderungen, die erste offizielle US-Durchsetzungsmaßnahme mit Bezug zu unkontrollierten KI-Agenten. CNBC bestätigte die Prüfung und erklärte, die FTC habe es abgelehnt, weitere untersuchte Unternehmen zu nennen.
Die oben genannten offenen Veröffentlichungen haben mit diesem Fall nichts zu tun. Doch sie teilen eine Prämisse: dass Fähigkeit, zumindest nützliche Fähigkeit, zu Gewichten driftet, die jeder herunterladen kann. Die Belege dieser Woche sind kleine Modelle mit engen Aufgaben, eine Freiwilligen-Trainingsschleife und eine Benchmark-Tabelle eines Herstellers. Ob daraus ein Wandel wird, werden die nächsten Veröffentlichungszyklen zeigen.
Quellen
14- 01Phonon-2: most accurate open speech recognition model in a 164 MB downloadEN
- 02Nvidia Kumo Tabular: Open Foundation Model for Tabular PredictionEN
- 03Coop: A small language model pretrained by volunteersEN
- 04Inspect: An open-source framework for large language model evaluationsEN
- 05Irony alert: OpenAI whines that Chinese model stole its special IP that it stole from everybody elseEN
- 06China's AI industry closes ranks as Deepseek ships open-source software for Huawei's Ascend chipsEN
- 07US trade regulator opens investigation into AI giantsEN
- 08FTC is investigating OpenAI, Anthropic and other AI companies over product risksEN
- 09OpenAI delays IPO over AI safety concernsEN
- 10OpenAI unveils AI assistant 'dots' while safety worries delay new modelEN
- 11"An AI did it" is no defense, says nonprofit suing OpenAI over Hugging Face hackEN
- 12"We're not going to shoot ourselves in the foot" over hack fallout, says OpenAI's chief research officerEN
- 13OpenAI's Jev clone could help the frontier lab stop its swarming agentsEN
- 14Google drops Gems for Skills, joining OpenAI and Anthropic in the shift to agent-ready prompt formatsEN
Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.
Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.
Kommentare
0- Noch keine Kommentare — seien Sie der Erste.