Offene Gewichte kommen weiter: Inspect, Phonon-2, Kumo Tabular und ein 145M-Modell von Freiwilligen
Das UK AI Security Institute und Meridian Labs haben am 30. September Inspect veröffentlicht, ein Open-Source-Framework mit mehr als 200 vorgefertigten Evaluierungen. Es reiht sich ein in eine Serie offener Veröffentlichungen, zu der auch das Sprachmodell Phonon-2 von Fermion Research und Nvidias Kumo Tabular gehören.

Laut der Projektseite erschien die Veröffentlichung am 30. September um 15:20 UTC. Inspect ist ein Framework für Evaluierungen an der Forschungsfront, entwickelt vom UK AI Security Institute und Meridian Labs. Der Anspruch ist Breite: Programmieren, agentische Aufgaben, Schlussfolgern, Wissen, Verhalten und multimodales Verständnis in einem Werkzeug.
Das Framework liefert kombinierbare Datensätze, Agenten, Werkzeuge und Bewerter mit, dazu eine Bibliothek mit über 200 vorgefertigten Evaluierungen. Es gibt ein webbasiertes Werkzeug Inspect View und eine VS-Code-Erweiterung. Sandboxing führt nicht vertrauenswürdigen Modellcode in Docker, Kubernetes, Modal, Proxmox oder Vagrant über eine Erweiterungsschnittstelle aus. Das Projekt gibt an, mehr als 20 Modellanbieter zu unterstützen, darunter lokale Inferenz mit HuggingFace, vLLM und SGLang.
Evaluierungswerkzeuge sind die unspektakuläre Hälfte offener Gewichte. Gewichte ohne eine Möglichkeit, sie zu messen, sind nur Dateien.
Ein 164 MB großes Sprachmodell und ein Tabellenmodell, das kein Training braucht
Fermion Research hat Phonon-2 am 30. September veröffentlicht und nennt es das genaueste offene Spracherkennungsmodell unter 900 MB. Der Download ist 164 MB groß. Das Unternehmen gibt an, im Mittel 5,21 Prozent Wortfehler über die sieben englischen Datensätze des Open ASR Leaderboard zu erreichen. Jedes offene Modell, das besser abschneidet, sei mindestens 5,8-mal so groß.
Der Encoder speichert jedes Gewicht als eine von fünf erlernten Stufen, ungefähr 2,1 Bit, verpackt als Basis-3-Ziffern, fünf pro Byte. Die Gewichte stehen unter CC-BY-4.0, der Lizenz von Nvidias Parakeet TDT 0.6B v3, von dem sie abstammen. Fermion behauptet, eine Stunde Audio werde auf einem MacBook Air in etwa 20 Sekunden zu Text. Auf einer H100 seien es in Stapeln von 128 etwa 13 Sekunden pro Tag Audio.
Nvidias Beitrag ist eine andere Art der Kompression. Kumo Tabular, am 29. September auf Hugging Face veröffentlicht, sagt Beschriftungen aus einer beschrifteten Tabelle in einem einzigen Vorwärtsdurchlauf voraus, ohne Training, ohne Abstimmung und ohne Merkmalskonstruktion, für Klassifikation und Regression. Es gibt drei Größen von 28M bis 215M Parametern, vortrainiert wurde ausschließlich auf künstlichen Daten, und es erscheint unter der Lizenz OpenMDW-1.1 für kommerzielle Nutzung. Nvidia gibt an, auf TabArena, BeyondArena, TALENT und ScoringBench an erster Stelle zu stehen.
Freiwillige, Rust und ein 145M-Modell, trainiert auf Cron-Jobs
Auch kleinere Vorhaben kommen voran. Coop, ein am 30. September aktualisiertes GitHub-Projekt, trainiert einen Decoder-only-Transformer mit rund 145M Parametern auf FineWeb-Edu vor, auf gespendeter Verbraucherhardware und den kostenlosen Stufen von Hugging Face und GitHub Actions. Pseudo-Gradienten treffen als Pull Requests gegen ein öffentliches Datensatz-Repository ein. Ein zustandsloser GitHub-Actions-Cron fasst sie mit einem äußeren DiLoCo-Schritt theoretisch alle fünf Minuten zusammen, doch das Projekt merkt an, dass GitHubs Planer irgendwann zwischen Minuten und Stunden auslöst. Stufe 1, ein 15M-Modell auf TinyStories, lief nach sechs Tagen über sein Chinchilla-optimales Budget hinaus und senkte den Validierungsverlust von 9,01 auf 2,8.
Ein separates Rust-Projekt namens PSSA, ebenfalls am 30. September aktualisiert, beschreibt eine Nicht-Transformer-Architektur mit einer selektiven Zustandsraum-Rekurrenz, einer episodischen Gedächtnisbank und Gewichtsaktualisierungen pro Token. Der Autor behauptet, sie lerne bei gleicher Parameterzahl schneller als ein Transformer und erzeuge auf derselben CPU etwa zwölfmal schneller Text. Im Repository gibt es keinen unabhängigen Vergleichsmaßstab.
Die offenen Veröffentlichungen der Woche fallen in ein schwierigeres regulatorisches Umfeld. Der Guardian berichtete am 30. September, die FTC habe eine branchenweite Untersuchung gegen Anthropic, OpenAI und andere eröffnet, die erste offizielle US-Durchsetzungsmaßnahme mit Bezug zu außer Kontrolle geratenen KI-Agenten. Ars Technica meldete am selben Tag, OpenAI verschiebe seinen Börsengang wegen Sicherheitsbedenken. Offene Gewichte sind nicht Gegenstand beider Verfahren, doch die Prüfung bestimmt den Ton für alles, was daneben erscheint.
Quellen
7- 01Inspect: An open-source framework for large language model evaluationsEN
- 02Phonon-2: most accurate open speech recognition model in a 164 MB downloadEN
- 03Nvidia Kumo Tabular: Open Foundation Model for Tabular PredictionEN
- 04Coop: A small language model pretrained by volunteersEN
- 05PSSA: A non-transformer language model written from scratch in RustEN
- 06US trade regulator opens investigation into AI giants including Anthropic and OpenAIEN
- 07OpenAI delays IPO over AI safety concernsEN
Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.
Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.
Kommentare
0- Noch keine Kommentare — seien Sie der Erste.