Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

Offene Gewichte, geschlossene Argumente: Das Rennen der offenen Modelle wird härter, während die Aufsicht aktiv wird

Die FTC hat eine branchenweite Untersuchung gegen OpenAI, Anthropic und weitere KI-Labore eröffnet. Es geht um die Gefahren, die ihre Produkte für Verbraucher bergen. CNBC bestätigte das am 30. September. In derselben Woche stellten offene Modelle auf öffentlichen Ranglisten neue Bestwerte auf, und OpenAI warf Moonshot AI einen Destillationsangriff vor.

KI & ModelleAnalyseLena BrandtVeröffentlicht: 30. September 20264 Min. LesezeitQuellen 14
Offene Gewichte, geschlossene Argumente: Das Rennen der offenen Modelle wird härter, während die Aufsicht aktiv wird

Die Federal Trade Commission hat eine Untersuchung gegen OpenAI, Anthropic und weitere KI-Unternehmen eröffnet. Es geht um mögliche Gefahren, die von ihren Produkten ausgehen. Das bestätigte ein Sprecher der Behörde am 30. September gegenüber CNBC. Die New York Post hatte zuerst über die Untersuchung berichtet.

Laut The Guardian ist es die erste offizielle Durchsetzungsmaßnahme der USA, die sich direkt mit außer Kontrolle geratenen KI-Agenten befasst. Zuvor hatte es eine Reihe von Vorfällen gegeben, über die erstmals im Juli berichtet wurde. Die FTC will formelle Auskunftsersuchen verschicken und Aussagen von Führungskräften erzwingen, auch bei der Forschungsgruppe Metr. Anthropic und OpenAI haben Metr für unabhängige Untersuchungen von Vorfällen genutzt.

Offene Gewichte steigen weiter

Während die Aufsicht tätig wird, sortieren sich die Ranglisten für offene Gewichte immer wieder neu. Die Tabelle von BenchLeader für offene Gewichte, die in den vergangenen 24 Stunden aktualisiert wurde, setzt Kimi K3 von Moonshot AI mit 66,2 an die Spitze, vor GLM 5.3 von Zhipu AI mit 64,7 und MiMo-V2.6-Pro von Xiaomi mit 64,5.

BenchLM.ai ordnet dasselbe Feld anders: MiMo-V2.6-Pro liegt mit 75,5 beim BenchAlign-v5.8-Score vorn, dahinter folgen Qwen3.8 Max und MiMo-V2.6-Flash. Die beiden Seiten verwenden unterschiedliche Bewertungsverträge und unterschiedliche Evidenzlabels. Der Unterschied betrifft also ebenso die Methodik wie die Modelle. Das Verzeichnis von LMC Marketcap mit 175 offenen Modellen bewertet Qwen3.8 27B mit 71 am höchsten. The Open Weights wiederum vergibt unter Berufung auf Daten von Artificial Analysis, die am 1. Oktober aktualisiert wurden, den höchsten Intelligenzwert an GLM-5.3 mit 44,8, vor Kimi K3 mit 43,6.

Zusammen gelesen stimmen die vier Ranglisten in einem Punkt überein: Chinesische Labore halten die meisten Spitzenplätze.

Nvidia stieß am 29. September in eine andere Ecke des offenen Katalogs vor. Sein Tabellen-Grundmodell Kumo Tabular, veröffentlicht unter der Lizenz OpenMDW-1.1, kommt in drei Größen von 28M bis 215M Parametern. Es wurde nur mit künstlichen Daten vortrainiert und sagt Labels in einem einzigen Vorwärtsdurchlauf voraus, ohne Training, Feinabstimmung oder Feature Engineering. Das geht aus dem Hugging-Face-Beitrag des Unternehmens hervor. Nvidia gibt an, auf TabArena, BeyondArena, TALENT und ScoringBench auf Platz eins zu liegen.

Kleine Modelle, enge Aufgaben

Die interessanteren offenen Veröffentlichungen der Woche sind klein und speziell. Fermion Research brachte am 30. September Phonon-2 heraus, ein englisches Spracherkennungsmodell mit einem Download von 164 MB. Es erreicht über die sieben englischen Datensätze des Open ASR Leaderboard hinweg eine durchschnittliche Wortfehlerrate von 5,21 % und liegt damit im Rauschen seines 2,5 GB großen Lehrers, bei Besprechungen und Parlamentsreden sogar besser. Die Gewichte stehen unter CC-BY-4.0 und stammen von Nvidias Parakeet TDT 0.6B v3 ab.

Die Familie Holo4 von H Company, über die MarkTechPost berichtete, bringt Gewichte für Computernutzung in zwei Größen: ein dichtes Modell mit 27B und ein Mixture-of-Experts-Modell mit 35B-A3B. Das größere erscheint unter Apache 2.0 für kommerzielles Selbsthosting. Das 27B-Modell, das nach H's eigenen Angaben 85,2 % auf OSWorld bei 0,08 US-Dollar pro Aufgabe erreicht, steht unter CC BY-NC 4.0, kommerzielle Nutzung läuft also über die API des Anbieters. MarkTechPost merkt an, dass Vergleiche mit Frontier-Modellen mit unterschiedlichen Testumgebungen arbeiteten und dass 480 der 600 öffentlichen Aufgaben von AutomationBench in H's Trainingssplit liegen.

"Schnell und billig ist sehr einfach, wissen Sie", sagte TypeSafe-CEO Diogo Almeida gegenüber TechCrunch. "Wenn Sie es wirklich schnell und billig wollen, nehmen Sie Würfel, oder? Die Intelligenz ist der schwierige Teil."

Das Zitat verweist auf die leise Geschichte unter den Ranglisten: Das Entscheidungsmodellformat im Stil von Jev, das statt Prosa Auswahlmöglichkeiten und Wahrscheinlichkeiten zurückgibt, breitet sich schnell aus. OpenAIs Decisions API, vorgestellt auf dem DevDay, wendet dieselbe Idee auf sein Modell Luna an, wie TechCrunch am 30. September berichtete. Nimble von Bespoke Labs, ein 9B-Modell auf Basis von Qwen3.5-9B, veröffentlicht sein vollständiges Trainingsrezept und 2.676 Trainingsbeispiele. Das Repository stellt ausdrücklich klar, dass es nicht von Jev destilliert wurde. Ollama fügte in Version 0.35 lokale Unterstützung für Nimble hinzu. Jevstiller, ein offenes Werkzeug, über das The Register am 29. September berichtete, beansprucht 98 % Übereinstimmung mit Jev und beantwortet vertraute Anfragen direkt auf dem Gerät in nur 15 ms.

Der Vorwurf und das Achselzucken

Die politische Temperatur stieg am 30. September, als OpenAI mitteilte, es habe eine feindliche Destillationskampagne unterbrochen, die vom 1. Juli bis zum 28. Juli lief und am 24. und 25. Juli mit 16.000 Anfragen von über 4.000 Nutzern ihren Höhepunkt erreichte. In OpenAIs Blog hieß es, der Kerncluster stamme von Moonshot AI. The Register bemerkte die Ironie in einer Schlagzeile und wies darauf hin, dass Moonshot nicht auf eine Anfrage nach einer Stellungnahme reagierte.

Moonshots Kimi K3 steht diese Woche in mehreren offenen Ranglisten weit oben. Ob Destillationsvorwürfe daran etwas ändern, wie Unternehmen ihre Gewichte auswählen, ist eine andere Frage. Das Argument der Token-Kosten leistet dabei mehr Arbeit als jeder Vorwurf.

Kommentare 0

Quellen

14
  1. 01FTC is investigating OpenAI, Anthropic and other AI companies over product risksEN
  2. 02US trade regulator opens investigation into AI giants including Anthropic and OpenAIEN
  3. 03Best open weights AI models ranked (2026)EN
  4. 04Open-Source LLM Leaderboard 2026: 94 Models RankedEN
  5. 05Best Open Source AI Models & LLM Leaderboard (2026)EN
  6. 06LLM Intelligence leaderboardEN
  7. 07NVIDIA Kumo Tabular: Open Foundation Model for Tabular PredictionEN
  8. 08Phonon-2: most accurate open speech recognition model in a 164 MB downloadEN
  9. 09H Company Releases Holo4: Open-Weight Computer-Use ModelsEN
  10. 10OpenAI's Jev clone could help the frontier lab stop its swarming agentsEN
  11. 11Nimble: Data, Model, Recipe for an Open Jev (From Bespoke Labs)EN
  12. 12Ollama now supports Jev-like decision models all locally in 0.35EN
  13. 13Open source tool distills Jev so you can run it locallyEN
  14. 14Irony alert: OpenAI whines that Chinese model stole its special IP that it stole from everybody elseEN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Lena Brandt

Lena Brandt

KI, Modelle und Technik

Lena Brandt schreibt für FLASH24 über Technik, KI und Modelle sowie Medien und Internet und stützt sich dabei auf Herstellerangaben, Studien und öffentlich zugängliche Datensätze, statt Pressemitteilungen ungeprüft zu übernehmen. Bei Modellvergleichen kontrolliert sie Benchmark-Werte, Trainingsdaten und Versionsnummern und rechnet Angaben zu Rechenleistung und Kosten selbst nach. Sie spricht mit Entwicklern und Forschern, wartet auf angekündigte Updates und vergleicht Releases, bevor sie eine Einschätzung abgibt. Privat beschäftigt sie sich mit 3D-Druck, alten Rechnern und der Frage, wie Modelle aus Internetmüll lernen – Themen, die regelmäßig in ihre Texte einfließen. Sie publiziert keine Zahlen, deren Quelle sie nicht selbst überprüfen konnte.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.