Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

Gleiche Punktzahl, andere Rechnung: Wie man Benchmarks offener Modelle liest

Im Artificial Analysis Intelligence Index kommt Xiaomis MiMo-V2.6-Pro auf 46 Punkte, genau wie das geschlossene Modell Grok 4.7. Die durchschnittlichen Kosten pro Aufgabe unterscheiden sich aber um etwa das 29-Fache.

KI & ModelleMeinungKatrin HoffmannVeröffentlicht: 18. September 20265 Min. LesezeitQuellen 3
Gleiche Punktzahl, andere Rechnung: Wie man Benchmarks offener Modelle liest

Wer Ankündigungen offener Modelle liest, übersieht am leichtesten die Bedingungen hinter den Punkten. Xiaomis MiMo-V2.6-Pro erreicht im Artificial Analysis Intelligence Index 46 Punkte und liegt damit an der Spitze der offenen Modelle. Das am selben Tag vorgestellte geschlossene Modell Grok 4.7 kommt im selben Index ebenfalls auf 46 Punkte. Betrachtet man nur diese Zeile, wirken beide Modelle gleich stark.

Wechselt man die Dimension, kippt das Ergebnis. Nach Messungen von Artificial Analysis braucht die hochkonfigurierte Version von Grok 4.7 für eine Aufgabe durchschnittlich 3,74 Dollar. MiMo-V2.6-Pro kostet pro Aufgabe im Schnitt nur 0,13 Dollar, ein Unterschied von etwa dem 29-Fachen. Derselbe Score kann also ganz unterschiedliche Nutzungskosten bedeuten.

Zweitens wird leicht übersehen, wie der Test konkret aufgesetzt war. MiMo-V2.6 erzielt sein Ergebnis mit einem Reinforcement-Learning-Training über nur 30 Steps. Jeder Step umfasst 1.568 Prompts, und bei jeder Aufgabe probiert das Modell 16 verschiedene Wege aus. Beim DeepSWE v1.1, der Coding Agents prüft, steigt Pro von 58,4 auf 72,57 Punkte, Flash von 48,7 auf 65,68 Punkte. Was diese Zahlen bedeuten, hängt davon ab, ob die Generalisierung außerhalb der Stichprobe trägt. Entscheidend ist nicht, wie viele Punkte im Trainingssatz erzielt wurden.

Die dritte Variable ist die Wahl der Evaluation selbst. In den Erläuterungen zu V4.1 Flash betont das Unternehmen, das Modell übertreffe nach internen und externen Tests V4 Pro bei Leistung, Kosten, Geschwindigkeit und Gesamtdauer in allen Kennzahlen. Doch die Formulierung von der umfassenden Überlegenheit stammt vom Anbieter. Erst die konkrete Testmethode, die Stichprobengröße und die eingesetzten Werkzeuge entscheiden, wie weit sich diese Schlüsse verallgemeinern lassen.

Eine Bewertung liest man deshalb richtig, wenn man drei Dinge zusammen betrachtet: unter welchen Bedingungen das Modell lief, was eine Aufgabe kostet und wie es sich außerhalb der Stichprobe schlägt. Nur den höchsten Score zu zitieren heißt, einen Punkt für eine Fläche zu nehmen.

Für die Auswahl im Unternehmen ist es praktischer, mit den eigenen Aufgaben einen kleinen Vergleich anzulegen: ein festes Evaluationsgerüst, dann Kosten pro Aufgabe und Erfolgsquote vergleichen und erst danach entscheiden, welches Modell in die Produktion geht. Der Score ist der Einstieg, die Rechnung ist das Ergebnis.

Kommentare 0

Quellen

3
  1. 01DeepSeek V4.1 Flash – Artificial AnalysisEN
  2. 026 天烧光 2000 多万,拿下开源第一ZH
  3. 03DeepSeek-V4.1-Flash 模型卡EN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Katrin Hoffmann

Katrin Hoffmann

KI, Modelle und Technik

Katrin Hoffmann schreibt für FLASH24 über Technik, KI und Modelle sowie Medien und Internet und stützt sich dabei auf Primärquellen wie Herstellerangaben, Studien und Protokolle statt auf Pressemitteilungen. Bei Benchmarks prüft sie Messmethoden, Testumgebungen und Reproduzierbarkeit, bevor sie Zahlen übernimmt. Für ihre Artikel spricht sie mit Entwicklern und Forschern, wartet auf Konferenzankündigungen und vergleicht Versionsstände von Modellen und Standards. Privat betreibt sie Selfhosting und Heimnetze und dokumentiert ihre eigene Infrastruktur, was ihrer Redaktionsarbeit zugutekommt. Sie veröffentlicht keine Zahlen ohne nachvollziehbare Quelle.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.