Gleiche Punktzahl, andere Rechnung: Wie man Benchmarks offener Modelle liest
Im Artificial Analysis Intelligence Index kommt Xiaomis MiMo-V2.6-Pro auf 46 Punkte, genau wie das geschlossene Modell Grok 4.7. Die durchschnittlichen Kosten pro Aufgabe unterscheiden sich aber um etwa das 29-Fache.

Wer Ankündigungen offener Modelle liest, übersieht am leichtesten die Bedingungen hinter den Punkten. Xiaomis MiMo-V2.6-Pro erreicht im Artificial Analysis Intelligence Index 46 Punkte und liegt damit an der Spitze der offenen Modelle. Das am selben Tag vorgestellte geschlossene Modell Grok 4.7 kommt im selben Index ebenfalls auf 46 Punkte. Betrachtet man nur diese Zeile, wirken beide Modelle gleich stark.
Wechselt man die Dimension, kippt das Ergebnis. Nach Messungen von Artificial Analysis braucht die hochkonfigurierte Version von Grok 4.7 für eine Aufgabe durchschnittlich 3,74 Dollar. MiMo-V2.6-Pro kostet pro Aufgabe im Schnitt nur 0,13 Dollar, ein Unterschied von etwa dem 29-Fachen. Derselbe Score kann also ganz unterschiedliche Nutzungskosten bedeuten.
Zweitens wird leicht übersehen, wie der Test konkret aufgesetzt war. MiMo-V2.6 erzielt sein Ergebnis mit einem Reinforcement-Learning-Training über nur 30 Steps. Jeder Step umfasst 1.568 Prompts, und bei jeder Aufgabe probiert das Modell 16 verschiedene Wege aus. Beim DeepSWE v1.1, der Coding Agents prüft, steigt Pro von 58,4 auf 72,57 Punkte, Flash von 48,7 auf 65,68 Punkte. Was diese Zahlen bedeuten, hängt davon ab, ob die Generalisierung außerhalb der Stichprobe trägt. Entscheidend ist nicht, wie viele Punkte im Trainingssatz erzielt wurden.
Die dritte Variable ist die Wahl der Evaluation selbst. In den Erläuterungen zu V4.1 Flash betont das Unternehmen, das Modell übertreffe nach internen und externen Tests V4 Pro bei Leistung, Kosten, Geschwindigkeit und Gesamtdauer in allen Kennzahlen. Doch die Formulierung von der umfassenden Überlegenheit stammt vom Anbieter. Erst die konkrete Testmethode, die Stichprobengröße und die eingesetzten Werkzeuge entscheiden, wie weit sich diese Schlüsse verallgemeinern lassen.
Eine Bewertung liest man deshalb richtig, wenn man drei Dinge zusammen betrachtet: unter welchen Bedingungen das Modell lief, was eine Aufgabe kostet und wie es sich außerhalb der Stichprobe schlägt. Nur den höchsten Score zu zitieren heißt, einen Punkt für eine Fläche zu nehmen.
Für die Auswahl im Unternehmen ist es praktischer, mit den eigenen Aufgaben einen kleinen Vergleich anzulegen: ein festes Evaluationsgerüst, dann Kosten pro Aufgabe und Erfolgsquote vergleichen und erst danach entscheiden, welches Modell in die Produktion geht. Der Score ist der Einstieg, die Rechnung ist das Ergebnis.
Quellen
3Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.
Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.
Kommentare
0- Noch keine Kommentare — seien Sie der Erste.