Te same punkty, inny rachunek: jak czytać benchmarki modeli otwartych
W indeksie Artificial Analysis Xiaomi MiMo-V2.6-Pro ma 46 punktów, tyle samo co zamknięty Grok 4.7, ale średni koszt wykonania jednego zadania różni się około 29 razy. Koszt obok wyniku staje się osobnym wymiarem oceny.

W komunikatach o modelach otwartych najłatwiej przeoczyć warunki, w jakich powstał wynik. Xiaomi MiMo-V2.6-Pro zdobył 46 punktów w Artificial Analysis Intelligence Index i zajął pierwsze miejsce wśród modeli otwartych. Tego samego dnia ukazał się zamknięty Grok 4.7, który w tym samym indeksie też ma 46 punktów. Patrząc tylko na ten wiersz, oba modele wypadają podobnie.
Inny wymiar zmienia jednak wniosek. Z pomiarów Artificial Analysis wynika, że mocniejsza wersja Groka 4.7 potrzebuje średnio 3,74 dolara na wykonanie jednego zadania, a MiMo-V2.6-Pro tylko 0,13 dolara. Różnica to około 29 razy. Ten sam wynik może więc oznaczać zupełnie inne koszty użytkowania.
Druga rzecz, którą łatwo pominąć, to szczegóły testu. Wynik MiMo-V2.6 pochodzi z treningu uczenia ze wzmocnieniem na zaledwie 30 krokach. Każdy krok obejmował 1 568 promptów, a przy każdym zadaniu model próbował 16 różnych ścieżek. W DeepSWE v1.1, który sprawdza agenta do kodowania, wersja Pro podniosła się z 58,4 do 72,57 punktu, a Flash z 48,7 do 65,68 punktu. Te liczby coś znaczą tylko wtedy, gdy generalizacja poza zbiorem treningowym działa. Nie mówią nic o tym, ile punktów wyciśnięto na samym zbiorze treningowym.
Trzecią zmienną jest wybór zestawu testowego. W opisie V4.1 Flash producent podkreśla, że po testach wewnętrznych i zewnętrznych model przewyższa V4 Pro pod każdym względem, w tym wydajności, kosztu, szybkości i całkowitego czasu. „Pełna przewaga” to jednak sformułowanie producenta. Dopiero konkretna metoda testu, liczba próbek i użyte narzędzia rozstrzygają, jak szeroko można te wnioski przenieść.
Dlatego wyniki trzeba czytać razem: w jakich warunkach model działał, ile kosztuje wykonanie zadania i jak wypada poza zbiorem treningowym. Cytowanie samego najwyższego wyniku zastępuje cały obraz jednym punktem.
Firmom wybierającym model bardziej przyda się mały test na własnych zadaniach: ustalić jeden zestaw oceny, porównać koszt jednostkowy i skuteczność, a potem zdecydować, który model trafi do środowiska produkcyjnego. Wynik to wejście, rachunek to wniosek.
Źródła
3Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.