Benchmark Inference Academy: DeepSeek V4 Flash kosztuje 14,9 razy więcej przy zimnych zapytaniach
Ten sam prompt wysłany dwa razy do DeepSeek V4 Flash może za drugim razem kosztować 14,9 razy mniej. Tak wynika z benchmarku serwowania opublikowanego przez inference.academy 7 września, obejmującego 14 dostawców i trzy rozmiary wejścia.

Pomiar nie dotyczy jakości odpowiedzi. Inference.academy przygotowało jeden kontrolowany układ dla celów 1 000, 10 000 i 100 000 tokenów wejściowych, każdy w parze z budżetem 100 lub 1 000 tokenów wyjściowych. Temperaturę ustawiono na zero, rozumowanie wyłączono. Zimne zapytania używały unikalnego prefiksu, ciepłe powtarzały ten sam prompt. Serwis opisuje wyniki jako pomiary serwowania, nie oceny jakości wykonania zadania.
Koszt to całkowite opłaty za zapytanie podzielone przez tokeny wejściowe i pomnożone przez 1M, z uwzględnieniem opłat za wyjście. To istotne, bo cena wejścia podana na stronie dostawcy nie jest tym, co porównuje benchmark. Badanie podaje punkty kosztowe dla 13 tras w wariancie 10 000 wejścia, 100 tokenów wyjścia i zimnego cache'u.
Liczba 14,9 to największa różnica, jaką benchmark wyróżnia. Przy zapytaniach DeepSeek z 100 000 wejścia i budżetem 100 tokenów wyjścia ciepłe wywołania kosztowały w tej próbie 14,9 razy mniej niż zimne. Ciepłe oznacza powtórzony prompt. Zmierzony udział cache'u decyduje o tym, ile pracy wejściowej rozliczono według stawki bez cache'u.
Szybkość to osobna os
Telnyx prowadził w medianie szybkości generowania we wszystkich 12 testowanych warunkach. Opóźnienie pierwszego tokena nie układało się w ten sam wzorzec. Benchmark podaje, że najszybszy pierwszy token zależał od kształtu zapytania. Dostawca, który wygrywa w czasie do pierwszego tokena przy prompcie 1 000, nie musi więc wygrywać przy 100 000.
"To, gdzie wysyłasz prompt, zmienia to, ile płacisz, jak długo czekasz i czy wywołanie się powiedzie."
Ten cytat to sposób, w jaki inference.academy opisuje ćwiczenie. Panele czasowe używają zimnych zapytań z budżetem 100 tokenów wyjścia i wspólną skalą osi. TTFT biegnie od startu zapytania do pierwszej treści lub delty rozumowania odebranej przez klienta i obejmuje czas sieci oraz kolejkowania. P90 korzysta z interpolacji liniowej między uporządkowanymi obserwacjami. Szybkość dekodowania, mierzona po rozpoczęciu streamingu, to tokeny ukończenia podzielone przez czas od pierwszej do ostatniej delty wyjścia. Odpowiedzi niestreamowane nie dostają żadnego pomiaru szybkości dekodowania.
Routing to kolejna zmienna. Benchmark zapisywał nazwy upstreamów zwracane przez OpenRouter dla każdego kształtu zapytania i warunku cache'u. Zauważa przy tym, że powtórzony prompt może trafić do innego upstreamu, co zmienia zachowanie cache'u.
W warunku ciepłym 10 000 do 100 na Together przypadło 29 wywołań, na Novita 20, a na CoreWeave 17. W warunku zimnym 10 000 do 100 Baidu pojawił się 15 razy, a Relace 13. Serwis wyraźnie zaznacza, że szerokość segmentu to udział wywołań, a nazwy to zgłoszone upstreamy, nie zweryfikowane maszyny. Dodaje też, że sam rozkład nie wyjaśnia, dlaczego routing się zmienił.
Wskaźniki błędów są rozbite według celu wejściowego i budżetu wyjścia, z osobnym porównaniem zimnych i ciepłych. Benchmark ostrzega, że trasa może zachować się inaczej, gdy ten sam prompt prosi o dłuższą odpowiedź. Błędy HTTP, transportu i odpowiedzi liczą się jako porażki, a dokładne liczby znajdują się w tabelach pod wykresami. Zero oznacza brak zaobserwowanej porażki w tej próbie, nie gwarancję.
Praktyczny wniosek dla każdego, kto płaci rachunki za inferencję, jest węższy niż nagłówek. Cache zmienia rachunek o więcej niż rząd wielkości przy długich wejściach, a dostawca, do którego trafiasz przez router, nie jest stały. Benchmark obejmuje 14 dostawców i 13 tras w swoim rozrzucie kosztów. Jego własne ujęcie jest najbezpieczniejszym podsumowaniem: to pomiary serwowania i opisują, co się stało w tej próbie.
Źródła
1Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.