Entscheidungsmodelle verzichten auf Textgenerierung, kleine On-Device-KI setzt auf Logit-Ausgabe
Zwei Modellveröffentlichungen am 29. September verfolgten dieselbe Idee: Statt Token zu erzeugen, sollen kleine Modelle kalibrierte Wahrscheinlichkeiten liefern. Liquid AIs d1 und ein Qwen3-VL-2B-Fine-Tune namens Qevi-2B arbeiten beide so.

Beide erschienen am Dienstag innerhalb von sechs Minuten. Liquid AI veröffentlichte um 20:09 UTC die Dokumentation zu d1, das das Unternehmen als sein erstes Entscheidungsmodell bezeichnet. MeerDevelopment schob Qevi-2B um 20:16 UTC auf Hugging Face. Keines der beiden erzeugt Text.
Die Dokumentation von Liquid AI wird beim Mechanismus deutlich. Ein Entscheidungsmodell „bewertet eine Situation und liefert in einem einzigen Aufruf ohne generierte Token kalibrierte Wahrscheinlichkeiten über eine feste Menge von Ausgängen“. Die API bietet drei Fragetypen: noul (Ja/Nein, gibt eine Fließkommazahl zurück), choice (eine von benannten Optionen auswählen) und score (eine wahrscheinlichkeitsgewichtete Position auf einer geordneten Skala). Im Beispiel der Dokumentation liefert die Zeichenkette „I have been waiting over three weeks for my order and nobody has responded to my emails“ einen noul-Wert von 0.999 auf die Frage „Is this message a complaint from the customer?“ Die Antwort meldet zudem usage.output_tokens mit 0.
Die Logits lesen, den Satz überspringen
Qevi-2B nimmt einen anderen Weg zum selben Ziel. Es ist ein vollständiges Fine-Tune von Qwen3-VL-2B-Instruct. Das Modell beantwortet geschlossene Fragen zu Bildern, indem es die Logits des LM-Heads an der Position liest, an der es mit der Antwort beginnen würde. Dabei ist es auf erlaubte Antwort-Token beschränkt. Fragt man es, ob auf einem Foto eine Leiter zu sehen ist, gibt es P(Yes) = 0.97 zurück. Die Modellkarte warnt, dass ein Aufruf von .generate() mit anschließendem Parsen des Textes die veröffentlichten Zahlen nicht reproduziert, „denn das ist nicht der Pfad, auf dem das Modell feinabgestimmt wurde“.
Die angegebenen Zugewinne sind groß und konkret. Gegen das Basis-Qwen3-VL-2B, das denselben Ausgabepfad durchläuft, erreicht Qevi-2B eine In-Domain-Genauigkeit von 0.977 gegenüber 0.855 und 0.889 auf zurückgehaltenen Domänen gegenüber 0.745. Der Expected Calibration Error auf zurückgehaltenen Daten sinkt von 0.160 auf 0.054. Die Karte nennt außerdem eine rund 21-fach schnellere Inferenz, wenn viele Fragen zu einem Bild gestellt werden, weil das Question Packing eine einzige Bildkodierung teilt.
Eine Einschränkung sollte man genau lesen. Der Trainingskorpus deckt nur noul- und choice-Fragen ab, der Typ score ist also ungetestet. Und die Karte nimmt frühere Temperatur-Empfehlungen ausdrücklich zurück: Bei T = 2.45 kehrt der ECE auf zurückgehaltenen Daten zu 0.160 zurück und löscht den gesamten Kalibrierungsgewinn aus.
Klein, schnell und auf Klassifikation gerichtet
Das ist das On-Device-Argument in seiner aktuellen Form. Der Leitfaden von Ailoitte zur Entwicklung kleiner Modelle, in den letzten 12 Stunden veröffentlicht, fasst es in Kosten: Ein 7B-Modell zu betreiben kann „10- bis 30-mal günstiger bei Latenz, Energie und Rechenaufwand“ sein als ein 70B- bis 175B-Modell, unter Verweis auf ein NVIDIA-Positionspapier von 2025. Er merkt außerdem an, dass kleine Modelle vor Ort laufen, was für Daten aus dem Gesundheitswesen und dem Finanzsektor zählt.
Sebastian Raschkas Essay vom 29. September zur Textklassifikation argumentiert dasselbe von der anderen Seite. Er beschreibt Jev, ein Modell, das „in den vergangenen 2 Wochen so etwas wie ein kulturelles Phänomen in technischen Communities“ ausgelöst habe, im Kern als Textklassifikator. Dieser sei bei der Klassifikation schneller und günstiger als allgemeine LLMs und zugleich allgemeiner als aufgabenspezifische Modelle. Er weist ausdrücklich darauf hin, dass er keine Verbindung zu Jev und keinen kostenlosen Zugang dazu hat.
Das jeeves-Repository von PostHog, am 29. September aktualisiert, ergänzt Reasoning zu diesem Muster. Jeeves ist ein 9B-Modell nach Art von Jev, gebaut auf Qwen3.5-9B mit LoRA und einem Pointer-Head, trainiert mit SFT und CISPO. Es meldet 0.889 insgesamt auf einem zurückgehaltenen Test-Split gegenüber 0.857 für Jev und 0.822 für Kev-9B sowie 0.935 auf den öffentlichen Stufen von JevBench gegenüber 0.866 für Jev. Denken kostet Zeit: etwa 3.3 Sekunden im Median pro Anfrage auf einer H100 in fp8, gegenüber 0.3 Sekunden ohne.
Die Zahlen weisen nicht in eine Richtung. Jeeves schlägt Jev insgesamt, verliert aber bei Transfer (0.746 gegenüber 0.800) und bei MMLU-Pro 10-way (0.739 gegenüber 0.840). Außerdem beantwortet es 5.5% der unbeantwortbaren Fragen mit p ≥ 0.9, besser als Jevs 9.0%, aber schlechter als Kev-9Bs 0.0%.
Die Marktprognosen für diese Kategorie gehen weit auseinander. Das sollte man eher vermerken als mitteln. MarketsandMarkets beziffert den SLM-Markt 2025 auf 930.000.000 USD und 2032 auf 5.450.000.000 USD bei einer CAGR von 28.7%. wizr.ai nennt dagegen eine Zahl von 7.760.000.000 USD für 2023, mit Wachstum von 15.6% zwischen 2024 und 2030. Die beiden Schätzungen beschreiben unterschiedlich große Märkte.
Was das Paar der Veröffentlichungen vom 29. September nahelegt, ist enger und konkreter: Bei klassifikationsartiger Arbeit wird das Ausgabeformat selbst um Wahrscheinlichkeiten herum neu entworfen, nicht um Prosa.
Quellen
6- 01d1: Liquid AI's First Decision ModelEN
- 02Qevi-2B: A Jev-style finetuned model for image classificationEN
- 03Jeeves. Reasoning improves Jev-like decision modelsEN
- 04Language Models for Text Classification: From Bag-of-Words to JevEN
- 05Small Language Model Development: Lower Cost, More PrivacyEN
- 06The Rise of Small Language Models in Enterprise AI Adoption [2026]EN
Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.
Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.
Kommentare
0- Noch keine Kommentare — seien Sie der Erste.