Kleine Entscheidungsmodelle laufen auf dem Gerät, Jev-Runner verbreiten sich
Liquid AI hat am 29. September die Dokumentation zu d1 veröffentlicht, seinem ersten Entscheidungsmodell. Die API liefert kalibrierte Wahrscheinlichkeiten für feste Ergebnisse in einem einzigen Aufruf, ohne ein einziges Token zu erzeugen. Am selben Tag zeigte eine Veröffentlichung auf Hugging Face ein 2B-Visionsmodell, das seine eigenen Logits auf dem Gerät liest.

Die Dokumentation zu Liquid AIs d1 erschien am 29. September. Sie zerlegt jede Anfrage in eine von drei typisierten Formen: ein noul, also eine Ja/Nein-Frage, die eine Wahrscheinlichkeit zwischen 0 und 1 zurückgibt, eine choice, eine Auswahlverteilung über benannte Optionen, und einen score, eine wahrscheinlichkeitsgewichtete Position auf einer geordneten Skala. Die Doku zeigt ein Beispiel, in dem eine Kundenbeschwerde an einem noul-Gate 0,999 zurückgibt. Dieselbe Anfrage kann mehrere Fragen gleichzeitig enthalten. Genau diese Form hat die On-Device-Fraktion erwartet.
Auf einem Handy oder Laptop zählt vor allem die Arithmetik. Ein Modell, das eine Zahl statt eines Textabsatzes ausgibt, überspringt die Decode-Schleife vollständig. Die Latenz wächst dann nicht mehr mit der Antwortlänge. Außerdem lässt sich die Ausgabe als Schwellenwert nutzen: Eine Wahrscheinlichkeit von 0,92 ist eine Verzweigungsbedingung, kein Wert, den ein Parser erst deuten muss.
Qevi-2B, am 29. September auf Hugging Face veröffentlicht, ist das klarste Beispiel für ein kleines Modell. Es ist ein vollständiges Fine-Tuning von Qwen3-VL-2B-Instruct. Es beantwortet typisierte, geschlossene Fragen zu Bildern, indem es die Logits des LM-Heads an der Antwortposition liest, statt Text zu erzeugen. Die Modellkarte nennt eine In-Domain-Genauigkeit von 0,977 gegenüber 0,855 für das Basis-Qwen3-VL-2B, eine Genauigkeit auf zurückgehaltenen Domänen von 0,889 gegenüber 0,745 und einen Expected Calibration Error auf zurückgehaltenen Daten von 0,054 gegenüber 0,160.
Die Karte benennt den Haken deutlich: Die Zahlen lassen sich nur über ein Logit-Readout reproduzieren, rund 30 Zeilen gewöhnlicher transformers-Code. Ein Aufruf von .generate() trifft sie nicht, weil das nicht der Pfad ist, auf dem das Modell feinabgestimmt wurde. Die Karte warnt außerdem, dass das Modell kein Chat-Modell ist. Wer fragt, ob eine Leiter im Bild ist, bekommt P(Yes) = 0,97 zurück, keinen Satz. Der versprochene Gewinn liegt bei bis zu etwa 21-mal schnellerer Inferenz, wenn viele Fragen zu einem Bild gestellt werden. Drei separate Fragen teilen sich eine einzige Kodierung und werden mit einer blockdiagonalen Attention-Maske isoliert, bitweise gegen die separate Abfrage verifiziert. Das Training umfasste 57.000 noul-Fragen und 28.500 choice-Fragen.
Reasoning bringt die kleinen Modelle zurück ins Rennen
Der naheliegende Einwand ist die Genauigkeit. Jev-artige Klassifikatoren sind billig und kalibriert, doch bei niedriger Genauigkeit schwach, wie eine Implementierung anmerkt. Deshalb behalten Pipelines ein Reasoning-Modell als Fallback. PostHogs Jeeves-Repo, am 29. September gepusht, greift das direkt an: ein 9B-Jev-ähnliches Modell (Qwen3.5-9B, LoRA, Pointer-Head), das denkt, bevor es entscheidet, trainiert mit SFT und CISPO, plus einen Block-4-Diffusion-Drafter. Die veröffentlichte Tabelle setzt Jeeves auf 0,889 bei zurückgehaltenen Testdaten gegenüber 0,857 für Jev und 0,822 für Kev-9B. In den öffentlichen Stufen von JevBench steht Jeeves bei 0,935 gegenüber 0,866 für Jev. Das Repo meldet etwa 0,3 s pro Anfrage ohne Denken und einen Median von 3,3 s mit Denken auf einer H100 bei fp8. Auf Apple Silicon läuft es in bf16 oder FP8.
Sebastian Raschkas am 29. September erschienene Geschichte der Textklassifikation rahmt die ganze Welle ein. Sie zeichnet den Weg von Bag-of-Words und Naive Bayes über RNNs und Transformer bis zu dem, was er Jev-artige APIs nennt. Sein Argument: Jevs Vorteil liegt bei Geschwindigkeit und Kosten für die Klassifikation, nicht bei der rohen Leistungsfähigkeit. Evan Schwartz führt am selben Tag den Einsatzfall konkret vor. Er stellt 54 Fragen über etwa 1.100.000 Dokumente pro Monat auf Scour, seine Fragen machen rund 88 % der Eingabe-Tokens aus, und seine Gesamtrechnung bleibt unter 150 Dollar im Monat. Von Anbietern fordert er Prompt-Caching oder wiederverwendbare Fragensätze.
Nicht alle halten die Ausgaben für vertrauenswürdig. Casco testete acht Modelle an 2.449 Sicherheitsbefunden gegen die eigenen veröffentlichten CVSS-3.1-Werte. Jedes Modell überschätzte die Schwere. Jev vergab 550 Critical-Werte an einen Datensatz mit 55 veröffentlichten Critical-Befunden, bei einem mittleren vorzeichenbehafteten Fehler von +3,30 Punkten. GPT-6 Astra war mit 1,92 Punkten mittlerem absolutem Fehler am genauesten, Jev lag mit 3,40 auf Platz sieben. Dasselbe Risiko der Überdiagnose gilt für jedes On-Device-Gate, das auf einen Schwellenwert anspringt.
Die Infrastruktur zieht nach. Microsofts Entwicklerblog argumentierte am 29. September, dass öffentliche Coding-Benchmarks die Leistung auf der eigenen Codebasis nicht vorhersagen. Das ist dasselbe Argument dafür, ein kleines Entscheidungsmodell an den eigenen Eingaben zu bewerten. JuliaHub berichtete am selben Tag, dass ein Wechsel des Agent-Harness bei festgehaltenem Modell die Werte von 0,533 auf 0,899 verschob. Damit verdoppelte sich der gemessene Abstand zwischen vier Frontier-Modellen mehr als. Tuneloop bezifferte die Evaluation selbst: 30 wiederholte Aufgaben und etwa 55 Dollar legen den Abstand auf plus oder minus 6 Punkte fest. Das genügt, um Routinearbeit zu einem günstigeren Modell mit 2,5 % der Kosten zu leiten. Für einen On-Device-Klassifikator ist das der Test, der entscheidet, ob das kleine Modell ausgeliefert wird.
Quellen
10- 01d1: Liquid AI's First Decision ModelEN
- 02Qevi-2B: A Jev-style finetuned model for image classificationEN
- 03Jeeves. Reasoning improves Jev-like decision modelsEN
- 04Language Models for Text Classification: From Bag-of-Words to JevEN
- 05Please add prompt caching to Jev-style modelsEN
- 06Every model (incl. Jev) we tested inflates security finding severityEN
- 07What AI benchmarks are not telling youEN
- 08The Best AI Models Fail at Physics: Coding Harnesses are to BlameEN
- 09How many tasks does it take to trust a cheaper model?EN
- 10Tango: Simple AI's Conversational Awareness ModelEN
Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.
Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.
Kommentare
0- Noch keine Kommentare — seien Sie der Erste.