Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

Kleine Entscheidungsmodelle laufen auf dem Gerät: Liquid AIs d1, Jev-Klone und ein 2B-Vision-Klassifikator

Liquid AI hat am 29. September die Dokumentation zu d1 veröffentlicht, seinem ersten Entscheidungsmodell. Es gehört zu einer schnell wachsenden Familie kleiner Modelle für den Geräteeinsatz, die kalibrierte Wahrscheinlichkeiten zurückgeben statt generierten Text.

KI & ModelleNachrichtKatrin HoffmannVeröffentlicht: 29. September 20265 Min. LesezeitQuellen 12
Kleine Entscheidungsmodelle laufen auf dem Gerät: Liquid AIs d1, Jev-Klone und ein 2B-Vision-Klassifikator

Die Dokumentation beschreibt drei Fragetypen. Noul ist eine Ja/Nein-Frage und gibt eine Wahrscheinlichkeit zwischen 0 und 1 zurück. Choice ist eine Auswahlfrage und liefert eine Verteilung über benannte Optionen. Score ist eine geordnete Bewertungsskala, die als wahrscheinlichkeitsgewichtete Position zurückkommt. Der Beispielaufruf schickt eine Kundenbeschwerde an das Modell "d1:free" und liefert 0.999 auf die Frage "Is this message a complaint from the customer?"

Das ist eine andere Form von Modell als ein Chatbot. Es wird nichts generiert. Laut Liquid-Dokumentation bewertet ein Entscheidungsmodell eine Situation und gibt kalibrierte Wahrscheinlichkeiten über eine feste Menge von Ergebnissen in einem einzigen Aufruf mit null generierten Tokens zurück. Mehrere Fragen lassen sich in einer Anfrage gegen denselben Zustand auswerten.

Warum es diese Modellklasse gibt

Dasselbe Muster taucht in den neuesten Quellen des Dossiers auf. Sebastian Raschka veröffentlichte am 29. September eine lange technische Erklärung. Sie führt die Textklassifikation von Bag-of-Words über RNNs, CNNs und Transformer bis zu dem, was er "Jev-like APIs" nennt. Sein Argument: Der Reiz liegt in Kosten und Geschwindigkeit, nicht in roher Genauigkeit. "Jev's advantage is that it can handle those classification tasks much faster and more cheaply", schreibt er. Zugleich warnt er: Für ein eng umrissenes, klar definiertes Problem gewinnt ein zweckgebauter Klassifikator in allen drei Punkten weiterhin.

Das Jeeves-Repository von PostHog, ebenfalls am 29. September veröffentlicht, beziffert den Trade-off. Jeeves ist ein 9B-Modell nach Jev-Art auf Basis von Qwen3.5-9B mit LoRA und einem Pointer-Head. Trainiert wurde es mit SFT und CISPO, damit es vor der Entscheidung nachdenkt. Das Repo meldet 0.889 auf dem eigenen zurückgehaltenen Testsplit gegen 0.857 für Jev und 0.822 für Kev-9B sowie 0.935 auf den öffentlichen Stufen von JevBench gegen 0.866 für Jev. Die Inferenz läuft ohne Nachdenken bei etwa 0.3 Sekunden pro Anfrage und mit Nachdenken bei einem Median von 3.3 Sekunden, auf einer H100 mit fp8. Sie läuft auch auf Apple Silicon in bf16 oder FP8 und benötigt 48GB oder mehr.

Evan Schwartz, der den personalisierten Inhaltsfeed Scour betreibt, veröffentlichte am 29. September eine Anfrage nach Prompt-Caching für diese API-Klasse. Sein Fragenset umfasst inzwischen 54 Fragen (50 Nouls, 3 Choices, 1 Score) mit ungefähr 2.150 Tokens, davon etwa 260 Tokens feste Overhead-Kosten. Wörtlich bei jeder Anfrage über rund 1.100.000 Dokumente pro Monat mitgeschickt, machen die Fragen etwa 88% seiner Input-Tokens aus. Seine Rechnung liegt unter 150 Dollar im Monat, doch mit Caching würden Batch-Workflows seiner Aussage nach noch günstiger.

Das Geräte-Ende: ein 2B-Vision-Klassifikator

Die klarste Veröffentlichung eines kleinen Modells in diesem Batch ist Qevi-2B, am 29. September auf Hugging Face publiziert. Es ist ein vollständiges Fine-Tuning von Qwen3-VL-2B-Instruct. Das Modell beantwortet geschlossene Fragen zu Bildern, indem es die Logits des Modells selbst liest, statt Text zu generieren. Fragt man es, ob in einem Bild eine Leiter ist, liefert es P(Yes) = 0.97, keinen Satz.

Die Modellkarte meldet eine In-Domain-Genauigkeit, die von 0.855 beim Basismodell auf 0.977 steigt, eine Genauigkeit auf zurückgehaltenen Domänen von 0.745 auf 0.889 und einen Expected Calibration Error auf zurückgehaltenen Daten, der von 0.160 auf 0.054 fällt. Die Inferenz wird mit bis zu etwa 21-mal schneller angegeben, wenn viele Fragen zu einem Bild gestellt werden. Die Karte stellt ausdrücklich klar, dass das Modell über ein Logit-Readout genutzt werden muss und nicht über .generate(). Alle drei unterstützten Fragetypen können sich eine einzige Kodierung des Bildes teilen, getrennt durch eine blockdiagonale Attention-Maske. Die Antworten wurden bitgenau gegen separat gestellte Fragen geprüft.

Eine Auswertung im Dossier dämpft die Begeisterung. Casco, ein Sicherheitsunternehmen, schickte 2.449 Findings durch acht Modelle, darunter Jev, Claude und GPT, und verglich deren CVSS-3.1-Scores mit den eigenen veröffentlichten Scores. Jedes Modell bewertete im Durchschnitt höher als die Referenz. Jev vergab 550 Critical-Scores an einen Datensatz mit 55 veröffentlichten Critical-Findings, und 500 dieser 550 lagen in Cascos Referenz unter Critical. Beim mittleren absoluten Fehler lag GPT-6 Astra mit 1.92 Punkten vorn und Jev mit 3.40 auf Platz sieben. Cascos Bericht ist auf den 28. September datiert.

Auch anderswo im selben Batch vom 29. September zeigt sich das Kleinmodell-Thema an weniger offensichtlichen Stellen. Ein kostenloses Vorschaumodell, das am 24. September auf OpenRouter als space-bunny-alpha gelistet wurde, beansprucht einen Kontext von einer Million Tokens. Auf denselben Benchmarks verbraucht es laut eigener Website etwa ein Drittel der Output-Tokens von Qwen3.8 Flash, 305.989 gegen 913.989. Simple AI startete Tango, ein audio-natives Modell zur Erkennung von Turn-Enden. Es beansprucht eine mediane Entscheidung 300ms früher, als ein herkömmlicher Voice-Activity-Detector eine Pause bemerken würde, und 15 verpasste Turn-Enden von 400 im öffentlichen LiveKit-Benchmark gegen 54 für Soniox und 197 für Deepgram Flux. Das sind vom Anbieter gefahrene Vergleiche auf einem öffentlichen Benchmark, keine unabhängigen Prüfungen.

Zwei weitere Veröffentlichungen im Zeitfenster zielen in dieselbe Richtung: Jeb, ein GitHub-Projekt, das jede OpenAI-kompatible API in ein Entscheidungsmodell verwandelt, und DesktopBrain, ein Dateiorganisator für den Mac, der auf dem Gerät läuft. Keines von beiden veröffentlicht im verfügbaren Material Benchmark-Zahlen.

Das Muster ist konsistent. Die interessanten kleinen Modelle der letzten 72 Stunden sind keine Miniatur-Chatbots. Sie sind eng zugeschnitten, kalibriert und günstig dort zu betreiben, wo ein Frontier-Modell absurd wäre: auf einem Telefon, einem Laptop, in einem 2B-Vision-Encoder, in einem Klassifikator, der 54 Fragen für weniger als 150 Dollar im Monat beantwortet. Ob sie für die Arbeit genau genug sind, auf die man sie richtet, ist eine separate Frage. Cascos Ergebnis legt nahe, dass die Antwort nicht immer ja lautet.

Kommentare 0

Quellen

12
  1. 01d1: Liquid AI's First Decision ModelEN
  2. 02Qevi-2B: A Jev-style finetuned model for image classificationEN
  3. 03Language Models for Text Classification: From Bag-of-Words to JevEN
  4. 04Jeeves. Reasoning improves Jev-like decision modelsEN
  5. 05Every model (incl. Jev) we tested inflates security finding severityEN
  6. 06Please add prompt caching to Jev-style modelsEN
  7. 07Space-bunny-alpha a reasoning model from an anonymous providerEN
  8. 08Tango: Simple AI's Conversational Awareness ModelEN
  9. 09Jeb: Turn any OpenAI API into a decision modelEN
  10. 10DesktopBrain - AI File Organizer for Mac and All Folders - Private On-Device AIEN
  11. 11Language Models Act on Hidden ValenceEN
  12. 12Needed 1+1, built a functional programming languageEN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Katrin Hoffmann

Katrin Hoffmann

KI, Modelle und Technik

Katrin Hoffmann schreibt für FLASH24 über Technik, KI und Modelle sowie Medien und Internet und stützt sich dabei auf Primärquellen wie Herstellerangaben, Studien und Protokolle statt auf Pressemitteilungen. Bei Benchmarks prüft sie Messmethoden, Testumgebungen und Reproduzierbarkeit, bevor sie Zahlen übernimmt. Für ihre Artikel spricht sie mit Entwicklern und Forschern, wartet auf Konferenzankündigungen und vergleicht Versionsstände von Modellen und Standards. Privat betreibt sie Selfhosting und Heimnetze und dokumentiert ihre eigene Infrastruktur, was ihrer Redaktionsarbeit zugutekommt. Sie veröffentlicht keine Zahlen ohne nachvollziehbare Quelle.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.