Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

Kleine Modelle laufen auf dem Gerät: Liquid AI liefert d1, Qevi-2B liest Logits statt zu sprechen

Liquid AI hat am 29. September die Dokumentation für d1 veröffentlicht. Darin geht es um ein Entscheidungsmodell, das in einem einzigen Aufruf kalibrierte Wahrscheinlichkeiten über eine feste Menge von Ausgängen liefert und dabei kein einziges Token erzeugt. Am selben Tag erschien auf Hugging Face ein 2B-Visionsmodell namens Qevi-2B, das statt Text ein Logit-Ergebnis ausgibt.

KI & ModelleAnalyseLena BrandtVeröffentlicht: 29. September 20264 Min. LesezeitQuellen 12
Kleine Modelle laufen auf dem Gerät: Liquid AI liefert d1, Qevi-2B liest Logits statt zu sprechen

Die d1-Dokumentation von Liquid AI erschien am 29. September. Sie beschreibt eine Modellklasse, die nie einen Satz schreibt. Das Modell nimmt einen Zustand, also Text oder ein JSON-Objekt, dazu eine oder mehrere typisierte Fragen und gibt Wahrscheinlichkeiten zurück. Unterstützt werden drei Fragetypen: noul für Ja/Nein, choice für die Auswahl aus mehreren Optionen und score für eine geordnete Bewertungsskala. Eine dreistufige Frage kann dabei als 1,85 zwischen Medium und High zurückkommen. "Decision models are a new class of AI model purpose-built for structured decisions", heißt es auf der Seite.

Diese Einordnung ist nicht auf Liquid beschränkt. Der Dienstag, 29. September, brachte außerdem Qevi-2B, ein vollständiges Fine-Tuning von Qwen3-VL-2B-Instruct, das MeerDevelopment auf Hugging Face veröffentlichte. Es beantwortet geschlossene Fragen zu Bildern, indem es die eigenen Logits des Modells liest. Wer fragt, ob auf einem Foto eine Leiter zu sehen ist, bekommt P(Yes) = 0,97 zurück, keinen Satz. Die Modellkarte nennt eine In-Domain-Genauigkeit von 0,977 gegenüber 0,855 beim Basis-Qwen3-VL-2B, eine Genauigkeit von 0,889 auf zurückgehaltenen Domänen gegenüber 0,745 und einen Expected Calibration Error auf zurückgehaltenen Daten von 0,054 gegenüber 0,160. Außerdem werden bis zu rund 21-mal schnellere Inferenz versprochen, wenn viele Fragen zu einem Bild gestellt werden.

Warum die kleinen die interessanten sind

Die Ökonomie zählt mehr als die Architektur. Evan Schwartz, der einen personalisierten Content-Feed namens Scour betreibt, schrieb am 29. September, dass er 54 Fragen (50 nouls, 3 choices, 1 score) gegen etwa 1.100.000 Dokumente pro Monat schickt. Sein Fragensatz umfasst rund 2.150 Token und macht etwa 88% der Eingabe-Token pro Anfrage aus, weil die Fragen jedes Mal wortgleich erneut mitgeschickt werden. Seine Gesamtrechnung liegt unter 150 Dollar im Monat. Ein Allzweck-LLM, sagt er, würde das bei diesem Volumen nicht schaffen. Er bittet die Labore, Prompt-Caching oder wiederverwendbare Fragensätze einzubauen, und verweist auf eine offene Anfrage im Repository des TypeSafe SDK.

Andere bauen bereits Workarounds. Ein Projekt namens Jeb, am 29. September auf GitHub veröffentlicht, verwandelt jeden OpenAI-kompatiblen Endpunkt in einen Entscheidungsdienst im Jev-Stil. Es liest die Log-Wahrscheinlichkeiten der Token und gibt strukturiertes JSON unter POST /v1/systemone zurück. Das README benennt die Abhängigkeit deutlich: Eine API kann für gewöhnlichen Chat OpenAI-kompatibel sein und trotzdem die Logprobs vermissen lassen, die Jeb braucht. Wer einen Anbieter auswählt, muss diese Fähigkeit vorher prüfen. PostHog veröffentlichte am selben Tag Jeeves, ein 9B-Modell auf Basis von Qwen3.5-9B mit LoRA und einem Pointer-Head, das erst denkt und dann entscheidet, dazu einen Block-4-Diffusion-Drafter. Es meldet 0,889 auf dem eigenen zurückgehaltenen Testsplit gegenüber 0,857 für Jev und 0,822 für Kev-9B sowie 0,935 auf den öffentlichen Stufen von JevBench gegenüber 0,866 für Jev. Die Angabe von 0,3 s pro Anfrage gilt ohne Thinking; mit Thinking liegt der Median bei 3,3 s auf einer H100 bei fp8.

Ein warnender Datenpunkt kam am 28. September von Casco. Die Sicherheitsfirma schickte 2.449 Befunde durch acht Modelle, darunter Jev, Claude und GPT, und ließ jedes die acht Basis-Metriken von CVSS 3.1 auswählen. Jedes Modell schnitt im Durchschnitt besser ab als die veröffentlichte Referenz von Casco. Jev vergab 550 Critical-Bewertungen an einen Datensatz, der 55 veröffentlichte kritische Befunde enthielt. GPT-6 Astra hatte mit 1,92 Punkten den niedrigsten mittleren absoluten Fehler; Jev lag mit 3,40 auf Platz sieben. Strukturierte Ausgabe führte nicht zu besserem Urteilsvermögen bei der Schweregradeinschätzung.

An anderer Stelle veröffentlichte Sebastian Raschka am 29. September eine lange technische Geschichte der Textklassifikation, die Jev einordnen will. Er merkt an, dass Bag-of-Words mit Naive Bayes mindestens bis 1961 zurückreicht und dass selbst der ursprüngliche Spamfilter von Gmail angeblich darauf beruhte. Sein Urteil bleibt abgewogen: Für ein enges, klar umrissenes Problem wird ein Modell im Jev-Stil einen Spezialklassifikator vermutlich nicht schlagen, ist aber deutlich allgemeiner. Simple AI nutzte den Tag für den Start von Tango, einem audio-nativen Modell zur Erkennung des Sprecherwechsels. Es schlägt nach eigenen Angaben im Median 300 ms vor einem herkömmlichen Voice-Activity-Detector an und löst bei gleicher Abdeckung von Sprecherwechseln 3,7- bis 4,7-mal seltener mitten in einer Äußerung aus als Smart Turn. Im öffentlichen LiveKit-Benchmark verpasst es 15 von 400 echten Sprecherwechseln, gegenüber 54 bei Soniox und 197 bei Deepgram Flux.

Der rote Faden: Auf der Ebene der kleinen Modelle und der On-Device-Modelle findet der Einsatz tatsächlich statt, und dort werden die Messdebatten geführt. Die Karte von Qevi-2B stellt klar, dass sich seine Zahlen nur über das Logit-Readout reproduzieren lassen, nicht über .generate(): "If you call .generate() and parse the text, you will not reproduce them, because that is not the path the model was fine-tuned on." Das ist eine nützliche Warnung für alle, die solche Systeme benchmarken. Ein Modell kann schlechter aussehen als es ist, nur weil man es zum Sprechen auffordert.

Kommentare 0

Quellen

12
  1. 01d1: Liquid AI's First Decision ModelEN
  2. 02Qevi-2B: A Jev-style finetuned model for image classificationEN
  3. 03Please add prompt caching to Jev-style modelsEN
  4. 04Jeb: Turn any OpenAI API into a decision modelEN
  5. 05Jeeves. Reasoning improves Jev-like decision modelsEN
  6. 06Every model (incl. Jev) we tested inflates security finding severityEN
  7. 07Language Models for Text Classification: From Bag-of-Words to JevEN
  8. 08Tango: Simple AI's Conversational Awareness ModelEN
  9. 09The System One models ecosystemEN
  10. 10AI models keep posting screenshots showing sensitive data from inside tech companiesEN
  11. 11OpenAI announces 'dots' agent after scrapping launch of new AI model over safety concernsEN
  12. 12Language Models Act on Hidden ValenceEN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Lena Brandt

Lena Brandt

KI, Modelle und Technik

Lena Brandt schreibt für FLASH24 über Technik, KI und Modelle sowie Medien und Internet und stützt sich dabei auf Herstellerangaben, Studien und öffentlich zugängliche Datensätze, statt Pressemitteilungen ungeprüft zu übernehmen. Bei Modellvergleichen kontrolliert sie Benchmark-Werte, Trainingsdaten und Versionsnummern und rechnet Angaben zu Rechenleistung und Kosten selbst nach. Sie spricht mit Entwicklern und Forschern, wartet auf angekündigte Updates und vergleicht Releases, bevor sie eine Einschätzung abgibt. Privat beschäftigt sie sich mit 3D-Druck, alten Rechnern und der Frage, wie Modelle aus Internetmüll lernen – Themen, die regelmäßig in ihre Texte einfließen. Sie publiziert keine Zahlen, deren Quelle sie nicht selbst überprüfen konnte.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.