Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

Kleine Modelle lernen antworten, ohne zu schreiben: Entscheidungsmodelle kommen auf das Gerät

Am 29. September veröffentlichte Liquid AI die Dokumentation zu d1, seinem ersten Entscheidungsmodell. Es liefert in einem einzigen Aufruf kalibrierte Wahrscheinlichkeiten und erzeugt dabei kein einziges Token. Damit gehört es zu einer schnell wachsenden Klasse kleiner Klassifikatoren für das Gerät, zu der auch Jev, Qevi-2B und PostHogs Jeeves zählen.

KI & ModelleErklärtKatrin HoffmannVeröffentlicht: 29. September 20265 Min. LesezeitQuellen 6
Kleine Modelle lernen antworten, ohne zu schreiben: Entscheidungsmodelle kommen auf das Gerät

Das Versprechen ist eng und konkret: ein Modell, das nicht schreibt. Laut der am 29. September veröffentlichten Dokumentation von Liquid AI bewertet d1 einen Zustand und gibt Wahrscheinlichkeiten über eine feste Menge von Ausgängen zurück. Im Beispiel des Unternehmens geht eine Kundenbeschwerde ein, und zurück kommt eine einzige Zahl, 0.999, für die Frage "Is this message a complaint?"

Liquid nennt das Format ein Entscheidungsmodell. Unterstützt werden drei Fragetypen, die die Dokumentation schlicht beschreibt: Eine "noul"-Frage ist eine Ja/Nein-Frage und liefert eine Wahrscheinlichkeit zwischen 0 und 1. Eine "choice"-Frage liefert eine Verteilung über benannte Optionen. Eine "score"-Frage liefert eine wahrscheinlichkeitsgewichtete Position auf einer geordneten Skala. Die API-Antwort enthält ein Feld output_tokens, das immer null ist.

Warum die kleinen Modelle plötzlich interessant sind

Liquid ist nicht allein in dieser Ecke. Sebastian Raschka ordnet in seiner technischen Abhandlung vom 29. September zur Geschichte der Textklassifikation das junge Modell Jev zuerst als Klassifikator ein und erst danach als kulturelles Phänomen. Sein Argument: Bei einer engen Aufgabe ist Jev nicht besser oder billiger als ein eigens gebauter Klassifikator. Er ist aber deutlich allgemeiner als solche aufgabenspezifischen Modelle und zugleich viel schneller und billiger als ein Frontier-LLM.

Diese Kombination macht die Geschichte vom Betrieb auf dem Gerät plausibel: mittlere Allgemeinheit bei niedrigen Kosten pro Aufruf. Ein 2B- oder 9B-Modell, das eine Wahrscheinlichkeit statt eines Absatzes zurückgibt, läuft auf Hardware, die ein Frontier-Modell nicht erreicht.

Qevi-2B, am 29. September auf Hugging Face veröffentlicht, ist die Bild-Variante. Das Modell ist ein vollständiges Fine-Tuning von Qwen3-VL-2B-Instruct. Es beantwortet geschlossene Fragen zu Bildern, indem es die Logits an der Position liest, an der das Modell mit der Antwort beginnen würde. Text erzeugt es nicht. Die Modellkarte benennt den Kompromiss deutlich: "It is not a chat model. Ask it 'is there a ladder in this image?' and it returns P(Yes) = 0.97, not a sentence."

Die Karte meldet eine Genauigkeit von 0.977 im Trainingsbereich gegenüber 0.855 beim Basismodell und 0.889 auf zurückgehaltenen Domänen gegenüber 0.745. Der erwartete Kalibrierungsfehler auf zurückgehaltenen Daten sinkt von 0.160 auf 0.054. Dazu kommt eine Warnung an alle, die Temperaturskalierung obendrauf legen wollen: Bei T = 2.45 kehrt der ECE auf zurückgehaltenen Daten zu 0.160 zurück und löscht den gesamten Gewinn aus.

Die Geschwindigkeit ist die andere Hälfte der Behauptung. Qevi-2B gibt an, bis zu etwa 21x schneller zu sein, wenn viele Fragen zu einem Bild gestellt werden. Der Grund: Alle drei Beispielfragen teilen sich eine Kodierung und werden durch eine blockdiagonale Attention-Maske getrennt. Die Antworten seien identisch mit einzeln gestellten Fragen, bitweise geprüft, schreibt die Karte.

"The biggest risk factor that we're seeing is in legitimate AI being used by developers, but then doing things that should not be done," sagte Omer Singer, Mitgründer und CTO von Glow Security, in einem Interview mit The Register.

Der Haken: Agenten, die beim Helfen Daten preisgeben

Dieses Zitat hat wenig mit Klassifikationsgenauigkeit zu tun und alles mit dem Einsatz. The Register berichtete am 29. September, dass Forscher von Glow Security mehr als 13.000 sensible Screenshots von Unternehmenssoftwareprojekten aus 343 Firmen fanden, die KI-Agenten in öffentlichen GitHub-Repositories abgelegt hatten. Sie nennen es PixelLeak.

Der Mechanismus ist banal. GitHub hat keine API, um Bilder in Pull Requests hochzuladen. Also legen Agenten, die Vorher-nachher-Bilder der Oberfläche zeigen sollen, sie stattdessen in ein öffentliches Repository. Etwa ein Drittel der Funde stammte von Entwicklern, die gitshot nutzten, ein Open-Source-Werkzeug für Screenshots. Dessen eigener Datenschutzhinweis warnt, dass hochgeladene Bilder standardmäßig öffentlich sind.

Nichts davon wird von kleinen Modellen verursacht. Aber es ist die Umgebung, in der kleine Modelle angepriesen werden: billig genug, um ständig zu laufen, eingebettet in Entwicklerwerkzeuge, handelnd ohne einen Menschen in der Schleife. Ein Klassifikator, der auf einem Laptop läuft, zieht diese Schleife enger.

Reasoning, aber nur ein wenig

PostHogs Jeeves, am 29. September auf GitHub veröffentlicht, versucht das Genauigkeitsproblem Jev-artiger Modelle zu lösen, ohne das Format aufzugeben. Es ist ein 9B-Klassifikator im Jev-Stil auf Basis von Qwen3.5-9B mit LoRA und einem Pointer-Kopf. Trainiert wurde er darauf, vor der Entscheidung zu denken, mit einem Block-4-Diffusion-Drafter.

Die Zahlen im Repository vergleichen es mit Kev-9B und Jev auf Daten, auf denen es nie trainiert wurde: 0.889 gegenüber 0.822 und 0.857. Auf den öffentlichen Stufen von JevBench meldet es 0.935 gegenüber 0.866 bei Jev. Der Preis ist die Latenz. Ohne Denken dauert eine Anfrage etwa 0.3 Sekunden. Mit Denken sind es im Median 3.3 Sekunden auf einer H100 bei FP8-Präzision. Das Repository merkt an, dass ein Abschneiden der Kette das verkürzt.

Die Jeeves-Tabelle widerspricht zudem der einfachen Geschichte, dass Reasoning immer hilft. Auf MMLU-Pro erreicht es 0.739 gegenüber 0.840 bei Jev, auf MMLU 0.793 gegenüber 0.900. Die Autoren mitteln das nicht weg. Sie veröffentlichen die Werte nebeneinander.

Microsofts Entwicklerblog bringt in einem Beitrag vom 29. September über Agent Experience die allgemeine Fassung dieses Punktes. Benchmark-Werte treiben die Verbreitung, die Verbreitung treibt die Optimierung auf den Benchmark, und der Wert sagt nichts mehr über die eigene Codebasis aus. "A model that's excellent at Django might be mediocre at your internal framework that superficially resembles Django but works differently in critical ways," heißt es in dem Beitrag. Dieselbe Logik gilt für ein Entscheidungsmodell, das auf öffentlichen Stufen getestet und dann in die eigene Ticket-Warteschlange gestellt wird.

Auf dem Gerät laufen diese Fäden zusammen. Qevi-2B listet 21 GB Gewichte in bf16. Jeeves schreibt, ein Apple-Silicon-Mac brauche 48 GB oder mehr für die Standard-Caches, wobei FP8 die Gewichte auf 11.5 GB drückt und kleinere Cache-Einstellungen auf eine 48-GB-Maschine passen. Das ist kein Telefon. Es ist ein Laptop, und der ist weiterhin ein anderes Einsatzziel als ein Rechenzentrum. Genau deshalb leistet das Etikett "kleines Modell" hier echte Arbeit.

Was keine dieser Veröffentlichungen klärt, ist die Frage, ob der Klassifikationsansatz den Kontakt mit unordentlichen Produktionsfragen übersteht. Eine 0.97 lässt sich leicht schwellenwertsetzen. Bei einer Score-Frage mit ungemessener Kalibrierung geht das nicht, und genau das sagt Qevi-2Bs Karte über ihren eigenen "score"-Typ.

Kommentare 0

Quellen

6
  1. 01d1: Liquid AI's First Decision ModelEN
  2. 02Qevi-2B: A Jev-style finetuned model for image classificationEN
  3. 03Jeeves. Reasoning improves Jev-like decision modelsEN
  4. 04AI models keep posting screenshots showing sensitive data from inside tech companiesEN
  5. 05Language Models for Text Classification: From Bag-of-Words to JevEN
  6. 06What AI benchmarks are not telling youEN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Katrin Hoffmann

Katrin Hoffmann

KI, Modelle und Technik

Katrin Hoffmann schreibt für FLASH24 über Technik, KI und Modelle sowie Medien und Internet und stützt sich dabei auf Primärquellen wie Herstellerangaben, Studien und Protokolle statt auf Pressemitteilungen. Bei Benchmarks prüft sie Messmethoden, Testumgebungen und Reproduzierbarkeit, bevor sie Zahlen übernimmt. Für ihre Artikel spricht sie mit Entwicklern und Forschern, wartet auf Konferenzankündigungen und vergleicht Versionsstände von Modellen und Standards. Privat betreibt sie Selfhosting und Heimnetze und dokumentiert ihre eigene Infrastruktur, was ihrer Redaktionsarbeit zugutekommt. Sie veröffentlicht keine Zahlen ohne nachvollziehbare Quelle.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.