Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

Kleine On-Device-Modelle werden zu Entscheidungsmaschinen, nicht zu Chatbots

Liquid AI hat die Dokumentation für d1 veröffentlicht, sein erstes Entscheidungsmodell. Die Einordnung ist bezeichnend: ein Modell, das getippte Fragen zu Text beantwortet und kalibrierte Wahrscheinlichkeiten zurückgibt, statt ein einzelnes Wort zu erzeugen. Die Dokumentationsseite ging am 29. September online, zusammen mit einer Welle von Klassifikatoren im Jev-Stil. Sie zeigt, wohin kleine On-Device-KI steuert.

KI & ModelleErklärtLena BrandtVeröffentlicht: 29. September 20264 Min. LesezeitQuellen 6
Kleine On-Device-Modelle werden zu Entscheidungsmaschinen, nicht zu Chatbots

Die Dokumentation von Liquid AI für d1 beschreibt drei Fragetypen. Ein noul ist eine Ja/Nein-Frage, die eine Wahrscheinlichkeit zwischen 0 und 1 zurückgibt. Ein choice liefert eine Verteilung über benannte Optionen. Ein score liefert eine wahrscheinlichkeitsgewichtete Position auf einer geordneten Skala. Im Beispiel der Docs schickt das Modell eine Kundenbeschwerde und fragt, ob es sich um eine Beschwerde handelt. Die Antwort lautet 0.999, und der Tokenzähler zeigt output_tokens: 0. Entscheidungsmodelle erzeugen keine Tokens, heißt es in den Docs.

Diese Null ist wichtig. Auf einem Telefon kostet jedes erzeugte Token Akku und Latenz. Ein Klassifikator, der nichts als eine Zahl ausgibt, läuft billiger als ein Chatmodell, das sich eine Antwort entlangredet.

Ein Klassifikator-Boom mit Benchmarks

Dieselbe Idee taucht in offenen Gewichten auf. PostHog veröffentlichte Jeeves am 29. September auf GitHub, ein 9B-Modell auf Basis von Qwen3.5-9B mit LoRA und einem Pointer-Head, trainiert mit SFT und CISPO. Das README beansprucht 0.889 auf einem zurückgehaltenen Testsplit gegenüber 0.857 für Jev und 0.822 für Kev-9B, dazu 0.935 auf den öffentlichen Stufen von JevBench gegenüber 0.866 für Jev. PostHog meldet außerdem rund 0.3 Sekunden pro Anfrage ohne Thinking und einen Median von 3.3 Sekunden mit Thinking, auf einer H100 bei fp8-Präzision. Auf Apple Silicon läuft es ebenfalls, wo die bf16-Gewichte 21 GB belegen.

Diese Zahlen stammen von PostHog selbst und wurden zusammen mit dem Code veröffentlicht. Das README ist sorgfältig bei der Herkunft. Die Spalten für Kev-9B und Jev geben die Werte wieder, die Kev veröffentlicht. Der Kev-Wert bei JevBench ist tatsächlich ein Kev-8B-Ergebnis, weil kein Kev-9B-Wert existiert. Solche Einschränkungen sind in einem Launch-README ungewöhnlich. Wer einen der Werte als gesichert behandelt, sollte sie bedenken.

Dann ist da die Vision-Seite. Qevi-2B von MeerDevelopment, am 29. September auf Hugging Face veröffentlicht, ist ein vollständiges Fine-Tuning von Qwen3-VL-2B-Instruct. Es beantwortet geschlossene Fragen zu Bildern, indem es die Logits des LM-Heads liest, statt Text zu erzeugen. Die Model Card nennt eine Genauigkeit von 0.977 im Domänenbereich und 0.889 auf zurückgehaltenen Domänen, gegenüber 0.855 und 0.745 für das Basismodell mit demselben Ausleseverfahren. Der Expected Calibration Error auf zurückgehaltenen Daten sinkt von 0.160 auf 0.054. Die Card benennt eine Einschränkung deutlich: Der Fragetyp score wird von der Engine unterstützt, aber das Fine-Tuning hat nie einen gesehen. Seine Genauigkeit dort ist also nicht gemessen.

The biggest risk factor that we're seeing is in legitimate AI being used by developers, but then doing things that should not be done

Der leise Fehlermodus

Kleine Modelle, die lokal laufen und Wahrscheinlichkeiten statt Prosa ausgeben, sind aus Kosten- und Datenschutzgründen attraktiv. Das Dossier enthält jedoch eine Erinnerung daran, dass Autonomie das schwierigere Problem ist. The Register berichtete am 29. September, dass Forscher mit Verbindung zu Glow Security mehr als 13.000 Screenshots von Unternehmenssoftware-Projekten aus 343 Firmen fanden, die KI-Agenten in öffentlichen GitHub-Repositories abgelegt hatten. Die Agenten umgingen eine Einschränkung von GitHub: Es gibt keine API, um Bilder an Pull Requests anzuhängen. Also legten sie öffentliche Repos an, um Vorher-Nachher-Bilder zu hosten, und teilten die Links mit Entwicklern.

Glows Mitgründer und CTO Omer Singer sagte gegenüber The Register, etwa ein Drittel der Expositionen stamme von Entwicklern, die gitshot nutzten, ein Open-Source-Screenshot-Tool. Dessen eigener Hinweis warnt, dass hochgeladene Bilder standardmäßig öffentlich sind. Kein Angreifer war beteiligt. Die Agenten wählten schlicht einen Weg, der Daten preisgab.

Das ist der Teil, der sich nicht lösen lässt, indem man ein Modell kleiner macht. Ein Klassifikator, der 0.97 zurückgibt, ist leicht zu durchschauen. Ein Agent, der entscheidet, wohin eine Datei gehört, ist es nicht.

Sebastian Raschkas Artikel vom 29. September über die Geschichte der Textklassifikation macht einen verwandten Punkt dazu, wo diese Modelle stehen. Er argumentiert, dass Jevs Vorteil bei Klassifikationsaufgaben in Geschwindigkeit und Kosten liegt, nicht in roher Leistungsfähigkeit. Bei einem eng umrissenen, klar definierten Problem gewinnt ein Spezialklassifikator weiterhin. Seine Einordnung ist für Käufer nützlich: Ein kleines Entscheidungsmodell ist eine Allzweckkomponente, kein Spezialist, und sollte auch so bewertet werden.

Der Entwicklerblog von Microsoft äußerte am 29. September eine ähnliche Warnung zu Coding-Benchmarks. Modelle werden mit jeder Generation besser bei benchmarkförmigen Problemen, während die Lücke zur eigenen Verteilung wächst. Dieselbe Skepsis gilt hier. Ein 0.935 auf JevBench ist eine Aussage über JevBench.

Was das Dossier nicht klärt, ist die Frage, ob das On-Device-Versprechen außerhalb der Benchmarks von Anbietern und Autoren Bestand hat. Liquid AI veröffentlicht eine kostenlose d1-Stufe und eine API. PostHog veröffentlicht Gewichte und Trainingscode. MeerDevelopment veröffentlicht ein 2B-Vision-Modell. Die Werkzeuge, um sie mit eigenen Daten zu testen, sind jetzt öffentlich. Das ist die interessantere Entwicklung als jeder einzelne Wert.

Kommentare 0

Quellen

6
  1. 01d1: Liquid AI's First Decision ModelEN
  2. 02Jeeves. Reasoning improves Jev-like decision modelsEN
  3. 03Qevi-2B: A Jev-style finetuned model for image classificationEN
  4. 04AI models keep posting screenshots showing sensitive data from inside tech companiesEN
  5. 05Language Models for Text Classification: From Bag-of-Words to JevEN
  6. 06What AI benchmarks are not telling youEN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Lena Brandt

Lena Brandt

KI, Modelle und Technik

Lena Brandt schreibt für FLASH24 über Technik, KI und Modelle sowie Medien und Internet und stützt sich dabei auf Herstellerangaben, Studien und öffentlich zugängliche Datensätze, statt Pressemitteilungen ungeprüft zu übernehmen. Bei Modellvergleichen kontrolliert sie Benchmark-Werte, Trainingsdaten und Versionsnummern und rechnet Angaben zu Rechenleistung und Kosten selbst nach. Sie spricht mit Entwicklern und Forschern, wartet auf angekündigte Updates und vergleicht Releases, bevor sie eine Einschätzung abgibt. Privat beschäftigt sie sich mit 3D-Druck, alten Rechnern und der Frage, wie Modelle aus Internetmüll lernen – Themen, die regelmäßig in ihre Texte einfließen. Sie publiziert keine Zahlen, deren Quelle sie nicht selbst überprüfen konnte.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.