Kleine Sprachmodelle laufen auf dem Gerät, doch die Konfidenzsignale hinken hinterher
Apples OpenELM-Familie reicht von 270 Millionen bis 3 Milliarden Parametern, Google liefert Gemma 3n inzwischen mit Text-, Bild-, Video- und Audioeingaben aus. Ein arXiv-Papier von 2026 berichtet jedoch, dass Token-Entropie bei Modellen unter 3 Milliarden Parametern praktisch blind ist.

Kleine Sprachmodelle auf dem Gerät sind längst keine Forschungskuriosität mehr. In zwei Jahren sind aus Proof-of-Concept-Gewichten auf Hugging Face ausgelieferte Bibliotheken geworden, mit Retrieval, Function Calling und multimodalen Eingaben. Das Versprechen bleibt gleich: Die Inferenz läuft auf dem Telefon oder Laptop, die Serverkosten sinken, die Nutzerdaten bleiben lokal.
Nicht mitgehalten hat die Werkzeugkiste, die diesen Modellen sagt, wann sie falschliegen.
Von acht winzigen Modellen zu einer Bibliothek
Apple eröffnete diese Phase am 24. April 2024. Das Unternehmen veröffentlichte acht quelloffene Sprachmodelle unter dem Namen OpenELM, kurz für Open-source Efficient Language Models, wie Ars Technica berichtet. Die Modelle reichten von 270 Millionen bis 3 Milliarden Parametern, aufgeteilt in vier vortrainierte und vier instruktionsoptimierte Varianten. Zum Maßstab merkte Ars Technica an, dass Metas Llama-3-Familie damals bei 70 Milliarden Parametern endete und eine Version mit 400 Milliarden in Arbeit war, während OpenAIs GPT-3 von 2020 mit 175 Milliarden ausgeliefert wurde.
Apples Behauptung betraf nicht nur die Größe. Das Unternehmen erklärte, seine schichtweise Skalierungsstrategie verteile Parameter effizienter über die Schichten. Sein Whitepaper berichtete von einer Genauigkeitsverbesserung um 2,36 Prozent gegenüber Allen AIs OLMo 1B bei halb so vielen Vortrainings-Tokens. Apple veröffentlichte außerdem die Trainingsbibliothek CoreNet und reproduzierbare Trainingsrezepte. Ars Technica nannte das für ein großes Tech-Unternehmen ungewöhnlich. Die Modelle hatten ein Kontextfenster von 2.048 Tokens. Trainiert wurden sie auf RefinedWeb, einem deduplizierten PILE, einer Teilmenge von RedPajama und einer Teilmenge von Dolma v1.6, insgesamt rund 1,8 Billionen Tokens.
Es besteht die Möglichkeit, dass diese Modelle als Reaktion auf Nutzereingaben ungenaue, schädliche, voreingenommene oder anstößige Ausgaben erzeugen, warnte Apple in seinem Papier, wie von Ars Technica zitiert.
Dieser Vorbehalt wiegt schwerer, je weiter diese Modelle das Labor verlassen.
Google macht aus SLMs eine Plattform
Bis Mai 2025 hatte sich der Rahmen geändert: Statt Modelle zu veröffentlichen, ging es nun um die Unterstützung eines Ökosystems. Googles AI-Edge-Team erklärte, es habe die Unterstützung auf dem Gerät von vier anfänglichen Modellen auf mehr als ein Dutzend erweitert, gehostet in einer neuen LiteRT-Hugging-Face-Community, darunter Gemma 3 und Gemma 3n.
Gemma 3n erschien als frühe Vorschau und wurde als Gemmas erstes multimodales kleines Sprachmodell für das Gerät beschrieben, mit Varianten zu 2B und 4B Parametern, die Text, Bild, Video und Audio unterstützen. Google erklärte, Text- und Bildmodalitäten seien auf Hugging Face verfügbar, Audio solle folgen. Das Unternehmen verwies zudem auf Gemma 3 1B mit 529 MB. Nach eigenen Angaben erreicht es bis zu 2.585 Tokens pro Sekunde beim Pre-Fill auf einer mobilen GPU, genug, um eine Seite Inhalt in unter einer Sekunde zu verarbeiten.
Der folgenreichere Teil der Ankündigung war die Infrastruktur. Google lieferte eine Bibliothek für Retrieval Augmented Generation auf dem Gerät, zum Start auf Android verfügbar, und eine Bibliothek für Function Calling auf dem Gerät, ebenfalls zuerst für Android. Die RAG-Bibliothek erlaubt einem Modell, auf anwendungsspezifische Daten ohne Fine-Tuning zuzugreifen. Google erklärte, sie könne die relevantesten Teile aus 1.000 Seiten Information oder 1.000 Fotos herausziehen. Die Function-Calling-Bibliothek lässt ein Modell entscheiden, wann es vordefinierte Funktionen oder APIs aufruft. Googles Beispiel-App zeigt das Ausfüllen eines Formulars aus diktierter Sprache, die Umwandlung von Stimme in Text, das Extrahieren von Feldern und den Aufruf von Anwendungsfunktionen.
Google beschrieb außerdem neue int4-Quantisierungsschemata nach dem Training. Sie verringern die Modellgröße nach eigenen Angaben um den Faktor 2,5 bis 4 gegenüber bf16, bei sinkender Latenz und sinkendem Spitzenverbrauch an Speicher. Solche Engineering-Details entscheiden, ob ein Modell ausgeliefert wird oder eine Demo bleibt.
SlimLM und der Samsung-Benchmark
Die akademische Arbeit lief parallel. Ein am 15. November 2024 bei arXiv eingereichtes und bis zum 25. November überarbeitetes Papier stellte SlimLM vor, eine Reihe kleiner Sprachmodelle, optimiert für Dokumentenhilfe auf mobilen Geräten. Die Autoren Thang M. Pham, Phat T. Nguyen, Seunghyun Yoon, Viet Dac Lai, Franck Dernoncourt und Trung Bui führten Experimente auf einem Samsung Galaxy S24 durch. Sie kartierten die Abwägungen zwischen Modellgröße, von 125M bis 7B Parametern, Kontextlänge und Inferenzzeit.
SlimLM wurde auf SlimPajama-627B vortrainiert und auf DocAssist feinabgestimmt, einem Datensatz, den die Autoren für Zusammenfassung, Fragebeantwortung und Vorschlagsaufgaben erstellten. Das Abstract sagt, das kleinste Modell habe auf dem S24 effizient gearbeitet, während größere Varianten innerhalb der mobilen Grenzen mehr Fähigkeiten boten. Die Arbeit schneide im Vergleich mit bestehenden kleinen Sprachmodellen günstig ab. Die Autoren veröffentlichten zudem eine Android-Anwendung. Den Nutzen beschrieben sie als geringere Serverkosten und besseren Datenschutz durch Verarbeitung auf dem Gerät.
Das Konfidenzproblem
Dann ist da die Frage, ob diese Modelle wissen, was sie nicht wissen. Ein am 21. Juli 2026 bei arXiv eingereichtes Papier von Prashant Mudgal untersuchte entropiebasierte Konfidenzsignale in kleinen Sprachmodellen mit weniger als 3 Milliarden Parametern, die vollständig auf Verbraucherhardware laufen. Es bewertete sieben Ansätze über 7 Modellpaare und 5 Standard-NLU-Benchmarks.
Das Hauptresultat ist unbequem. Token-Entropie war praktisch blind: In 91 Prozent der Datensatz-Modell-Kombinationen lag die mittlere Token-Entropie nahe null, unabhängig davon, ob die Antwort richtig war. Laut Papier macht das tokenbasierte Konfidenzsignale in dieser Größenordnung unbrauchbar.
Semantische Entropie schnitt besser ab. Die Methode erzeugt mehrere Stichproben, clustert Antworten nach Bedeutung und misst die Verteilungsunsicherheit. So gewann sie ein brauchbares Konfidenzsignal. Wurde sie genutzt, um unsichere Anfragen an ein größeres Expertenmodell weiterzuleiten, ergaben sich Genauigkeitsverbesserungen von bis zu 50 Prozentpunkten. Das Routing über Familiengrenzen hinweg, das Papier nennt als Beispiel SmolLM 360M zu Phi-3.5-mini, erreichte im Schnitt 22,0 Prozent Verbesserung gegenüber 6,8 Prozent beim Routing innerhalb derselben Familie. Der Autor schließt daraus, dass der Wert von Entropiemethoden in kleinen Modellen nicht in Recheneinsparungen liegt, sondern in intelligenter Rechenzuweisung. Mehr Tokens sollen dorthin fließen, wo sie am meisten zählen.
Schlussfolgern ohne Worte
Eine separate Arbeitslinie fragt, ob kleine Modelle ihre Schlussfolgerungen überhaupt ausschreiben müssen. Science News berichtete am 22. September 2026, dass ein kleines experimentelles System namens BDH-CQ, wobei DH für Dragon Hatchling steht, einige Denkrätsel lösen kann, ohne Zwischenschritte auszubuchstabieren. Das Papier wurde am 10. August bei arXiv eingereicht und ist nicht begutachtet.
Statt Beispiele im Kontext zu halten, nutzt BDH-CQ jedes Beispiel, um einen Speicher fester Größe zu aktualisieren. Zuzanna Stamirowska, Komplexitätsforscherin und CEO des KI-Unternehmens Pathway, sagte Science News, sobald die Anfrage eintreffe, schreibe das Modell sein Denken überhaupt nicht in Worten aus. "Nichts dazwischen wird je in Sprache umgewandelt", sagte sie.
Stamirowska und Kollegen berichteten, das Modell habe bei zwei Versuchen fast drei von zehn Rätseln im öffentlichen Evaluationssatz ARC-AGI-1 gelöst. Es bewältigte einige Aufgaben zum Drehen und Bewegen von Formen, hatte aber Mühe mit Farbänderungen und einigen Regelkombinationen. Bei schwereren Ordnungs- und Verschachtelungsrätseln war es besser, nachdem es ein Beispiel ähnlicher Schwierigkeit gesehen hatte.
Die Kostenbehauptung ist auffällig. Die Forscher schätzen, dass jede Rätselanfrage etwa 0,00070 Dollar kostet, rund ein Elftel dessen, was GPT-5.6 Luna beim selben Benchmark verbraucht. Science News merkt an, dass die beiden Kosten unterschiedlich berechnet wurden. Die Reaktion externer Forscher war zurückhaltend. Yuntian Deng von der University of Waterloo nannte es ein interessantes Effizienzergebnis, sagte aber, es zeige nicht, dass die zugrunde liegende Architektur besser sei als andere Ansätze. Ohne ausgeschriebene Schlussfolgerungen sei das Modell zudem schwerer zu prüfen. Jonas Geiping vom ELLIS Institute Tübingen und dem Max-Planck-Institut für Intelligente Systeme sagte, das Modell sei speziell für Probleme im ARC-Stil gebaut, was einen direkten Vergleich mit Allzwecksystemen schwierig mache. Den Ansatz nannte er sauber und merkte an, dass er Testprobleme ohne Neutraining angehen kann.
Auslieferung vor Verständnis
Imbues Bouncer, ein am 8. April 2026 veröffentlichter Filter für den Twitter-Feed, zeigt, wie der Einsatz in der Praxis aussieht. Das Werkzeug klassifiziert Beiträge mit einem Open-Source-Modell, das der Blogbeitrag Gemma 4 26B-A4B nennt. Es sei groß genug, um Kontext zu verstehen, aber klein genug, um mit der Scrollgeschwindigkeit mitzuhalten. Imbue erklärt, es betreibe das Modell derzeit aus dem eigenen Rechenzentrum und arbeite daran, es direkt auf Laptops und Telefonen laufen zu lassen. Bouncer sei als Chrome-Erweiterung, Firefox-Add-on und iPhone-App verfügbar, mit zugesagter Unterstützung für Reddit, LinkedIn und Safari.
Das Muster über diese Projekte hinweg ist gleichbleibend. Fähigkeit und Verbreitung bewegen sich schneller als die Evaluation. Apple lieferte Gewichte mit einem offenen Hinweis auf ungenaue oder voreingenommene Ausgaben. Google lieferte Retrieval und Function Calling, damit Modelle auf Anwendungsdaten handeln können. SlimLM benchmarkte Dokumentenaufgaben auf echter Hardware. Mudgals Papier fand, dass das billigste Konfidenzsignal unter 3 Milliarden Parametern nicht funktioniert und ein teureres schon. BDH-CQ legt nahe, dass ein Teil des Schlussfolgerns ohne Sprache ablaufen kann, während Forscher warnen, dass unausgesprochenes Schlussfolgern schwerer zu prüfen ist.
Quellen
6- 01Apple releases eight small AI language models aimed at on-device useEN
- 02SlimLM: An Efficient Small Language Model for On-Device Document AssistanceEN
- 03On-device small language models with multimodality, RAG, and Function CallingEN
- 04Do small language models know what they don't know?EN
- 05Can AI reason without words? A small model puts the idea to the testEN
- 06Show HN: Control your X/Twitter feed using a small on-device LLMEN
Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.
Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.
Kommentare
0- Noch keine Kommentare — seien Sie der Erste.