Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

Kleine Sprachmodelle wandern auf das Gerät, die Forschung hinkt hinterher

Apples OpenELM-Familie reicht von 270 Millionen bis 3 Milliarden Parametern, Googles Gemma 3 1B läuft mit 529MB, doch eine Arbeit von 2026 findet, dass Token-Konfidenzsignale in 91% der Datensatz-Modell-Kombinationen nahe null liegen.

KI & ModelleErklärtLena BrandtVeröffentlicht: 28. September 20264 Min. LesezeitQuellen 6
Kleine Sprachmodelle wandern auf das Gerät, die Forschung hinkt hinterher

Kleine Sprachmodelle mit weniger als 3 Milliarden Parametern laufen auf einem Telefon statt in einem Rechenzentrum. In rund zwei Jahren sind sie von der Forschungskuriosität zum ausgelieferten Produkt geworden. Das Versprechen ist einfach: Das Modell bleibt lokal, die Serverkosten sinken, die Nutzerdaten bleiben auf fremder Hardware. Die Belege sind gemischter als das Marketing nahelegt.

Apples Beitrag ist der klarste Ausgangspunkt. Am 24. April 2024 berichtete Ars Technica, das Unternehmen habe acht Modelle unter dem Namen OpenELM auf Hugging Face veröffentlicht, kurz für Open-source Efficient Language Models, unter einer Apple Sample Code License. Ars Technica merkte an, die Lizenz enthalte Einschränkungen, die nicht zur üblichen Definition von Open Source passen könnten. Der Quellcode ist trotzdem verfügbar. Die Modelle reichen von 270 Millionen bis 3 Milliarden Parametern, in vier vortrainierten und vier instruktionsoptimierten Varianten, mit einem maximalen Kontextfenster von 2.048 Token. Apples Whitepaper nennt eine "layer-wise scaling strategy". Sie brachte einen Genauigkeitsgewinn von 2,36 Prozent gegenüber Allen AIs OLMo 1B und verbrauchte dabei halb so viele Vortrainings-Token.

Ars Technica ordnete das ein: Metas Llama-3-Familie erreichte damals bis zu 70 Milliarden Parameter, eine Version mit 400 Milliarden war in Entwicklung, und OpenAIs GPT-3 von 2020 kam mit 175 Milliarden. Die Parameterzahl ist ein grobes Maß, kein Urteil.

Was die Benchmark-Arbeiten tatsächlich messen

SlimLM, am 15. November 2024 auf arXiv veröffentlicht, wählte einen engeren Weg: Dokumentenassistenz. Die Autoren Thang M. Pham und vier Mitautoren testeten Modelle von 125M bis 7B Parametern auf einem Samsung Galaxy S24. Sie trainierten auf SlimPajama-627B vor und stimmten die Modelle auf einem selbst gebauten Datensatz namens DocAssist fein, für Zusammenfassung, Fragebeantwortung und Vorschlagsaufgaben. Das Abstract beansprucht vergleichbare oder bessere Leistung gegenüber bestehenden kleinen Modellen und beschreibt eine Android-Anwendung als Deployment-Referenz. Das ist ein nützlicher Datenpunkt, weil er Hardware, Aufgabe und Modellgrößen zusammen nennt. Die meisten On-Device-Behauptungen tun das nicht.

Googles AI-Edge-Team ging breiter vor. In einem Entwicklerblogbeitrag vom 20. Mai 2025 kündigten Mark Sherwood, Matthew Chan, Marissa Ikonomidis und Milen Ferev Unterstützung für mehr als ein Dutzend Modelle an, darunter Gemma 3 und Gemma 3n, gehostet in einer neuen LiteRT-Hugging-Face-Community. Gemma 3 1B ist 529MB groß und schafft bis zu 2.585 Token pro Sekunde beim Pre-Fill auf der mobilen GPU. Laut Google verarbeitet es damit bis zu einer Seite Inhalt in unter einer Sekunde. Gemma 3n in den Varianten 2B und 4B wird als Gemmas erstes multimodales On-Device-Sprachmodell beschrieben, mit Unterstützung für Text, Bild, Video und Audio, wobei Text und Bild zuerst verfügbar sind. Der Beitrag führt außerdem On-Device-RAG- und Function-Calling-Bibliotheken ein, beide zum Start auf Android verfügbar.

Dann kommt die skeptische Ebene. Eine Arbeit mit dem Titel "Do small language models know what they don't know?" wurde am 21. Juli 2026 von Prashant Mudgal auf arXiv eingereicht. Sie bewertet sieben Ansätze für entropiebasierte Konfidenz über 7 Modellpaare und 5 NLU-Benchmarks. Der Hauptbefund ist nüchtern: Token-Entropie ist in kleinen Modellen praktisch blind. Sie liegt in 91% der Datensatz-Modell-Kombinationen nahe null, unabhängig davon, ob die Antwort richtig ist. Semantische Entropie liefert ein brauchbares Signal. Sie wird berechnet, indem man Antworten sampelt und nach Bedeutung clustert. Das Weiterleiten unsicherer Anfragen an ein größeres Expertenmodell verbesserte die Genauigkeit um bis zu 50 Prozentpunkte. Familienübergreifendes Routing erreichte im Mittel +22,0%, Routing innerhalb derselben Familie +6,8%.

Schlussfolgern ohne laufenden Kommentar

Science News berichtete am 22. September 2026 über BDH-CQ, ein kleines experimentelles System, das am 10. August auf arXiv eingereicht wurde und einige Denkaufgaben löst, ohne Zwischenschritte auszuschreiben. Die Komplexitätsforscherin Zuzanna Stamirowska, CEO des KI-Unternehmens Pathway, sagte zu Science News: "Once the query arrives, the model doesn't write out its thinking in words at all." Das Modell löste mit zwei Versuchen fast drei von zehn Aufgaben im öffentlichen ARC-AGI-1-Evaluationsset. Stamirowska und Kollegen schätzen die Kosten pro Aufgabenabfrage auf etwa $0,00070. Das ist rund ein Elftel von GPT-5.6 Luna im selben Benchmark. Science News merkt an, dass die beiden Kosten unterschiedlich berechnet wurden und die Studie nicht begutachtet ist.

Nicht alle sind überzeugt. Der Informatiker Yuntian Deng von der University of Waterloo sagte zu Science News, das Ergebnis sei "an interesting efficiency result". Es zeige aber nicht, dass die Architektur besser sei als andere Ansätze, und ohne ausgeschriebenes Schlussfolgern sei das Modell schwerer zu prüfen. Jonas Geiping vom ELLIS Institute Tübingen und dem Max-Planck-Institut für Intelligente Systeme nannte den Ansatz "neat". BDH-CQ sei aber gezielt für ARC-artige Probleme gebaut, was den direkten Vergleich mit Allzwecksystemen erschwere.

Der Einsatz läuft den Arbeiten bereits davon. Imbues Bouncer, ein am 8. April 2026 veröffentlichter Filter für den Twitter-Feed, nutzt ein Open-Source-Modell zur Klassifikation, das die Firma Gemma 4 26B-A4B nennt. Ausgeliefert wird es vorerst aus dem eigenen Rechenzentrum von Imbue. Der Ingenieur Millan Philipose schreibt, das Team arbeite daran, es direkt auf Laptops und Telefonen laufen zu lassen. Die Lücke zwischen diesem Anspruch und einem 529MB großen Modell auf einem Handgerät ist der Ort, an dem die meisten Behauptungen der nächsten Runde geprüft werden.

Kommentare 0

Quellen

6
  1. 01Apple releases eight small AI language models aimed at on-device useEN
  2. 02SlimLM: An Efficient Small Language Model for On-Device Document AssistanceEN
  3. 03On-device small language models with multimodality, RAG, and Function CallingEN
  4. 04Do small language models know what they don't know?EN
  5. 05Can AI reason without words? A small model puts the idea to the testEN
  6. 06Show HN: Control your X/Twitter feed using a small on-device LLMEN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Lena Brandt

Lena Brandt

KI, Modelle und Technik

Lena Brandt schreibt für FLASH24 über Technik, KI und Modelle sowie Medien und Internet und stützt sich dabei auf Herstellerangaben, Studien und öffentlich zugängliche Datensätze, statt Pressemitteilungen ungeprüft zu übernehmen. Bei Modellvergleichen kontrolliert sie Benchmark-Werte, Trainingsdaten und Versionsnummern und rechnet Angaben zu Rechenleistung und Kosten selbst nach. Sie spricht mit Entwicklern und Forschern, wartet auf angekündigte Updates und vergleicht Releases, bevor sie eine Einschätzung abgibt. Privat beschäftigt sie sich mit 3D-Druck, alten Rechnern und der Frage, wie Modelle aus Internetmüll lernen – Themen, die regelmäßig in ihre Texte einfließen. Sie publiziert keine Zahlen, deren Quelle sie nicht selbst überprüfen konnte.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.