Kleine Sprachmodelle wandern aufs Gerät: Apple, Google, Imbue und Cactus setzen auf lokale KI
Apple, Google und mehrere kleinere Anbieter bringen kleine Sprachmodelle auf Telefone, Laptops und Wearables. Sie setzen darauf, dass die Inferenz lokal läuft und nicht in einem Rechenzentrum.

Apple veröffentlichte im April 2024 acht kleine Sprachmodelle mit verfügbarem Quellcode unter dem Namen OpenELM. Sie reichen von 270 Millionen bis 3 Milliarden Parametern, wie Ars Technica berichtet. Die Modelle erschienen auf Hugging Face unter einer Apple Sample Code License. Ars Technica merkte an, dass die Lizenz wegen ihrer Einschränkungen möglicherweise nicht der üblichen Definition von Open Source entspricht, obwohl der Quellcode verfügbar ist.
Vier der acht sind vortrainiert, vier sind instruktionsoptimiert. Alle teilen sich ein maximales Kontextfenster von 2.048 Token. Trainiert wurden sie mit RefinedWeb, einer deduplizierten Version von PILE, einer Teilmenge von RedPajama und einer Teilmenge von Dolma v1.6. Apple zufolge sind das insgesamt rund 1,8 Billionen Token.
Apples Whitepaper behauptet, eine schichtweise Skalierungsstrategie habe OpenELM einen Genauigkeitsgewinn von 2,36 Prozent gegenüber OLMo 1B von Allen AI gebracht, bei halb so vielen Vortrainings-Token. Das Unternehmen veröffentlichte außerdem CoreNet, die Trainingsbibliothek, dazu reproduzierbare Trainingsrezepte, mit denen sich die Gewichte nachbauen lassen. Ars Technica nannte das für einen großen Technikkonzern damals ungewöhnlich.
Parameterzahlen sind ein grobes Maß für Leistungsfähigkeit, und Apples Modelle liegen deutlich unter den größten Systemen. Metas Llama-3-Familie hatte 70 Milliarden Parameter erreicht, eine Version mit 400 Milliarden war in Arbeit. OpenAIs GPT-3 erschien 2020 mit 175 Milliarden. Die Forschungsannahme lautet, dass kleine Modelle heute erreichen können, was viel größere vor einigen Jahren leisteten.
Google ergänzt Modalitäten, RAG und Funktionsaufrufe
Googles AI-Edge-Team erklärte am 20. Mai 2025, es habe die Unterstützung für kleine On-Device-Sprachmodelle von vier anfänglichen Modellen auf mehr als ein Dutzend erweitert. Dazu gehören Gemma 3 und Gemma 3n, gehostet in einer neuen LiteRT-Community auf Hugging Face. Gemma 3n kam als frühe Vorschau. Es sei Gemmas erstes multimodales kleines On-Device-Sprachmodell, mit Varianten von 2B und 4B Parametern, die Text-, Bild-, Video- und Audioeingaben unterstützen. Text und Bild waren zuerst auf Hugging Face verfügbar, Audio sollte folgen.
Google bezifferte auch die Kompressionsarbeit. Das Unternehmen erklärte, die Int4-Quantisierung nach dem Training könne Sprachmodelle um den Faktor 2,5 bis 4 gegenüber bf16 verkleinern und dabei Latenz und Spitzenspeicher senken. Gemma 3 1B kommt auf 529MB und schafft auf einer mobilen GPU bis zu 2.585 Token pro Sekunde im Prefill. Google zufolge reicht das, um eine Seite Inhalt in unter einer Sekunde zu verarbeiten.
Zwei Bibliotheken erschienen zusammen mit den Modellen. Die AI Edge RAG Library, zum Start auf Android verfügbar, erlaubt einem Modell, auf anwendungsspezifische Daten zuzugreifen, ohne feinabgestimmt zu werden. Google zufolge findet sie die relevantesten Stücke aus 1.000 Seiten oder 1.000 Fotos. Die Function Calling Library, ebenfalls zuerst für Android, lässt ein Modell entscheiden, wann es vordefinierte Funktionen aufruft. Eine Beispiel-App füllt damit ein medizinisches Formular aus diktierter Sprache.
Die Reproduzierbarkeit und Transparenz großer Sprachmodelle sind entscheidend für den Fortschritt offener Forschung, für die Verlässlichkeit der Ergebnisse und für Untersuchungen zu Daten- und Modellverzerrungen sowie zu möglichen Risiken.
Diese Zeile stammt aus der Zusammenfassung von Apples OpenELM-Paper, zitiert von Ars Technica. Apple warnte außerdem, dass die Modelle, weil sie auf öffentlich zugänglichen Datensätzen trainiert wurden, Ausgaben erzeugen können, die ungenau, schädlich, voreingenommen oder anstößig sind. Ars Technica berichtete, iOS 18, das im Juni auf der WWDC vorgestellt werden sollte, enthalte Gerüchten zufolge On-Device-KI-Funktionen. Möglich sei auch, dass Apple Google oder OpenAI für schwerere Verarbeitung außerhalb des Geräts engagiert.
Benchmarks auf einem Telefon, und ein Filter für den eigenen Feed
Ein arXiv-Paper vom November 2024 von Forschern um Thang M. Pham stellte SlimLM vor, eine Reihe von Modellen für Dokumentenassistenz auf Mobilgeräten. Die Autoren führten Experimente auf einem Samsung Galaxy S24 durch. Sie suchten nach Abwägungen zwischen Modellgröße von 125M bis 7B Parametern, Kontextlänge und Inferenzzeit. SlimLM wurde auf SlimPajama-627B vortrainiert und auf DocAssist feinabgestimmt, einem Datensatz, den die Autoren für Zusammenfassung, Fragebeantwortung und Vorschlagsaufgaben erstellten. Sie lieferten auch eine Android-Anwendung mit.
Imbues Bouncer geht einen anderen Weg. Veröffentlicht am 8. April 2026 und aktualisiert am 25. September 2026, filtert es einen X/Twitter-Feed anhand einer Beschreibung in einfacher Sprache. Zum Einsatz kommt ein Open-Source-Modell, das das Unternehmen Gemma 4 26B-A4B nennt. Imbue zufolge wird das Modell vorerst aus dem eigenen Rechenzentrum ausgeliefert, während daran gearbeitet wird, es direkt auf einem Laptop oder Telefon laufen zu lassen. Bouncer ist als Chrome-Erweiterung, Firefox-Add-on und iPhone-App verfügbar. Unterstützung für Reddit, LinkedIn und Safari ist angekündigt.
Cactus Computes Needle 3, veröffentlicht am 18. September 2026, geht noch kleiner. Das Unternehmen beschreibt gestaffelte Modelle mit 29-121M Parametern, die 9 bis 29 MB große CQ2-Bit-Binärdateien erzeugen. Auf einem Raspberry Pi 5 erreichen sie 400 bis 4.000 Token pro Sekunde im Decode und 1 bis 10.000 Token pro Sekunde im Prefill. Cactus zufolge kann das 4-Schicht-Subnetz DeepSeek V4 Flash erreichen, wenn es eine Epoche lang auf Downstream-Aufgaben abgestimmt wird.
Needle 3 zielt auf Werkzeugaufrufe, strukturierte Extraktion und Texteinbettung, mit genannten Anwendungsfällen in Smart Homes, Robotern, Telefonen, Wearables, AR-Brillen, Autos und PCs. Jede Antwort trägt einen Konfidenzwert aus einem kalibrierten Kopf. Die Engine setzt eine Untergrenze von 0,1 an. Darunter werden Aufrufe zurückgehalten und in ein Feld suppressed_calls geschrieben.
Ein Forschungsergebnis läuft der Begeisterung zuwider. Ein am 21. Juli 2026 eingereichtes Paper von Prashant Mudgal fand, dass Token-Entropie in Modellen unter 3 Milliarden Parametern praktisch blind ist. In 91 Prozent der Datensatz-Modell-Kombinationen lag die mittlere Token-Entropie nahe null, unabhängig davon, ob die Antwort richtig war. Semantische Entropie, berechnet durch mehrfaches Abtasten von Antworten und deren Clusterung nach Bedeutung, lieferte ein brauchbares Signal. Unsichere Anfragen an ein größeres Expertenmodell weiterzuleiten verbesserte die Genauigkeit um bis zu 50 Prozentpunkte. Routing über Modellfamilien hinweg erreichte im Mittel +22,0 Prozent gegenüber +6,8 Prozent innerhalb derselben Familie.
Das Paper benennt ohne Umschweife, was das für lokale Inferenz bedeutet. Der Wert von Entropieverfahren in kleinen Modellen liegt ihm zufolge nicht in Recheneinsparungen, sondern in intelligenter Rechenallokation: mehr Token dort ausgeben, wo sie am meisten zählen. Vorerst stützt sich das Versprechen von On-Device-KI damit auf Privatsphäre, Latenz und Kosten. Die schwierigere Frage der Zuverlässigkeit bleibt offen.
Quellen
6- 01Apple releases eight small AI language models aimed at on-device useEN
- 02SlimLM: An Efficient Small Language Model for On-Device Document AssistanceEN
- 03On-device small language models with multimodality, RAG, and Function CallingEN
- 04Do small language models know what they don't know?EN
- 05Show HN: Control your X/Twitter feed using a small on-device LLMEN
- 06Show HN: Cactus Needle 3: 8-29MB automation models can match DeepSeek V4 FlashEN
Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.
Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.
Kommentare
0- Noch keine Kommentare — seien Sie der Erste.