Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

Kleine Sprachmodelle wechseln aufs Gerät: was die Zahlen wirklich zeigen

Kleine Sprachmodelle verlassen das Rechenzentrum und wandern aufs Telefon. Die veröffentlichten Ergebnisse zeigen ein uneinheitliches Bild: Apples OpenELM-Reihe reicht von 270 Millionen bis 3 Milliarden Parametern, ein Google-Modell ist ein 529 MB großer Download und schafft auf einer mobilen GPU bis zu 2.585 Token pro Sekunde.

KI & ModelleAnalyseKatrin HoffmannVeröffentlicht: 27. September 20264 Min. LesezeitQuellen 5
Kleine Sprachmodelle wechseln aufs Gerät: was die Zahlen wirklich zeigen

Apple veröffentlichte am 24. April 2024 acht kleine Sprachmodelle unter dem Sammelnamen OpenELM, kurz für Open-source Efficient Language Models. Das berichtet Ars Technica. Die Modelle reichen von 270 Millionen bis 3 Milliarden Parametern und liegen auf Hugging Face unter einer Apple Sample Code License. Ars Technica wies darauf hin, dass die Lizenz Einschränkungen enthält. Damit erfüllt die Veröffentlichung womöglich nicht die übliche Definition von Open Source, obwohl der Quellcode verfügbar ist.

Die acht Modelle gibt es in zwei Varianten: vier vortrainierte und vier instruktionsoptimierte. Das maximale Kontextfenster beträgt 2.048 Token. Als Trainingsdaten nennt Apple RefinedWeb, eine Version von PILE ohne Duplikate, dazu eine Teilmenge von RedPajama und eine Teilmenge von Dolma v1.6, insgesamt rund 1,8 Billionen Token. Laut Whitepaper brachte die schichtweise Skalierungsstrategie des Unternehmens 2,36 Prozent mehr Genauigkeit als OLMo 1B von Allen AI, bei halb so vielen Vortrainings-Token. Apple veröffentlichte außerdem CoreNet, die Trainingsbibliothek, samt reproduzierbaren Trainingsrezepten. In der Zusammenfassung des Papers heißt es, Reproduzierbarkeit und Transparenz großer Sprachmodelle seien wesentlich, um offene Forschung voranzubringen.

Der Größenunterschied zu anderen Modellen ist deutlich. Ars Technica bezifferte die größte Veröffentlichung von Meta Llama 3 mit 70 Milliarden Parametern, eine Version mit 400 Milliarden ist unterwegs. OpenAIs GPT-3 von 2020 hatte 175 Milliarden. Die Parameterzahl ist ein grobes Maß für Leistungsfähigkeit, kein Urteil.

Was Telefon-Benchmarks zeigen

SlimLM wurde am 15. November 2024 bei arXiv eingereicht und am 25. November überarbeitet. Es ist eine Reihe kleiner Sprachmodelle für Dokumentenassistenz. Die Autoren experimentierten auf einem Samsung Galaxy S24 und untersuchten die Abwägungen zwischen Modellgröße (125M bis 7B Parameter), Kontextlänge und Inferenzzeit. SlimLM wurde auf SlimPajama-627B vortrainiert und auf DocAssist feinabgestimmt, einem Datensatz, den die Autoren für Zusammenfassung, Fragebeantwortung und Vorschlagsaufgaben erstellten. Eine Android-Anwendung begleitet das Paper. Als Beweggründe nennen die Autoren geringere Serverkosten und besseren Datenschutz durch Verarbeitung auf dem Gerät.

Googles Beitrag, am 20. Mai 2025 im Developers Blog beschrieben, ist stärker produktförmig. Google AI Edge erweiterte die Unterstützung von vier anfänglichen Modellen auf über ein Dutzend, darunter Gemma 3 und Gemma 3n, gehostet in einer LiteRT Hugging Face Community. Gemma 3 1B ist 529 MB groß und erreicht auf einer mobilen GPU bis zu 2.585 Token pro Sekunde im Pre-Fill. Laut Google reicht das, um eine Seite Inhalt in unter einer Sekunde zu verarbeiten. Gemma 3n ist in einer frühen Vorschau Gemmas erstes multimodales kleines Sprachmodell auf dem Gerät, mit Varianten von 2B und 4B Parametern, die Text-, Bild-, Video- und Audioeingaben unterstützen. Text und Bild sind auf Hugging Face, Audio soll folgen.

Google lieferte außerdem eine RAG-Bibliothek für das Gerät, verfügbar für Android, und eine Bibliothek für Funktionsaufrufe auf dem Gerät, ebenfalls zuerst für Android. Das Unternehmen behauptet, die int4-Nachschulungs-Quantisierung könne Sprachmodelle um den Faktor 2,5 bis 4X gegenüber bf16 verkleinern, während Latenz und Spitzenspeicher sinken.

"Sobald die Anfrage eintrifft, schreibt das Modell sein Denken überhaupt nicht in Worten auf. Nichts dazwischen wird jemals in Sprache umgewandelt", sagte die Komplexitätswissenschaftlerin Zuzanna Stamirowska, CEO des KI-Unternehmens Pathway, gegenüber Science News.

Dieses Zitat betrifft BDH-CQ, ein experimentelles System, das in einem am 10. August bei arXiv eingereichten Paper beschrieben und am 22. September von Science News gemeldet wurde. Das Modell aktualisiert einen Speicher fester Größe mit jedem Beispiel, statt Beispiele im Kontext zu behalten. Stamirowska und Kollegen sagen, es habe mit zwei Versuchen fast drei von zehn Rätseln im öffentlichen ARC-AGI-1-Evaluierungssatz gelöst. Sie schätzen die Kosten pro Anfrage auf etwa 0,00070 Dollar, rund ein Elftel von GPT-5.6 Luna im selben Benchmark. Science News merkt an, dass die beiden Kosten unterschiedlich berechnet wurden und die Studie nicht begutachtet ist.

Außerhalb von Forschungslabors werden die Behauptungen schwerer zu überprüfen. Bouncer, ein Twitter-Feed-Filter, den Imbue am 8. April 2026 veröffentlichte, nutzt ein Open-Source-Modell zur Klassifizierung, das der Blog Gemma 4 26B-A4B nennt. Der Beitrag sagt, das Modell werde derzeit aus Imbues eigenem Rechenzentrum ausgeliefert, und es werde daran gearbeitet, es auf Laptops und Telefonen laufen zu lassen.

Skepsis ist angebracht, und ein Teil davon kommt von den Forschern selbst. Yuntian Deng von der University of Waterloo sagte gegenüber Science News, BDH-CQ sei "ein interessantes Effizienzergebnis", zeige aber nicht, dass seine Architektur besser sei als andere Ansätze. Er sagte, es brauche mehr Tests, um das Design vom Trainingsverfahren zu trennen, und ein Modell, das seine Schlussfolgerungen nicht ausschreibe, sei schwerer zu überprüfen. Jonas Geiping vom ELLIS Institute Tübingen und dem Max-Planck-Institut für Intelligente Systeme sagte, BDH-CQ sei speziell für ARC-artige Probleme gebaut, was einen direkten Vergleich mit Allzwecksystemen schwierig mache. Er nannte den Ansatz dennoch "gelungen".

Die ungeklärte Frage ist, wie viel davon den Kontakt mit einem ausgelieferten Produkt übersteht. Apple behandelt die Modelle nach eigener Darstellung im OpenELM-Paper als Forschungsveröffentlichungen. Googles eigener Vorbehalt ist, dass Gemma 3n eine frühe Vorschau ist. Die Lücke zwischen einer Benchmark-Tabelle und einem Telefon in der Tasche bleibt der Teil, für den niemand Zahlen veröffentlicht hat.

Kommentare 0

Quellen

5
  1. 01Apple releases eight small AI language models aimed at on-device useEN
  2. 02SlimLM: An Efficient Small Language Model for On-Device Document AssistanceEN
  3. 03On-device small language models with multimodality, RAG, and Function CallingEN
  4. 04Can AI reason without words? A small model puts the idea to the testEN
  5. 05Show HN: Control your X/Twitter feed using a small on-device LLMEN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Katrin Hoffmann

Katrin Hoffmann

KI, Modelle und Technik

Katrin Hoffmann schreibt für FLASH24 über Technik, KI und Modelle sowie Medien und Internet und stützt sich dabei auf Primärquellen wie Herstellerangaben, Studien und Protokolle statt auf Pressemitteilungen. Bei Benchmarks prüft sie Messmethoden, Testumgebungen und Reproduzierbarkeit, bevor sie Zahlen übernimmt. Für ihre Artikel spricht sie mit Entwicklern und Forschern, wartet auf Konferenzankündigungen und vergleicht Versionsstände von Modellen und Standards. Privat betreibt sie Selfhosting und Heimnetze und dokumentiert ihre eigene Infrastruktur, was ihrer Redaktionsarbeit zugutekommt. Sie veröffentlicht keine Zahlen ohne nachvollziehbare Quelle.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.