Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

Kleine Modelle auf dem Gerät: 91 Prozent der Token-Entropie liefern kein brauchbares Signal

In kleinen Sprachmodellen mit weniger als 3 Milliarden Parametern sind Konfidenzsignale auf Token-Ebene praktisch blind. Ein am 21. Juli eingereichtes arXiv-Preprint fand in 91 Prozent der Datensatz-Modell-Kombinationen eine mittlere Token-Entropie nahe null, egal ob die Antwort stimmte.

KI & ModelleAnalyseKatrin HoffmannVeröffentlicht: 28. September 20264 Min. LesezeitQuellen 6
Kleine Modelle auf dem Gerät: 91 Prozent der Token-Entropie liefern kein brauchbares Signal

Prashant Mudgal testete sieben Ansätze an 7 Modellpaaren und 5 gängigen NLU-Benchmarks, alle auf Verbraucherhardware. Sein Fazit ist deutlich: Frühabbruch über Token-Entropie funktioniert in dieser Größenklasse nicht. Semantische Entropie dagegen liefert ein brauchbares Signal. Dafür erzeugt das Modell mehrere Stichproben und gruppiert die Antworten nach Bedeutung. Leitet man unsichere Anfragen an ein größeres Expertenmodell weiter, steigt die Genauigkeit um bis zu 50 Prozentpunkte.

Weiterleitung über Modellfamilien hinweg brachte im Schnitt +22,0 Prozent, innerhalb derselben Familie +6,8 Prozent. Das Beispiel im Paper: SmolLM 360M übergibt an Phi-3.5-mini. Der Wert von Entropieverfahren in kleinen Modellen liegt laut den Autoren nicht in eingesparter Rechenzeit, sondern in zugeteilter Rechenzeit.

Warum die Arbeit auf dem Gerät wächst

Der Zeitpunkt ist wichtig. Am 27. September veröffentlichte Nvidia Nemotron 3 Diarization, ein Modell mit rund 100 Millionen Parametern, das erkennt, wer in einem Gespräch spricht. Die Gewichte sind kostenlos herunterladbar, wie The Decoder berichtete. Es trennt bis zu acht Sprecher und markiert überlappende Sprache. Im Diarization-Bench von VoiceArena liegt es derzeit mit einer Fehlerrate von 14,72 Prozent an erster Stelle, vor dem nächstbesten System mit 19,3 Prozent. Zusammen mit einem Spracherkennungssystem wie Parakeet entstehen Transkripte mit anonymen Sprecherlabels. Die Fehlerraten steigen mit mehr Teilnehmern, Hintergrundgeräuschen oder Hall.

Latenz ist ein Kompromiss im Design, kein kostenloser Gewinn. Der Audiopuffer lässt sich in vier Stufen einstellen, von 30,4 Sekunden bis hinunter zu 0,32 Sekunden. Kürzere Puffer senken in der Regel die Genauigkeit. Nvidia zufolge reduziert das Modell die Fehlerrate über acht Testszenarien hinweg um durchschnittlich 41 Prozent gegenüber dem Vorgänger Streaming Sortformer bei einem Puffer von 1,04 Sekunden. Solche Zahlen zählen, wenn das Modell lokal laufen muss und nicht im Rechenzentrum.

In derselben Woche kam ein viel größeres Projekt mit einer viel engeren Aussage zur Automatisierung. Ein Team mit Forschern der chinesischen Fudan-Universität untersuchte die eigene Arbeit am Aufbau von Atria Dawn Preview, einem agentischen Sprachmodell auf einer Mixture-of-Experts-Architektur mit 744 Milliarden Parametern, wie The Decoder berichtete. Die Analyse umfasste mehr als 700 Aufgabenprotokolle von 56 Teilnehmern. In 96,5 Prozent der untersuchten Aufgaben kam KI zum Einsatz. Das mittlere Verhältnis von Agentenaktionen zu menschlichen Eingaben stieg über vier Wochen von 11 auf 28,5. Die Autoren warnen davor, das als Autonomie zu lesen: Jede menschliche Entscheidung löste einfach mehr Agentenschritte aus.

Die Teilnehmer wurden gefragt, ob sie ihren Anteil an einer Aufgabe ohne KI im selben Umfang und in derselben Qualität hätten erledigen können. Von 455 abgeschlossenen KI-gestützten Aufgaben wurden 151 ohne KI als nicht machbar eingestuft, rund ein Drittel, verteilt auf 27 der 56 Teilnehmer.

Menschen trafen weiterhin 85,5 Prozent der Entscheidungen über Methoden und Parameter, die KI 9,2 Prozent. Bei Zielen und Umfang lag die letzte Entscheidung in 93,4 Prozent der Fälle beim Menschen. Wenn etwas schiefging, über 588 Aufgaben mit dokumentierter Schwierigkeit, kamen 76 Prozent durch menschliches Eingreifen voran, 23 Prozent löste der Agent allein. Das Paper warnt: Wenn jede Entscheidung auf einer längeren Kette von Agentenarbeit beruht, als ein Mensch prüfen kann, verkommt Aufsicht zum Abnicken.

Billige Modelle, teure Fragen

Die Kosten verschieben, welche Modelle überhaupt genutzt werden. CNBC berichtete am 26. September, dass chinesische Modelle in der Woche des 14. September 57 bis 67 Prozent der auf OpenRouter verwendeten Tokens ausmachten, nach 6 bis 13 Prozent im Februar. Auf Vercel erreichten sie im August 55 Prozent der Tokens, nach 11 Prozent im Januar. Peter Walker, Head of Insights bei OpenRouter, sagte CNBC, chinesische Open-Source-Modelle, die in diesem Jahr erschienen sind, könnten fortgeschrittene agentische Aufgaben glaubwürdig bewältigen, besonders Programmierung. Ende 2025 sei das noch nicht der Fall gewesen. Zudem seien sie im Vergleich zu den meisten Modellen aus US-Labors günstig. Harpreet Arora, Head of Agentic Infrastructure bei Vercel, sagte, der Preis werde überzeugend, sobald ein Modell die Qualitätsschwelle für eine Aufgabe überschreite.

Washington schaut zu. Zwei Ausschüsse des US-Repräsentantenhauses untersuchen den Trend, und CNBC merkt an, dass US-Frontiermodelle weiterhin mehr Ausgaben insgesamt auf sich ziehen. Daniel Remler vom Center for a New American Security sagte dem Sender, die Sorge sei, dass Integration Länder in eine chinesische Technologiesphäre zieht. Die von CNBC zitierten Daten sind uneinheitlich: Etwa die Hälfte der Tokens auf OpenRouter stammt von US-Unternehmen. Unternehmen in den 82 Ländern, die OpenRouter als Global South zusammenfasst, schicken dagegen 67 Prozent ihrer Tokens an chinesische Modelle.

Kleine Modelle stehen in diesem Streit unbequem da. Sie laufen auf dem Gerät, was manchen Argumenten zu Exportkontrollen ausweicht. Ihre Zuverlässigkeit ist aber genau das, was das arXiv-Paper infrage stellt. Das Ergebnis zur Weiterleitung legt nahe, dass die praktische Antwort nicht ein besseres kleines Modell allein ist, sondern ein kleines Modell, das weiß, wann es um Hilfe bitten muss.

Kommentare 0

Quellen

6
  1. 01Do small language models know what they don't know?EN
  2. 02Nvidia drops a free 100M-parameter model that identifies up to eight speakers in real timeEN
  3. 03AI agents do more of the work in model development, but humans still make the decisionsEN
  4. 04Chinese AI models surge in global popularity — and Washington is worriedEN
  5. 05OpenAI halts training of latest models as reports mount of AI agents going rogueEN
  6. 06OpenAI pauses training of its 'most capable models'EN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Katrin Hoffmann

Katrin Hoffmann

KI, Modelle und Technik

Katrin Hoffmann schreibt für FLASH24 über Technik, KI und Modelle sowie Medien und Internet und stützt sich dabei auf Primärquellen wie Herstellerangaben, Studien und Protokolle statt auf Pressemitteilungen. Bei Benchmarks prüft sie Messmethoden, Testumgebungen und Reproduzierbarkeit, bevor sie Zahlen übernimmt. Für ihre Artikel spricht sie mit Entwicklern und Forschern, wartet auf Konferenzankündigungen und vergleicht Versionsstände von Modellen und Standards. Privat betreibt sie Selfhosting und Heimnetze und dokumentiert ihre eigene Infrastruktur, was ihrer Redaktionsarbeit zugutekommt. Sie veröffentlicht keine Zahlen ohne nachvollziehbare Quelle.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.