Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

Halluzinations-Benchmarks werden schärfer, während Gemini 4 Argon an eine ausgewählte Gruppe ausgeliefert wird

Google hat am Mittwoch, den 30. September, Gemini 4 Argon, sein bisher leistungsfähigstes Modell, an eine kuratierte Gruppe von Cybersicherheits-Experten ausgeliefert. Das Modell bleibt vor der breiten Öffentlichkeit verborgen, da Bedenken bezüglich Missbrauchs bestehen.

KI & ModelleAnalyseLena BrandtVeröffentlicht: 2. Oktober 20268 Min. LesezeitQuellen 13
Halluzinations-Benchmarks werden schärfer, während Gemini 4 Argon an eine ausgewählte Gruppe ausgeliefert wird

Google hat am Mittwoch, den 30. September, Gemini 4 Argon, sein bisher leistungsfähigstes Modell, an eine kuratierte Gruppe von Cybersicherheits-Experten ausgeliefert. Das Unternehmen hält das Modell vor der breiten Öffentlichkeit zurück, da Bedenken bezüglich Missbrauchs bestehen. In einem Blogbeitrag erklärte das Unternehmen, dass es der US-Regierung freiwillig frühzeitigen Zugriff gewährt und vor einer breiteren Verfügbarkeit Feedback von Testern sammeln wird, wie The Guardian berichtete.

Diese vorsichtige Haltung steht im Widerspruch zu den Behauptungen, die Google für das Modell aufstellt. In seinem Launch-Blog, zitiert von TechCrunch, sagte das Unternehmen, dass Argon in verschiedenen KI-Benchmarks deutlich besser abschneidet als OpenAIs GPT-6 Astra sowie Anthropics Fable und Opus, unter Verweis auf das Benchmark-Startup Vals. Es hieß auch, Argon könne kritische Software-Schwachstellen autonom finden, validieren und patchen. Das sind Leistungsfähigkeitsaussagen, keine Zuverlässigkeitsaussagen. Beides ist nicht dasselbe.

Hier wird die Frage nach Halluzinationen relevant. Ein Modell, das bei Reasoning- oder Coding-Benchmarks gut abschneidet, kann weiterhin falsche Antworten mit hoher Selbstsicherheit liefern. Die neuesten halluzinationsnahen Materialien im Dossier weisen in beide Richtungen. Eine kontrollierte Prüfung von Gradienten-Konflikt-Metriken in einheitlichen multimodalen Modellen, eingereicht bei arXiv am 29. September, ist der interessantere der jüngsten Papers. Es testet, ob eine weit verbreitete Proxy-Metrik tatsächlich das vorhersagt, was Forscher annehmen. Das Ergebnis lautet: nein.

Die Autoren bauten einen Teststand namens GRIDUMM, der wichtige strukturelle Bestandteile des Trainings einheitlicher multimodaler Modelle abbildet und den Grundwahrheits-Trade-off zwischen Verständnis und Generierung exakt berechenbar macht. Über 63 Konfigurationen und 372 gemessene Checkpoints hinaus erreichte keine richtungsbezogene Konflikt-Metrik eine absolute Spearman-Korrelation von 0,3 mit einem Konfidenzintervall, das null ausschließt. Eine Dosis-Wirkungs-Intervention, die Konflikte monoton unterdrückt, ließ den Trade-off flach, was Korrelation und Kausalität trennt. Funktionelle Interferenz-Maße schlugen richtungsbezogene Konflikt-Metriken, und der Trainingsverlust trackte den Trade-off stark. Die Autoren behaupten nicht, dass Konflikt nutzlos ist. Sie behaupten, dass seine Validität als diagnostisches Ziel nachgewiesen, nicht vorausgesetzt werden muss.

Das ist ein enges Ergebnis über eine enge Klasse von Modellen. Es ist aber auch die Art von Befund, die jeden, der eine Leaderboard liest, innehalten lassen sollte.

Was die neueren Benchmarks tatsächlich messen

Zwei weitere arXiv-Papers aus demselben Zeitfenster verfolgen eine ähnlich skeptische Linie. ChartDensity-Bench, eingereicht am 30. September, bewertet multimodale Large Language Models beim Rekonstruieren numerischer Daten aus wissenschaftlichen Charts unter kontrollierter visueller Dichte, wobei die Anzahl der gleichzeitig gezeigten Charts über k gleich 1, 3, 6 und 9 variiert. Experimente an fünf aktuellen MLLMs zeigen, dass die numerische Rekonstruktion mit zunehmender visueller Dichte abnimmt, und das Ausmaß dieser Abnahme variiert erheblich zwischen den Modellen. Die Chart-Ebene gepaarten Vergleiche im Paper fanden, dass derselbe Quell-Chart eine höhere Rekonstruktionsfehler erzeugen kann, wenn er in einem dichteren visuellen Kontext eingebettet ist. Das ist ein halluzinationsnaher Fehlermodus mit einer sauberen Messung. Das Modell verweigert nicht. Es produziert Zahlen.

Ein drittes Paper, Reverse Scoring for Diffusion Language Model Agents, eingereicht am 29. September, verfolgt einen spezifischen Fehler in diffusion-basierten Sprachmodell-Agenten. Sie fallen in Retry-Schleifen, indem sie eine Aktion lange nach ihrem Scheitern erneut ausführen. Die Autoren führen dies darauf zurück, dass masked Decoding die Positionen, von denen es am meisten überzeugt ist, festlegt und die unsicheren auf später verschiebt. So bietet der Kontext im Fehlerzustand bereits eine überzeugende Füllung für die verschobene Entscheidung, nämlich die fehlgeschlagene Aktion selbst. Sie modellieren die Verzerrung als task-blind-Korruption und schlagen eine trainingsfreie Lösung namens Reflect Reverse vor, die sie an vier multi-turn Embodied-Benchmarks evaluieren.

Es gibt ein Muster über diese drei Papers hinweg. Jedes isoliert eine spezifische Art, wie ein Modell mit hoher Selbstsicherheit falsch liegen kann, misst dies unter kontrollierten Bedingungen und findet, dass die beliebte Proxy-Metrik das Ergebnis nicht trackt. Keines bietet einen allgemeinen Halluzinationsscore. Alle deuten darauf hin, dass allgemeine Halluzinationsscores weniger Arbeit leisten, als ihre Veröffentlicher andeuten.

Für ein Gefühl dafür, wie sehr ein Benchmark die Diskussion bewegen kann, schauen wir uns den Bereich der Entscheidungsmodelle an. InfoQ berichtete, dass TypeSafe AI Jev veröffentlicht hat, das überhaupt keinen Text generiert, sondern typisierte, probabilistische Entscheidungen mit einem Konfidenzwert zurückgibt, sodass aufrufender Code über einem Schwellenwert handeln und unter diesem eskalieren kann. Die Eingabe kostet 0,042 $ pro Million Tokens, die Ausgabe ist kostenlos, das Kontextfenster beträgt 32.000 Tokens, und TypeSafe zitiert eine End-to-End-Latenz von 70ms bis 500ms. Vercel fügte Jev am zweiten Tag zu AI Gateway hinzu und sagte, es habe innerhalb von 24 Stunden fast 13 % der bezahlten Teams erreicht, doppelt so viel wie der Anteil der GPT-5.6-Familie.

Amazon folgte. TechCrunch berichtete am 1. Oktober, dass AWS Strands Decider 2B veröffentlicht hat, ein Open-Source-Entscheidungsmodell, inspiriert von Jev, basierend auf dem Torso von Qwen3.5-2B. Es sortiert zwischen vorbestimmten Optionen und gibt ein Konfidenzmaß zurück. Amazons Distinguished Engineer Marc Brooker sagte TechCrunch, das Modell habe kurzzeitig den Spitzenplatz im Jevbench-Ranking für Modelle seiner Größe erreicht, und dass der Reiz in einem Workflow-Schritt liegt, der dank Konfidenzwerten und einem geschlossenen Antwortbereich zuverlässiger ist, mit niedrigerer Latenz und potenziell niedrigeren Kosten.

TypeSafe-Gründer Diogo Almeida war unmissverständlich über die Konkurrenz. „Ich verstehe, dass Leute denken, es ist ein Goldrausch, aber sie unterschätzen vielleicht die Schwierigkeit, die Modelle wirklich schlau zu machen“, sagte er TechCrunch. Die aktuelle Welle, sagte er, „scheint eher“ wie eine Welle von Imitatoren zu sein. Ob das stimmt oder nicht, die Richtung ist klar: Einige Builder reagieren auf das Zuverlässigkeitsproblem, indem sie den Ausgaberaum verkleinern, statt ein besseres allgemeines Modell zu versprechen.

Das Sicherheitsargument kommt vor den Beweisen

Googles eigenes Framing für die Beschränkung von Argon ist, dass Frontier-Leistungsfähigkeit auf diesem Niveau einen phasenweisen Ansatz benötigt. Koray Kavukcuoglu, Googles Chief AI Architect, schrieb dies im Blogbeitrag zur Ankündigung des Modells. Google sagte, Argon sei so konzipiert, dass es Anfragen ablehnt, die bei der Durchführung von Cyberangriffen oder der Entwicklung von chemischen, biologischen oder nuklearen Waffen helfen könnten, und dass es das Reasoning des Modells überwacht, um zu verhindern, dass es über die Absichten der Nutzer hinausgeht, ein Risiko, das Forscher als Misalignment bezeichnen.

The Guardian berichtete, dass die vorsichtige Auslieferung Anthropic widerspiegelt, das Claude Mythos Preview auf eine kleine Anzahl vertrauenswürdiger Organisationen beschränkt hat. Washington zwang Anthropic im Juni kurzzeitig, den Zugriff auf seine öffentlich veröffentlichten Claude Mythos und Claude Fable Modelle zu suspendieren, und hat seitdem einen freiwilligen Prozess zur Prüfung der leistungsfähigsten KI-Modelle vor der Veröffentlichung eingerichtet. Die Ankündigung kam einen Tag, nachdem Donald Trump führende Tech-Manager, einschließlich Sundar Pichai und Anthropics Dario Amodei, im Weißen Haus empfing, wo sie ein freiwilliges Abkommen unterzeichneten, das Risiken ihrer eigenen KI-Systeme zu überwachen.

Google sagte, frühe Tester verwendeten Argon, um einen Fehler in Software zu finden, die von Krankenhäusern weltweit verwendet wird und sensible persönliche Informationen offenlegte, etwas, das andere fortgeschrittene Modelle übersehen hatten. Das ist eine Anekdote vom Vendor über ein Modell, das nicht im allgemeinen Umlauf ist. Behandeln Sie es als Leistungsfähigkeitsaussage von einer Partei mit Interesse.

Der Streit über die Herkunft läuft parallel. CNBC berichtete, dass OpenAI sagte, es habe eine koordinierte Kampagne zur Extraktion geschützter Reasoning aus seinen Modellen identifiziert und gestört, und verknüpfte einen Kerncluster der Aktivität mit dem chinesischen Startup Moonshot AI. Die Aktivität begann Anfang Juli und stieg innerhalb von zwei Tagen auf 16.000 Anfragen von mehr als 4.000 Nutzern an, mit verwandter Aktivität über mehr als 15.000 Nutzer. OpenAI sagte, Betreiber hätten seine Verschlüsselung, Datenbanken oder gespeicherten Nutzerkonversationen nicht verletzt, und dass es die Kampagne bis zum 28. Juli vollständig gestört hatte.

The Register bemerkte die Unschärfe der Beschwerde, angesichts der eigenen Geschichte von OpenAI beim Training auf Webdaten, und berichtete, dass The Register OpenAI fragte, welche seiner Modelle im Juli angegriffen wurden, und keine Antwort erhielt. Es berichtete auch, dass Michael Kratsios, Trumps Assistent für Wissenschaft und Technologie, Moonshot AI Ende Juli beschuldigte, sein Kimi K3 Modell durch Destillation von Anthropics Fable erstellt zu haben. Anthropics Claude Opus 5.5, eine Woche vor diesem Bericht veröffentlicht, kommt mit einer Verteidigung gegen Destillation namens preserved thinking, eingeführt mit Fable 5.1.

Moonshot reagierte nicht sofort auf CNBCs Anfragen um Kommentar, und The Register sagte, es habe auch keine sofortige Antwort erhalten. So bleibt die zentrale Anschuldigung im öffentlichen Rekord einseitig.

Der andere Faden, der es wert ist, beobachtet zu werden, ist, woher die Trainingsdaten kommen und unter welchen Bedingungen. The Guardian berichtete am 1. Oktober, dass Anthropic die Albanese-Regierung aufrief, eine bedingte Genehmigung für das Training auf australischen urheberrechtlich geschützten Werken unter einem Opt-out-Modell in Betracht zu ziehen, nachdem es zugestanden hatte, keine pauschale Urheberrechtsbefreiung zu sichern. Die ABC und SBS widersprachen in Stellungnahmen zu einer parlamentarischen Untersuchung des Bundes, wobei die ABC vor einer Kannibalisierung der australischen Nachrichtenindustrie warnte und beide Sender vorschlugen, KI-Unternehmen in den News Bargaining Incentive einzubeziehen.

Anthropics Stellungnahme behauptete, die Technologie könnte die australische Wirtschaft transformieren, warnte aber auch vor ernsthaften Auswirkungen auf die nationale Sicherheit, die Widerstandsfähigkeit kritischer Infrastrukturen und die öffentliche Sicherheit. Der gemeinsame Sonderausschuss für KI hält nächste Woche in Sydney Anhörungen ab, wobei Anthropic- und OpenAI-Manager teilnehmen werden.

Keines davon klärt, ob ein gegebenes Modell zuverlässig ist. Es deutet aber darauf hin, dass die Branche jetzt Zuverlässigkeitsaussagen schneller ausliefert, als sie Wege liefert, sie zu überprüfen, und dass die vorhandenen Prüfungen tendenziell eng, kontrolliert und unvorteilhaft für die Proxy-Metriken sind, die alle zitiert werden.

Kommentare 0

Quellen

13
  1. 01Google rolls out new Gemini AI model but restricts access over safety concernsEN
  2. 02Google releases Gemini 4 Argon, called its most powerful model yetEN
  3. 03Does Gradient Conflict Predict the Understanding-Generation Trade-off? A Controlled Audit of Conflict-Metric Validity in Unified Multimodal ModelsEN
  4. 04ChartDensity-Bench: Benchmarking MLLMs for Numerical Data Reconstruction under Visual DensityEN
  5. 05Does This Action Still Explain the Task? Reverse Scoring for Diffusion Language Model AgentsEN
  6. 06TypeSafe AI Releases Jev: A Decision-Only Model That Returns Typed Probabilities Instead of TextEN
  7. 07Amazon releases its own Jev clone as decision models flood the webEN
  8. 08AI race heats up as OpenAI flags alleged model-copying campaignEN
  9. 09Irony alert: OpenAI whines that Chinese model stole its special IP that it stole from everybody elseEN
  10. 10Anthropic pushes for opt-out model for Australian content as ABC warns of 'cannibalisation' of newsEN
  11. 11Microsoft AI releases new transcription and text-to-speech models for voice agentsEN
  12. 12Ideogram says its new model can edit part of an image without messing up the restEN
  13. 13ThreatsDay: AI-Powered Zero-Day Chain, 543K Live Secrets, Model Inspection RCE and 13 More StoriesEN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Lena Brandt

Lena Brandt

KI, Modelle und Technik

Lena Brandt schreibt für FLASH24 über Technik, KI und Modelle sowie Medien und Internet und stützt sich dabei auf Herstellerangaben, Studien und öffentlich zugängliche Datensätze, statt Pressemitteilungen ungeprüft zu übernehmen. Bei Modellvergleichen kontrolliert sie Benchmark-Werte, Trainingsdaten und Versionsnummern und rechnet Angaben zu Rechenleistung und Kosten selbst nach. Sie spricht mit Entwicklern und Forschern, wartet auf angekündigte Updates und vergleicht Releases, bevor sie eine Einschätzung abgibt. Privat beschäftigt sie sich mit 3D-Druck, alten Rechnern und der Frage, wie Modelle aus Internetmüll lernen – Themen, die regelmäßig in ihre Texte einfließen. Sie publiziert keine Zahlen, deren Quelle sie nicht selbst überprüfen konnte.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.