ServiceNow AutoSynthData macht Agentenfehler zu Trainingsdaten
ServiceNow hat am 2. Oktober eine Pipeline für Enterprise-Agenten veröffentlicht, die aus den Fehlschlägen eines Modells neue Aufgaben generiert. Ziel sind die Lücken bei der Abrufung und Werkzeugnutzung, die Deployment blockieren. Vier ServiceNow-Forscher stellten AutoSynthData auf Hugging Face vor.

Die Pipeline heißt AutoSynthData. Sie nutzt die Fehlschläge des Zielmodells und die Erfolge eines stärkeren Lehrermodells, um zu entscheiden, was das Modell als Nächstes lernen soll. Anschließend erzeugt und validiert sie neue Aufgaben, die diese Fähigkeiten üben, wie im Engineering-Beitrag vom 2. Oktober beschrieben.
Das ist relevant, weil das Enterprise-Agenten-Problem größtenteils ein Abrufproblem ist. Ein Agent, der die richtige Richtlinie, das Asset-Record oder die Notiz zur richtigen Zeit nicht findet, scheitert an der Aufgabe. Ein einzelner Fehler reicht nicht aus, um darauf zu trainieren.
Die Autoren von ServiceNow, Esakkivel Esakkiraja, Shruthan Radhakrishna, Denis Akhiyarov und Sagar Davasam, beschreiben die Lücke offen: Ein Modell kann grundsätzlich kompetent sein und dennoch in einer bestimmten Umgebung scheitern. Das gilt für Workflows, die es schlecht handhabt, Werkzeugkombinationen, die es missbraucht, oder Einschränkungen, die es ignoriert. Der Beitrag legt drei Bedingungen für generierte Aufgaben fest: Machbarkeit, Realismus und Schwierigkeit. Für den Verifizierer, der das Ergebnis bewertet, gibt es drei Kriterien, beginnend mit Konsistenz. Die Validierungsschicht ist das tragende Element. Ohne eine zuverlässige Kontrolle lehren synthetische Aufgaben nichts. ServiceNow veranschaulicht die Methode am EnterpriseOps Gym, einem Benchmark, der dieses Jahr mit einem Papier veröffentlicht wurde. Es ist eines von mehreren Forschungsprojekten im selben Zeitfenster, die dasselbe Problem aus verschiedenen Winkeln angehen: Wie man Enterprise-Systeme in einen Kontext verankert, mit dem sie tatsächlich handeln können.
Abrufqualität wird zu einer messbaren Variable
Am 30. September nahmen zwei Preprint-Papiere auf arXiv die Repräsentationsschicht unter dem Enterprise-Abruf ins Visier. Merieme Askour und Ayoub Merimi schlagen eine Theorie der Kontextausreichung in der personalisierten generativen KI vor. Sie argumentieren, dass mehr Kontext nicht besser ist, sobald Kontext günstig zu beschaffen ist.
Ihr Rahmen identifiziert vier Zustände: Unzureichend, ausreichend, Sättigung und Interferenz. Sie definieren eine Kontextausreichungsgrenze, um die minimale relevante Menge zu lokalisieren. In einem Vollfaktorenexperiment mit einem generativen Recommender bei einem großen Möbelerhändler verbesserte relevanter Kontext die Angemessenheit. Irrelevanter Kontext reduzierte sie und destabilisierte die Abrufung.
Das zweite Papier von Terry Dorsey und Kevin Huggins führt die Enterprise Representation Simplification und ein repräsentationsneutrales Modell namens Enterprise Representation Complexity ein. Die Autoren argumentieren, dass Unternehmensinformationen Strukturen ansammeln, die durch Anwendungen, Projekte und organisatorische Grenzen geformt sind. Diese repräsentative Komplexität muss von Menschen und KI-Systemen gewartet und interpretiert werden. Ihre zentrale Aussage für Abruf-Praktiker: Reduktionen der Komplexität auf Aufgabenstufe verringern den Repräsentationsumfang, den ein KI-System identifizieren, in Beziehung setzen und interpretieren muss. Text-to-SQL-Forschung liefert Belege dafür, dass reduzierte Schema- und Reasoning-Komplexität die Genauigkeit verbessern kann. Die Autoren stellen klar, dass ERC keine universelle Metrik für Komplexität, Leistung oder Kosten ist.
Keines der Papiere liefert ein Produkt. Beide weisen jedoch auf dieselbe Diagnose hin. Mehr Kontext in ein Abrufsystem zu werfen, ist nicht dasselbe wie ausreichenden Kontext zu geben. Der Unterschied zeigt sich als instabile Antworten in der Produktion.
Identität ist die andere Hälfte des Verankerungsproblems
The Hacker News veröffentlichte am 28. September einen Rahmen für das Identitäts- und Zugriffsmanagement von KI-Agenten. Er benennt einen Fehlersmodus, den Abruf-Teams oft spät entdecken. IAM-Plattformen drücken den beabsichtigten Zugriff aus, während Anwendungen und Infrastruktur zeigen, was der Agent tatsächlich ausgeführt hat.
Dazwischen liegt das, was der Artikel als Identitäts-Dunkelmaterie bezeichnet: Agenten, Credentials, lokal auf Anwendungsebene angelegte Konten und Authentifizierungspfade, die zentrale Identitätsdaten nie melden. Der Beitrag zitiert die OWASP Top 10 für Large Language Model Applications, die übermäßige Agentik als LLM06 benennt. Er listet fünf häufige Fehler auf, darunter fehlende Ownership, langlebige Secrets und unbegrenzte Delegation.
Der Bezug zur Abrufung ist direkt. Ein Agent mit breiten Berechtigungen kann Daten abrufen, die er nie sehen sollte. Statische Rollenzuweisung kann dieses Verhalten nicht begrenzen. Konfigurationsbefunde beschreiben die Möglichkeit; Telemetrie beschreibt, was passiert ist.
Cloud-Anbieter schieben die Infrastruktur tiefer in den Stack
Microsoft hat Azure Container Apps Express für allgemein verfügbar erklärt, meldete InfoQ am 1. Oktober. Gleichzeitig wurde Azure Container Apps Sandboxes, die isolierte Compute-Schicht, auf der Express läuft, allgemein verfügbar. Express übernimmt ein Container-Image, eine Region und die nötige Konfiguration. Danach provisioniert es Compute, Ingress und Scaling selbst. Es läuft auf Consumption-CPU mit Abrechnung pro Sekunde und skaliert auf null, wenn es idle ist.
Microsoft beschreibt Express als developer-first und agent-first. Die Dokumentation besagt, dass es vollständig auf Sandboxes basiert. Diese provisionieren aus vorerwärmten Pools für subsekundenstar Startups. Sie isolieren jede Workload in ihrer eigenen hardware-isolierten microVM-Grenze. Sie unterstützen Suspend und Resume mit subsekundenstar Restore. Entwickler können Sandboxes direkt verwenden. Microsoft positioniert diesen Weg für Agenten-Plattformen und sichere Code-Ausführungsdienste. Reaktionen auf Reddit deuteten darauf hin, dass die Primitive vor der Ankündigung bereits im Einsatz war. Ein Kommentar, MuhBlockchain, behauptete, ACA Sandboxes stützen zentrale Azure-Dienste, einschließlich Foundry Hosted Agents. Das ist ein Detail, das Microsofts eigene Materialien nicht bestätigen.
CoreWeave zog einen Tag zuvor in die gleiche Richtung. Am 30. September stellte das Unternehmen auf seinem Fully Connected-Event in San Francisco CoreWeave Forge vor. Laut Data Center Knowledge ist es eine integrierte Softwareplattform für die Entwicklung, Ausführung und Verbesserung von KI-Modellen und Agenten. Forge ist in den Editionen Free, Pro und Enterprise verfügbar. Sie umfasst CoreWeave Notebooks, Agent Lens für die Observability von Produktionsagenten und RL Rollouts.
Corey Sanders, Senior Vice President of Product Management bei CoreWeave, sagte auf einem Medienbriefing, das Unternehmen habe den Fokus von der besten Anbieterrolle für KI-zentrierte Infrastruktur auf die Bereitstellung von KI-Diensten verlagert. Diese ermöglichen es Kunden, Anwendungen auf der Plattform zu bauen. IDC-Analyst Dave McCarthy sagte gegenüber Data Center Knowledge, CoreWeave brauche ein breiteres Enterprise-Publikum und ein größeres Software-Ökosystem, um ein nachhaltiges Geschäft aufzubauen.
Woher die Nachfrage kommt
Die Benutzerbasis für generative KI in China überschritt Ende Juni die Marke von 700.000.000. Das meldete das China Internet Network Information Centre. Das ist ein Anstieg um 16 Prozent gegenüber 602.000.000 Ende 2025, als die Durchdringungsrate bei 42,8 Prozent lag. Die South China Morning Post, die die Veröffentlichung am 29. September berichtete, stellte fest, dass 76 Prozent der befragten Nutzer generative KI nutzten, um Antworten zu finden. 48 Prozent nutzten sie zur Verarbeitung von Bildern oder Videos. 38 Prozent setzten sie für Textverarbeitung ein.
Das sind Konsumzahlen, keine Enterprise-Zahlen. Sie setzen aber den Erwartungswert, gegen den Enterprise-Abrufsysteme jetzt gemessen werden. Sie erklären, warum Anbieter im gesamten Stack darum konkurrieren, Agenten-Ausgaben weniger wie Vermutungen aussehen zu lassen.
Die Infrastruktureinschränkungen darunter sind real. Optische Frequenzkamm-Generatoren, die viele Wellenlängen aus einem einzigen Laser erzeugen, statt einen Laser pro Kanal, werden als Weg gepusht, um Strom, Kosten und Ausfallpunkte zu senken, während KI-Rechenzentren über 16 Wellenlängen pro Glasfaser skalieren. Das meldete Data Center Knowledge am 24. September. Frank Smyth, Gründer und CTO von Pilot Photonics, sagte, Kamm-Laser ermöglichen potenziell, viele mehr Wellenlängen viel enger zu packen, ohne Angst vor Interferenz. Marcello Girardi, CEO und Mitgründer von Solinide, nannte die praktische Grenze offen: Vier Wellenlängen ist ein gelöstes Problem für Laser-Arrays. Die Schwierigkeit beginnt bei acht. Bei 16 begrenzt die Komponentenanzahl. Steven Estrella von Quintessent fügte hinzu, dass bei dem aktuellen Mangel an Indiumphosphid-CW-DFB-Lasern die Reduzierung der benötigten Laseranzahl wichtiger denn je ist.
Enterprise-Käufer überdenken auch, wo Inferenz läuft. Der VMware Private Cloud Outlook 2026, zitiert von Data Center Knowledge am 21. September, zeigt, dass 83 Prozent der Unternehmen Workloads aus der Public Cloud zurückholen oder planen, dies zu tun. Getrieben wird das durch Sicherheits-, Kosten-, Compliance- und Leistungsbedenken. Moderne Colocation-Anlagen unterstützen 35 kW-Schränke mit Luftkühlung und 70 bis 150 kW-Schränke mit optionaler Flüssigkühlung. Dort landet Inferenz auf vertraulichen Unternehmensdaten tendenziell.
Keines davon löst das Abrufproblem für sich allein. Aber die Richtung der letzten Woche ist konsistent: Die Branche behandelt Kontext, Repräsentation und Identität als Ingenieursvariablen, nicht als Prompts, die abgestimmt werden müssen. Das ist ein schwierigeres Problem als ein Vektor-Store anzuschließen. Und es ist das eine, das entscheidet, ob man einem Agenten die Arbeit anvertrauen kann.
Quellen
14- 01AutoSynthData: Generating Training Data for Enterprise AgentsEN
- 02When More Data Is Not Enough: The Context-Sufficiency Frontier in Generative AI PersonalizationEN
- 03Enterprise Representation Simplification (ERS): Reducing Representational Complexity for Enterprise AIEN
- 04IAM for AI agents: A Practical Enterprise FrameworkEN
- 05Container Apps Express Reaches GA on a Newly Generally Available Sandbox LayerEN
- 06CoreWeave Targets Enterprises with Forge PlatformEN
- 07China's generative AI user base crosses 700 million, covering over half the populationEN
- 08The Role of Optical Frequency Comb Generators in AI Data CentersEN
- 09Enterprises Adopt Colocation for AI and Hybrid Cloud InitiativesEN
- 10Redefining enterprise intelligence with autonomous AIEN
- 11ShamAN-Q: Shampoo Augmented NanoQuant for Sub-1-bit LLM WeightsEN
- 12ReLaG: A Scalable Framework Generalizing Random Splits to Data with Latent RelationsEN
- 13Conformal Adversarial Generative EnsembleEN
- 14This startup helps food carts switch loud, dirty generators for batteriesEN
Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.
Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.
Kommentare
0- Noch keine Kommentare — seien Sie der Erste.