Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

AutoSynthData di ServiceNow trasforma gli errori degli agenti in dati di addestramento

Il 2 ottobre ServiceNow ha pubblicato un pipeline per agenti enterprise che genera nuovi task di addestramento dagli errori del modello, colmando le lacune di retrieval e uso degli strumenti. Quattro ricercatori di ServiceNow hanno descritto AutoSynthData su Hugging Face.

IA e modelliNotiziaGiulia FerrariPubblicato: 2 ottobre 20267 min di letturaFonti 14
AutoSynthData di ServiceNow trasforma gli errori degli agenti in dati di addestramento

Il pipeline si chiama AutoSynthData. Come riportato nel post tecnico del 2 ottobre, sfrutta gli errori del modello target e i successi di un modello teacher più forte per decidere cosa il modello deve imparare. Genera poi nuovi task validati che esercitano quelle capacità.

Questo è importante perché il problema degli agenti enterprise è in gran parte un problema di retrieval. Un agente che non trova la giusta policy, il record di asset o la nota di lavoro nel momento giusto fallisce il task. Un singolo errore non basta per addestrare.

Gli autori di ServiceNow, Esakkivel Esakkiraja, Shruthan Radhakrishna, Denis Akhiyarov e Sagar Davasam, descrivono la lacuna con chiarezza: un modello può essere capace in generale ma faticare con un ambiente specifico, un workflow gestito male, una combinazione di strumenti usata in modo errato o un vincolo che non rispetta. Il post definisce tre condizioni per un task generato, fattibilità, realismo e difficoltà, e tre per il verificatore che valuta il risultato, a partire dalla coerenza. Il layer di verifica è la parte portante: senza un controllo affidabile, i task sintetici non insegnano nulla. ServiceNow illustra il metodo su EnterpriseOps Gym, un benchmark rilasciato con un paper quest'anno. È uno di diversi sforzi di ricerca che arrivano nello stesso periodo attaccando lo stesso problema da angoli diversi: come ancorare i sistemi enterprise a un contesto su cui possono effettivamente agire.

La qualità del retrieval diventa una variabile misurabile

Il 30 settembre, due preprint inviati su arXiv hanno preso di mira il layer di rappresentazione sotto il retrieval enterprise. Merieme Askour e Ayoub Merimi propongono una teoria della sufficienza del contesto nella personalizzazione AI generativa, sostenendo che una volta che il contesto è economico da fornire, di più non è meglio.

Il loro framework identifica quattro stati, insufficienza, sufficienza, saturazione e interferenza, e definisce una Frontiera di Sufficienza del Contesto per localizzare l'insieme minimo rilevante. In un esperimento fattoriale completo con un raccomandatore generativo in un grande rivenditore di arredamento, il contesto rilevante ha migliorato l'appropriatezza, mentre il contesto irrilevante l'ha ridotta e destabilizzato il retrieval.

Il secondo paper, di Terry Dorsey e Kevin Huggins, introduce la Semplificazione della Rappresentazione Enterprise e un modello representation-neutral chiamato Enterprise Representation Complexity. Gli autori sostengono che le informazioni enterprise accumulano strutture modellate da applicazioni, progetti e confini organizzativi, e che questa complessità rappresentazionale deve essere mantenuta e interpretata sia dalle persone che dai sistemi AI. La loro affermazione chiave per i practitioner del retrieval: le riduzioni nella complessità a livello di task riducono l'estensione rappresentativa che un sistema AI deve identificare, collegare e interpretare. La ricerca su text-to-SQL fornisce evidenze che riduzioni nella complessità dello schema e del ragionamento possono migliorare l'accuratezza. Gli autori precisano che ERC non è una metrica universale di complessità, prestazioni o costo.

Nessun paper include un prodotto. Entrambi puntano alla stessa diagnosi. Buttare più contesto su un sistema di retrieval non è la stessa cosa che dargli contesto sufficiente, e la differenza emerge come risposte instabili in produzione.

L'identità è l'altra metà del problema di grounding

Hacker News ha pubblicato il 28 settembre un framework per la gestione di identità e accesso degli agenti AI, e nomina un failure mode che i team di retrieval tendono a scoprire tardi. Le piattaforme IAM esprimono l'accesso previsto, mentre applicazioni e infrastruttura rivelano ciò che l'agente ha effettivamente eseguito.

Tra i due si trova ciò che l'articolo chiama materia oscura dell'identità: gli agenti, le credenziali, gli account locali alle applicazioni e i percorsi di autenticazione che i dati di identità centrali non riportano mai. L'articolo cita la Top 10 di OWASP per Applicazioni Large Language Model, che nomina l'eccessiva agenzia come LLM06, ed elenca cinque fallimenti comuni tra cui assenza di ownership, segreti a lunga durata e delega illimitata.

L'angolo retrieval è diretto. Un agente con permessi ampi può estrarre dati a cui non era mai stato assegnato lo scope, e l'assegnazione statica dei ruoli non può vincolare quel comportamento. I riscontri di configurazione descrivono la possibilità; la telemetria descrive ciò che è accaduto.

I vendor cloud spingono la plumbatura giù nello stack

Microsoft ha reso generalmente disponibile Azure Container Apps Express, come riportato da InfoQ il 1 ottobre, insieme alla disponibilità generale di Azure Container Apps Sandboxes, il layer di calcolo isolato su cui Express gira. Express prende un'immagine container, una regione e la configurazione necessaria all'app, poi provisiona calcolo, ingress e scaling da solo. Gira su CPU a consumo con fatturazione al secondo e scala a zero quando inattivo.

Microsoft descrive Express come developer-first e agent-first, e la sua documentazione afferma che è costruito interamente su Sandboxes, che provengono da pool pre-riscaldati per avvio sub-second, isolano ogni workload in un proprio microVM boundary isolato a livello hardware, e supportano suspend e resume con ripristino sub-second. I developer possono usare Sandboxes direttamente, e Microsoft posiziona quel percorso per piattaforme agent e servizi di esecuzione codice sicuri. La reazione su Reddit suggeriva che il primitivo fosse già in uso prima dell'annuncio; un commentatore, MuhBlockchain, ha affermato che ACA Sandboxes sostengono servizi Azure core incluso Foundry Hosted Agents, un dettaglio che i materiali di Microsoft non dichiarano.

CoreWeave si è mossa nella stessa direzione un giorno prima. Ha svelato CoreWeave Forge il 30 settembre al suo evento Fully Connected a San Francisco, una piattaforma software integrata per sviluppare, eseguire e migliorare modelli e agenti AI, secondo Data Center Knowledge. Forge è disponibile in edizioni Free, Pro ed Enterprise e include CoreWeave Notebooks, Agent Lens per l'osservabilità degli agenti in produzione, e RL Rollouts.

Corey Sanders, senior vice president of product management di CoreWeave, ha detto a un briefing media che l'azienda si è spostata da un focus sull'essere il miglior provider per infrastruttura AI-centric a fornire servizi AI che permettano ai clienti di costruire applicazioni sulla sua piattaforma. L'analista IDC Dave McCarthy ha detto a Data Center Knowledge che CoreWeave ha bisogno di un pubblico enterprise più ampio e di un ecosistema software più grande per costruire un business sostenibile.

Da dove arriva la domanda

La base utenti di AI generativa in Cina ha superato i 700.000.000 alla fine di giugno, ha riportato il China Internet Network Information Centre, in aumento del 16 per cento rispetto ai 602.000.000 alla fine del 2025, quando la penetrazione era al 42,8 per cento. Il South China Morning Post, che ha coperto il rilascio il 29 settembre, ha notato che il 76 per cento degli utenti sondati ha detto di usare l'AI generativa per cercare risposte, il 48 per cento per elaborare immagini o video, e il 38 per cento per l'elaborazione del testo.

Questi sono numeri consumer, non enterprise. Ma stabiliscono la baseline di aspettative contro cui i sistemi di retrieval enterprise sono ora misurati, e spiegano perché i vendor in tutto lo stack corrono per far sembrare gli output degli agenti meno come stime.

I vincoli infrastrutturali sottostanti sono reali. I generatori di pettini di frequenza ottica, che producono molte lunghezze d'onda da un singolo laser invece di un laser per canale, sono proposti come un modo per ridurre potenza, costo e punti di fallimento man mano che i data center AI scalano oltre 16 lunghezze d'onda per fibra, ha riportato Data Center Knowledge il 24 settembre. Frank Smyth, fondatore e CTO di Pilot Photonics, ha detto che i laser a pettino potenzialmente permettono molte più lunghezze d'onda impacchettate molto più strette senza paura di interferenze. Marcello Girardi, CEO e co-fondatore di Solinide, ha messo il limite pratico con franchezza: quattro lunghezze d'onda è un problema risolto per gli array laser, la difficoltà inizia a otto, e a 16 il conteggio dei componenti ti limita. Steven Estrella di Quintessent ha aggiunto che con l'attuale carenza di offerta di laser CW DFB in fosforo di indio, ridurre il numero di laser richiesti è più importante che mai.

I buyer enterprise stanno anche ripensando dove gira l'inferenza. Il Private Cloud Outlook 2026 di VMware, citato da Data Center Knowledge il 21 settembre, indica che l'83 per cento delle aziende ha completato o sta pianificando di riportare i workload dal cloud pubblico, spinto da preoccupazioni su sicurezza, costo, compliance e prestazioni. Le facility di colocation moderne supportano cabinet da 35 kW con raffreddamento ad aria e cabinet da 70 a 150 kW con raffreddamento a liquido opzionale, che è dove l'inferenza su dati aziendali confidenziali tende a atterrare.

Nessuna di queste cose risolve da sola il problema del retrieval. Ma la direzione di viaggio dell'ultima settimana è coerente: l'industria sta trattando contesto, rappresentazione e identità come variabili di ingegneria piuttosto che come prompt da regolare. È un problema più difficile del cablaggio di un vector store, ed è quello che decide se un agente può essere fidato con il lavoro.

Commenti 0

Fonti

14
  1. 01AutoSynthData: Generating Training Data for Enterprise AgentsEN
  2. 02When More Data Is Not Enough: The Context-Sufficiency Frontier in Generative AI PersonalizationEN
  3. 03Enterprise Representation Simplification (ERS): Reducing Representational Complexity for Enterprise AIEN
  4. 04IAM for AI agents: A Practical Enterprise FrameworkEN
  5. 05Container Apps Express Reaches GA on a Newly Generally Available Sandbox LayerEN
  6. 06CoreWeave Targets Enterprises with Forge PlatformEN
  7. 07China's generative AI user base crosses 700 million, covering over half the populationEN
  8. 08The Role of Optical Frequency Comb Generators in AI Data CentersEN
  9. 09Enterprises Adopt Colocation for AI and Hybrid Cloud InitiativesEN
  10. 10Redefining enterprise intelligence with autonomous AIEN
  11. 11ShamAN-Q: Shampoo Augmented NanoQuant for Sub-1-bit LLM WeightsEN
  12. 12ReLaG: A Scalable Framework Generalizing Random Splits to Data with Latent RelationsEN
  13. 13Conformal Adversarial Generative EnsembleEN
  14. 14This startup helps food carts switch loud, dirty generators for batteriesEN

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Giulia Ferrari

Giulia Ferrari

IA, modelli e tecnologie

Giulia Ferrari scrive di tecnologia, IA e modelli e media e internet per FLASH24, partendo da dataset pubblici, preprint e registri di versioni dei modelli. Controlla ogni numero confrontando benchmark dichiarati e risultati riproducibili, e scarta le stime senza fonte. Segue le audizioni in calendario, parla con ricercatori e ingegneri, e mette a confronto release e changelog prima di pubblicare. Fuori dalla redazione smonta stampanti 3D, recupera vecchi computer e studia come i modelli imparano dai rifiuti del web. Non pubblica un dato se non può ricostruirne il percorso.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.