Przejdź do treści
Czas na świecieEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal o AI i technologiiwydarzenia · analizy · wywiady · tło techniczne

Szukaj
NA ŻYWO
›

AutoSynthData od ServiceNow zamienia błędy agentów na dane treningowe

ServiceNow opublikował 2 października pipeline do agentów enterprise, który generuje nowe zadania treningowe na podstawie własnych błędów modelu. Celem jest zapełnienie luk w pobieraniu danych i użyciu narzędzi. Metodę opisali czterej badacze z ServiceNow na Hugging Face.

AI i modeleNewsAnna KaczmarekOpublikowano: 2 października 20267 min czytaniaŹródła 14
AutoSynthData od ServiceNow zamienia błędy agentów na dane treningowe

Pipeline nosi nazwę AutoSynthData. Zgodnie z wpisem inżynieryjnym z 2 października, wykorzystuje błędy docelowego modelu oraz sukcesy silniejszego nauczyciela, aby zdecydować, czego model powinien się nauczyć. Następnie generuje i waliduje nowe zadania ćwiczące te kompetencje.

To istotne, ponieważ problem agentów enterprise to w dużej mierze problem pobierania danych. Agent, który nie znajdzie właściwej polityki, rekordu aktywów lub notatki pracy w odpowiednim momencie, nie wykona zadania. Jeden błąd to za mało, aby trenować system.

Autorzy z ServiceNow, Esakkivel Esakkiraja, Shruthan Radhakrishna, Denis Akhiyarov i Sagar Davasam, opisują lukę wprost: model może być ogólnie zdolny, ale mieć problem z konkretnym środowiskiem, słabo obsługiwanym workflow, nieprawidłowym połączeniem narzędzi lub ignorowaniem ograniczeń. Wpis wyznacza trzy warunki dla generowanego zadania: wykonalność, realizm i trudność. Trzy warunki dla walidatora oceniającego wynik zaczynają się od spójności. Warstwa weryfikacji jest kluczowa: bez pewnego sprawdzenia, syntetyczne zadania niczego nie uczą. ServiceNow ilustruje metodę na przykładzie EnterpriseOps Gym, benchmarku opublikowanego z artykułem w tym roku. To jeden z kilku badań w tym samym okresie, które atakują ten sam problem z różnych stron: jak zakotwiczyć systemy enterprise w kontekście, na którym mogą realnie działać.

Jakość pobierania danych staje się mierzalną zmienną

30 września dwa preprinty złożone na arXiv zajęły się warstwą reprezentacji pod spodem enterprise retrieval. Merieme Askour i Ayoub Merimi proponują teorię wystarczalności kontekstu w personalizacji generatywnej AI. Argumentują, że gdy kontekst jest tani do dostarczenia, więcej nie znaczy lepiej.

Ich ramy identyfikują cztery stany: niewystarczalność, wystarczalność, nasycenie i interferencję. Definiują Frontier Wystarczalności Kontekstu, aby zlokalizować minimalny, odpowiedni zbiór. W eksperymencie pełnofaktorialnym z generatywnym rekomenderem u dużego sprzedawcy mebli, odpowiedni kontekst poprawił trafność, podczas gdy nieistotny kontekst ją obniżył i destabilizował pobieranie.

Drugi artykuł, autorstwa Terry’ego Dorsey’ego i Kevina Hugginsa, wprowadza Uproszczenie Przedstawień Enterprise i model niezależny od reprezentacji o nazwie Złożoność Przedstawień Enterprise. Autorzy twierdzą, że informacje enterprise akumulują struktury kształtowane przez aplikacje, projekty i granice organizacyjne. Ta złożoność reprezentacji musi być utrzymywana i interpretowana zarówno przez ludzi, jak i systemy AI. Kluczowy argument dla praktyków retrieval: redukcja złożoności na poziomie zadania zmniejsza zakres reprezentacji, który system AI musi identyfikować, łączyć i interpretować. Badania nad tekstem do SQL dostarczają dowodów, że zmniejszenie złożoności schematu i rozumowania może poprawić dokładność. Autorzy zaznaczają ostrożnie, że ERC nie jest uniwersalnym wskaźnikiem złożoności, wydajności ani kosztu.

Żaden z artykułów nie dostarcza produktu. Oba wskazują jednak na tę samą diagnozę. Rzucanie w system retrieval większej ilości kontekstu to nie to samo co dostarczenie wystarczającego kontekstu. Różnica objawia się niestabilnymi odpowiedziami w produkcji.

Tożsamość to druga połowa problemu zakotwiczenia

The Hacker News opublikował 28 września ramy dla zarządzania tożsamością i dostępem (IAM) agentów AI. Wskazują one na tryb błędu, który zespoły retrieval często odkrywają zbyt późno. Platformy IAM wyrażają zamierzony dostęp, podczas gdy aplikacje i infrastruktura ujawniają, co agent faktycznie wykonał.

Między nimi znajduje się to, co artykuł nazywa ciemną materią tożsamości: agenci, poświadczenia, lokalne konta aplikacji i ścieżki uwierzytelniania, o których centralne dane tożsamości nigdy nie raportują. Tekst cytuje OWASP Top 10 dla Aplikacji LLM, które wymienia nadmierną agencję jako LLM06. Wymienia pięć częstych błędów, w tym brak właściciela, długoterminowe sekrety i nieograniczone delegowanie.

Kąt pobierania danych jest bezpośredni. Agent z szerokimi uprawnieniami może pobrać dane, do których nigdy nie miał zakresu dostępu. Statyczna przypisania ról nie są w stanie ograniczyć tego zachowania. Wyniki konfiguracji opisują możliwość; telemetria opisuje to, co się wydarzyło.

Dostawcy chmury przenoszą infrastrukturę niżej w stosie

Microsoft ogłosił ogólną dostępność Azure Container Apps Express, o czym InfoQ poinformował 1 października. Obok niej pojawiła się ogólna dostępność Azure Container Apps Sandboxes, warstwy obliczeniowej izolowanej, na której działa Express. Express przyjmuje obraz kontenera, region i potrzebną konfigurację, a następnie sam zaopatruje obliczenia, ingress i skalowanie. Działa na CPU consumption z rozliczaniem co sekundę i skaluje się do zera, gdy jest nieaktywny.

Microsoft opisuje Express jako zorientowany na dewelopera i agenta. Dokumentacja stwierdza, że jest zbudowany w całości na Sandboxes. One zaopatrują się z podgrzanych puli dla uruchomienia w subsekundzie, izolują każdą obciążenie w swojej własnej granicy microVM izolowanej sprzętowo i wspierają zawieszenie oraz wznowienie z przywracaniem w subsekundzie. Deweloperzy mogą używać Sandboxes bezpośrednio. Microsoft pozycjonuje tę ścieżkę dla platform agentowych i usług bezpiecznego wykonywania kodu. Reakcja na Reddit sugerowała, że prymityw był już w użyciu przed ogłoszeniem. Jeden komentator, MuhBlockchain, twierdził, że ACA Sandboxes stanowią podstawę kluczowych usług Azure, w tym Foundry Hosted Agents. To szczegół, którego nie potwierdzają materiały Microsoftu.

CoreWeave poszło w tym samym kierunku dzień wcześniej. 30 września na evencie Fully Connected w San Francisco zaprezentowało CoreWeave Forge. To zintegrowana platforma programistyczna do tworzenia, uruchamiania i ulepszania modeli i agentów AI, według Data Center Knowledge. Forge jest dostępny w edycjach Free, Pro i Enterprise. Zawiera CoreWeave Notebooks, Agent Lens do obserwowalności agentów produkcyjnych oraz RL Rollouts.

Corey Sanders, starszy wiceprezes ds. zarządzania produktami w CoreWeave, powiedział na briefingu medialnym, że firma przeszła od skupienia na byciu najlepszym dostawcą infrastruktury AI do dostarczania usług AI, które pozwalają klientom budować aplikacje na ich platformie. Analityk IDC Dave McCarthy powiedział Data Center Knowledge, że CoreWeave potrzebuje szerszej bazy enterprise i większego ekosystemu oprogramowania, aby zbudować zrównoważony biznes.

Skradąd pochodzi popyt

Baza użytkowników generatywnej AI w Chinach przekroczyła 700 000 000 pod koniec czerwca, poinformowało China Internet Network Information Centre. To wzrost o 16 procent z 602 000 000 pod koniec 2 025, gdy penetracja wynosiła 42,8 procent. South China Morning Post, który relacjonował wydanie 29 września, zauważył, że 76 procent ankietowanych użytkowników korzystało z generatywnej AI do szukania odpowiedzi, 48 procent do przetwarzania obrazów lub wideo, a 38 procent do przetwarzania tekstu.

To liczby konsumenckie, nie enterprise. Ustalają jednak bazę oczekiwań, z którą mierzone są systemy retrieval enterprise. Wyjaśniają, dlaczego dostawcy na całym stosie ścigają się, aby wyjścia agentów wyglądały mniej jak zgadywanki.

Ograniczenia infrastrukturalne pod spodem są realne. Generatory grzebieni częstotliwości optycznych, które produkują wiele długości fal z jednej lasera zamiast jednego lasera na kanał, są promowane jako sposób na obniżenie zużycia energii, kosztów i punktów awarii, gdy centra danych AI skalują się ponad 16 długości fal na włókno. Data Center Knowledge raportowało o tym 24 września. Frank Smyth, założyciel i CTO Pilot Photonics, powiedział, że lasery grzebieniowe potencjalnie pozwalają na zapakowanie znacznie większej liczby długości fal znacznie ciaśniej, bez obaw o interferencję. Marcello Girardi, CEO i współzałożyciel Solinide, jasno określił praktyczną granicę: cztery długości fal to rozwiązany problem dla tablic laserowych, trudność zaczyna się przy ośmiu, a przy 16 liczbę komponentów ogranicza. Steven Estrella z Quintessent dodał, że przy obecnym niedoborze podaży laserów InP CW DFB, zmniejszenie liczby wymaganych laserów jest ważniejsze niż kiedykolwiek.

Kupcy enterprise przemyślają również, gdzie uruchamiana jest inferencja. VMware Private Cloud Outlook 2 026, cytowane przez Data Center Knowledge 21 września, wskazuje, że 83 procent firm ukończyło lub planuje repatriację obciążeń z chmury publicznej. Przyczyniają się do tego kwestie bezpieczeństwa, kosztów, zgodności i wydajności. Nowoczesne obiekty colocation wspierają szafy 35 kW z chłodzeniem powietrzem oraz szafy 70 do 150 kW z opcjonalnym chłodzeniem cieczą. To tam ląduje inferencja na poufnych danych korporacyjnych.

Nic z tego samo w sobie nie rozwiązuje problemu pobierania danych. Kierunek ruchu w ostatnim tygodniu jest jednak spójny: branża traktuje kontekst, reprezentację i tożsamość jako zmienne inżynieryjne, a nie jako prompty do dostrojenia. To trudniejszy problem niż podłączenie wektora store i to on decyduje, czy agentowi można zaufać z pracą.

Komentarze 0

Źródła

14
  1. 01AutoSynthData: Generating Training Data for Enterprise AgentsEN
  2. 02When More Data Is Not Enough: The Context-Sufficiency Frontier in Generative AI PersonalizationEN
  3. 03Enterprise Representation Simplification (ERS): Reducing Representational Complexity for Enterprise AIEN
  4. 04IAM for AI agents: A Practical Enterprise FrameworkEN
  5. 05Container Apps Express Reaches GA on a Newly Generally Available Sandbox LayerEN
  6. 06CoreWeave Targets Enterprises with Forge PlatformEN
  7. 07China's generative AI user base crosses 700 million, covering over half the populationEN
  8. 08The Role of Optical Frequency Comb Generators in AI Data CentersEN
  9. 09Enterprises Adopt Colocation for AI and Hybrid Cloud InitiativesEN
  10. 10Redefining enterprise intelligence with autonomous AIEN
  11. 11ShamAN-Q: Shampoo Augmented NanoQuant for Sub-1-bit LLM WeightsEN
  12. 12ReLaG: A Scalable Framework Generalizing Random Splits to Data with Latent RelationsEN
  13. 13Conformal Adversarial Generative EnsembleEN
  14. 14This startup helps food carts switch loud, dirty generators for batteriesEN

Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.

Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.

Anna Kaczmarek

Anna Kaczmarek

AI, modele i technologie

Anna Kaczmarek pisze o technologiach, AI i modelach oraz mediach i internecie, opierając się na dokumentacji, repozytoriach i danych źródłowych, a nie na komunikatach prasowych. Przy testach modeli sprawdza karty techniczne, parametry wejściowe i liczy wyniki na tych samych zbiorach, zamiast powtarzać liczby od producentów. Czeka na premiery API i aktualizacje wag, rozmawia z inżynierami oraz porównuje wersje modeli pod kątem kosztów i opóźnień. Prywatnie self-hostuje usługi i konfiguruje sieci domowe, więc do redakcji wnosi praktykę z własnego serwera. Nie publikuje zapowiedzi ani parametrów, których nie może odtworzyć na własnym środowisku.

Redakcja →

Komentarze

0
  1. Brak komentarzy — bądź pierwszy.

Dodaj komentarz

Komentarze są widoczne publicznie. Nie publikujemy wulgaryzmów, spamu i treści reklamowych.