Przejdź do treści
Czas na świecieEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal o AI i technologiiwydarzenia · analizy · wywiady · tło techniczne

Szukaj
NA ŻYWO
›

Humanoidy wchodzą na halę produkcyjną: dane, opóźnienia i spór w zarządzie

Innodata otworzyła 30 września laboratorium przechwytywania ruchu. Firma chce dostarczyć fizycznej AI danych z realnego świata, których jej brakuje. Najnowsze badania nad opóźnieniami i benchmarkami pokazują, jak daleko humanoidom jeszcze do niezawodnej pracy w fabryce.

TechnologiaAnalizaAnna KaczmarekOpublikowano: 30 września 20264 min czytaniaŹródła 4
Humanoidy wchodzą na halę produkcyjną: dane, opóźnienia i spór w zarządzie

Innodata otworzyła 30 września laboratorium przechwytywania ruchu. Firma zapowiada, że będzie generować dane treningowe dla humanoidów i robotów przemysłowych oraz niezależnie weryfikować wyniki, które te roboty podają o sobie samych. Spółka zajmująca się inżynierią danych z Ridgefield Park w New Jersey zbudowała obiekt razem z Vicon. Kamery tego producenta śledzą ruch w podczerwieni i mierzą go z dokładnością do ułamka milimetra. Pisze o tym The Robot Report.

To najnowszy epizod z tygodnia zapowiedzi sprzętowych i programistycznych. Wszystkie wskazują na tę samą lukę: roboty potrafią się ruszać, ale dane i pętle sterowania za nimi nie są jeszcze wystarczająco dobre na zwykłą zmianę w fabryce.

Pieniądze rzucone na problem z danymi

"Fizyczna AI rośnie szybciej niż każdy inny segment AI, ale każdy zespół robotyczny trafia na tę samą ścianę: brakuje danych z realnych interakcji, a te, które istnieją, są drogie i powstają wolno" - powiedział w ogłoszeniu Rahul Singhal, dyrektor generalny Innodaty. Franklin Tanner, wiceprezes firmy ds. robotyki i fizycznej AI, powiedział The Robot Report, że duże modele językowe mogły żywić się otwartym internetem, a roboty nie mogą: "Fizyczna AI musi zapracować na swoje tokeny jedna interakcja po drugiej, i to z rozmysłem".

Innodata twierdzi, że przechwytuje ruch 3D bezpośrednio z ciał, ludzkich lub mechanicznych, zamiast wnioskować go z wideo 2D. Uzyskane dane mogą zasilać cyfrowe bliźniaki dla przypadków brzegowych. Tanner wskazał też ograniczenie, o którym branża nie lubi rozmawiać: nie ma dziś danych treningowych, w których człowiek i robot wchodzą w interakcję. Nad tym między innymi pracuje nowe laboratorium.

Firma nie jest osamotniona w tezie, że o wdrożeniu decydują dane, a nie ciało robota. Destro AI wyszła z ukrycia 30 września z rundą zalążkową o wartości 8 000 000 dolarów, prowadzoną przez Base10 Partners i Bonfire Ventures z udziałem CoFound Partners, i z nietypową propozycją. Nie buduje bowiem robotów.

"Jednym z najważniejszych powodów, dla których wygrywamy z firmami robotycznymi, jest to, że nie jesteśmy firmą robotyczną" - powiedział TechCrunch założyciel Manthan Pawar.

Koordynacja ludzi i wózków

Oprogramowanie Destro kieruje zarówno pracownikami, jak i maszynami. W zakładzie Yusen Logistics w regionie Pacific Northwest trzy roboty do przewożenia wózków, zbudowane przez Miva Robotics, działają na systemie operacyjnym Vision od Destro, opartym na otwartych modelach typu vision-language-action. Pracownicy rozładowują towar z jednej ciężarówki do wózków, a roboty przewożą pełne wózki do miejsc docelowych. System Mothership od Destro koordynuje ludzi, wózki i ciężarówki. Richard Brunelle z Yusen powiedział TechCrunch, że dwa inne startupy robotyczne nie pasowały do tego samego procesu cross-dock: jeden przenosił wózki z punktu do punktu, ale nie radził sobie z załadunkiem ani rozładunkiem, drugi wymagał człowieka do koordynacji.

Destro rozszerza teraz pilotaż do 26 robotów i zaczyna drugi, z 17 robotami, w południowej Kalifornii. Plan Pawara zakłada powielenie procesu cross-dock w innych magazynach. TechCrunch zauważa jednak, że firma nie pokazała jeszcze, że poradzi sobie z zadaniami wymagającymi prawdziwej zręczności.

Szybkość to druga połowa problemu. MindOn opublikowała 30 września tekst techniczny, w którym przedstawia Mind-1, model fizycznej AI. Według firmy skraca on opóźnienie wnioskowania robota z 82 milisekund do 32 milisekund, przybliżając czas wykonania zadania do ludzkich cykli. Tekst mówi wprost, dlaczego to ma znaczenie: przy prędkości efektora 3 metrów na sekundę 10 milisekund opóźnienia to około 3 centymetry ruchu, dość, by zepsuć chwyt albo wsunięcie elementu. MindOn zwraca też uwagę, że większość danych o manipulacji pochodzi z teleoperacji, która jest znacznie wolniejsza od naturalnego ruchu człowieka. Modele uczą się więc wolnego tempa razem z zadaniem.

Benchmarki ukrywają postrzępione krawędzie

Osobne badanie opublikowane 30 września przez naukowców z Fig. Inc podważa wyniki, którymi porównuje się modele napędzające to wszystko. Zespół uruchomił siedem wiodących modeli, w tym Astra i Opus 5.5, na 177 zadaniach webowych w zamkniętej pętli w VisualWebArena. Potem sprawdził trzy modele w czterech domenach fizycznych: VLABench, Assembly101, IndEgo i Bench2Drive. Wniosek jest taki, że średnie z benchmarków ukrywają, jak nierówno modele sobie radzą. W każdej testowanej parze modeli słabszy rozwiązał co najmniej jedno zadanie, które pominął mocniejszy. Aktualizacja modelu może niemal nie zmienić średniej, a jednocześnie odwrócić wyniki wielu pojedynczych zadań. Modele, które pokonały Gemini 3.5-Flash w średniej z każdej domeny, w niektórych kategoriach zadań wypadły gorzej.

To nie jest wyłącznie problem badawczy. 30 września TechCrunch poinformował, że Matan Grinberg, współzałożyciel i dyrektor generalny start-upu Factory zajmującego się kodowaniem z AI, powiedział, że zwolnił inwestora Chrisa Degnana z funkcji doradcy zarządu. Zarzucił mu przekazanie poufnych informacji konkurentowi Cognition. Degnan ogłosił dwie godziny później, że dołączył do Cognition jako dyrektor ds. przychodów, i stwierdził, że odszedł sam, a nie został zwolniony. Khosla Ventures, inwestor w obu firmach, zobaczył, jak jego założyciel Vinod Khosla i partner Keith Rabois zajęli przeciwne stanowiska na X. Factory pozyskała w tym miesiącu 200 000 000 dolarów przy wycenie 5 000 000 000 dolarów; Cognition pozyskała 2 000 000 000 dolarów przy wycenie 48 000 000 000 dolarów.

Pieniądze są. Niezawodny robot, który je odzyska na hali produkcyjnej, wciąż pozostaje pytaniem otwartym.

Komentarze 0

Źródła

4
  1. 01Innodata opens motion-capture lab to help humanoids move more like peopleEN
  2. 02Destro AI's secret sauce is getting robots and humans on the same pageEN
  3. 03Mind-1: Physical AI at Human Speed, Built for Real WorkEN
  4. 04Astra, Opus 5.5, and other Frontier Models Demonstrate Jagged Performance Across SoTA Agentic Tasks from Web Browsing to RoboticsEN

Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.

Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.

Anna Kaczmarek

Anna Kaczmarek

AI, modele i technologie

Anna Kaczmarek pisze o technologiach, AI i modelach oraz mediach i internecie, opierając się na dokumentacji, repozytoriach i danych źródłowych, a nie na komunikatach prasowych. Przy testach modeli sprawdza karty techniczne, parametry wejściowe i liczy wyniki na tych samych zbiorach, zamiast powtarzać liczby od producentów. Czeka na premiery API i aktualizacje wag, rozmawia z inżynierami oraz porównuje wersje modeli pod kątem kosztów i opóźnień. Prywatnie self-hostuje usługi i konfiguruje sieci domowe, więc do redakcji wnosi praktykę z własnego serwera. Nie publikuje zapowiedzi ani parametrów, których nie może odtworzyć na własnym środowisku.

Redakcja →

Komentarze

0
  1. Brak komentarzy — bądź pierwszy.

Dodaj komentarz

Komentarze są widoczne publicznie. Nie publikujemy wulgaryzmów, spamu i treści reklamowych.