DSec: DeepSeek pokazał, jak produkuje 3 mln środowisk dziennie dla agentów
W pracy z podpisem Liang Wenfenga DeepSeek opisuje system DSec: 5000 nowych sandboxów na sekundę, 300 mln dziennie i 380 tys. działających jednocześnie.

Trening agenta nie polega na karmieniu sieci danymi. Agent musi w środowisku napisać kod, skompilować go, otworzyć przeglądarkę, a czasem zainstalować system. Każdy krok zmienia stan tego środowiska, które w dowolnym momencie może się zepsuć. Dlatego każda runda treningu potrzebuje świeżego, czystego sandboxa, który po użyciu się wyrzuca. Chiński portal IT之家 opisuje pracę DeepSeek o nazwie DSec (DeepSeek Elastic Compute), pod którą podpisał się współzałożyciel firmy, Liang Wenfeng.
Skala jest tu istotą problemu. DSec wytwarza ponad 5000 sandboxów na sekundę, co daje 3 mln dziennie, a szczyt jednoczesnej pracy sięga 380 tys. środowisk. Obsługujący to pojedynczy klaster liczy około 160 węzłów, 30 tys. rdzeni procesorowych i 250 TB pamięci RAM. Dzięki nadsubskrypcji zasobów i gęstemu upakowaniu jeden węzeł mieści jednocześnie 3200 kontenerów albo 800 mikro-maszyn wirtualnych.
Problem: system dla każdego z 3 mln sandboxów
Wąskim gardłem nie jest samo szeregowanie, lecz budowa środowiska. Klasyczne podejście Dockera pakuje obraz bazowy, katalog roboczy i zestaw narzędzi w jeden kompletny obraz i sprawdza się w małej skali. W DSec backend kontenerowy zużył łącznie 11 266 obrazów bazowych i 102 171 katalogów roboczych. Aż 67,8 proc. sandboxów wymaga dołożenia na obraz bazowy co najmniej jednej warstwy z katalogiem roboczym lub pakietem narzędzi. Przy takiej różnorodności aktualizacja jednego pakietu wymuszałaby przebudowę wszystkich obrazów, które go zawierają.
Rozwiązaniem jest rozbicie środowiska na trzy niezależnie wersjonowane, tylko-do-odczytu warstwy w formacie EROFS: obraz bazowy, katalog roboczy i pakiet narzędzi. Skleja je w momencie startu sandboxa overlayfs. Aktualizacja pakietu dotyka wtedy wyłącznie jego warstwy. Drugim elementem jest komponent Chronus. Pośredniczy on w komunikacji z wnętrza sandboxa do frameworka treningowego, dzięki czemu framework wie, na jakim etapie jest agent i jaki sygnał zwrotny ma przekazać.
Dlaczego to dotyczy każdego modelu agentowego
Karta modelu V4.1-Flash potwierdza, że w treningu poszło właśnie o to: przepis posttreningowy pozostał standardowy, a wszystkie istotne zmiany dotyczyły potoku danych, czyli masowej, automatycznej syntezy zadań i środowisk agentowych. Jakość agenta zależy dziś od fabryki środowisk w tle, a nie od kolejnej sztuczki w algorytmie uczenia. DSec jest odpowiedzią DeepSeek na pytanie, skąd wziąć 3 mln takich środowisk dziennie bez zbudowania centrum danych, które sam się zadusi.
Źródła
2- 01DeepSeek 新论文公开 Agent 训练,梁文锋署名 (IT之家)ZH
- 02DeepSeek-V4.1-Flash — sekcja Post-training (data pipeline)EN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.