Przejdź do treści
Czas na świecieEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal o AI i technologiiwydarzenia · analizy · wywiady · tło techniczne

Szukaj
NA ŻYWO
›

Koszty inferencji idą w dwie strony: otwarte silniki optymalizują się same, producenci chipów tną hardware

Otwarty silnik inferencji opublikowany na GitHubie 30 września obiecuje, że modele open source działają do 2x szybciej niż llama.cpp, kompilując jądra na urządzeniu użytkownika. Tymczasem MaxLinear twierdzi, że nowy chip Puma 9 DOCSIS obniża koszty urządzeń klienckich o 30% do 50%.

AI i modeleAnalizaAnna KaczmarekOpublikowano: 1 października 20265 min czytaniaŹródła 11
Koszty inferencji idą w dwie strony: otwarte silniki optymalizują się same, producenci chipów tną hardware

Magnitude, spółka z programu Y Combinator S25, udostępniła swoje repozytorium 30 września na licencji Apache 2.0. Aplikacja desktopowa stroi jądra na Apple Silicon, NVIDIA, AMD lub zwykłych CPU przed uruchomieniem modelu. MaxLinear wykorzystał briefing z 29 września, aby stwierdzić, że krzem Puma 9 obniża koszty modemów i bram o 30% do 50% w porównaniu z poprzednikiem, Pumą 8 wprowadzoną w 2023 roku.

Liczby Magnitude są konkretne: README twierdzi o 92% szybszym dekodowaniu na Metal i 19% na CUDA w porównaniu z llama.cpp, 27% mniejszym zużyciu pamięci na agenta, które uwalnia się, gdy agenci się zatrzymują, oraz wspólnych cache'ach prefiksów dla równoległych sesji. Silnik łączy się z Pi, OpenCode, Hermes, OpenClaw, Codex, Claude Code, Oh My Pi i Cline, a pozostałe narzędzia obsługiwane są przez API zgodne z OpenAI. Firma zapewnia, że prompty, pliki i modele pozostają na maszynie, a po pobraniu modelu nie jest wymagany internet. To jest obietnica. Czy się spełni na Twoim sprzęcie, to inna sprawa: benchmark należy do dostawcy, a repozytorium nie publikuje niezależnej replikacji.

Argument MaxLineara opiera się na innym rodzaju strojenia. Puma 9 wspiera DOCSIS 4.0, DOCSIS 3.1+ i DOCSIS 3.1, dodaje obsługę Wi-Fi 8 i po raz pierwszy w linii Puma przechodzi na architekturę ARM, którą MaxLinear przejął w 2020 roku wraz z zakupem działu Home Gateway Platform od Intela.

Źródło branżowe zaznajomione z krzemem powiedziało Light Reading, że zmiana na ARM pomaga obniżyć pobór mocy i niektóre koszty licencyjne. MaxLinear deklaruje, że będzie wspierał produkty x86, a platforma programowa RDK sprawia, że architektura CPU jest w dużej mierze transparentna dla klientów. W obliczu niedoborów DDR4, Puma 9 wspiera również DDR5. Puneet Sethi, SVP i GM jednostki biznesowej MaxLinear ds. infrastruktury sieciowej i operatorów, stwierdził, że firma uważa, że ekosystem, ceny i dostawy DDR5 staną się bardziej stabilne niż napięcie obserwowane przy DDR4. Jeff Heynen z Dell'Oro Group powiedział Light Reading, że większość dostawców przejdzie na DDR5 dla bardziej zaawansowanych jednostek Wi-Fi 8, ponieważ dodatkowe aplikacje na pokładzie i diagnostyka mogą wymagać więcej pamięci.

MaxLinear informuje, że ma wiele zobowiązań dotyczących Pumy 9, wymienia Askey, Fritz! GmbH i Gemtek jako partnerów CPE oraz ma wsparcie australijskiego operatora NBN Co. Modemy i bramki oparte na tym chipie są oczekiwane w 2027 roku.

Presja kosztowa nie ogranicza się do modemów. W ochronie zdrowia Endpoints News zapytało 1 października, czy AI podnosi koszty zamiast je obniżać, stawiając pytanie w kontekście fali finansowania: Parakeet Health pozyskała $10M, aby zautomatyzować kontakt z pacjentami, a Devoted Health pozyskała $1.2B, co oba raportowano 1 października. CleanTechnica raportowała 29 września, że analiza Transport & Environment szacuje koszty eksploatacji aut elektrycznych na mniej niż połowę kosztów diesla na kilometr, podczas gdy kierowcy diesli płacą €32 więcej za tankowanie niż na początku roku, w tym około €16 dodatkowego marży rafineryjnej. Ten sam serwis raportował 28 września o operatorach centrów danych sięgających po przenośne generatory metanowe oraz o wcześniejszej walce ze spalinami diesla, która nastąpiła po klasyfikacji spalin diesla jako substancji rakotwórczej przez Światową Organizację Zdrowia w 2012 roku.

Producenci sprzętu starają się też wyciągać koszty z baterii. Electrek raportował 29 września, że Ultium Cells, spółka joint venture GM z LG Energy Solution, będzie masowo produkować pryzmatyczne ogniwa LMR w Spring Hill w Tennessee, twierdząc o 33% wyższej gęstości energii niż LFP przy porównywalnych kosztach. Wiceprezes GM Kurt Kelty stwierdził, że dodanie LMR pozycjonuje firmę, aby wyprzedzić dzisiejsze tańsze chemie. Ulepszenia rozpoczynają się pod koniec tego roku i mają zostać ukończone do 2028 roku, dodając 500 miejsc pracy do zespołu liczącego 1 700 osób; pierwszy pojazd z bateriami LMR jest oczekiwany w 2028 roku.

Tańsza eksploatacja, droższa budowa

Wzorzec w tej dokumentacji jest taki, że inferencja i operacje stają się tańsze, podczas gdy aktywne pod spodem pozostają kosztowne. Xpeng skonsolidował cztery linie produktowe do dwóch, aby skupić R&D i obniżyć koszty, co 36Kr raportowało w poniedziałek za pośrednictwem CnEVPost. Liczby stojące za tą decyzją: dostawy spadły o 10.49% do 243 111 pojazdów w pierwszych ośmiu miesiącach 2026 roku, wydatki na R&D wzrosły o 32.1% rok do roku do 2 910 000 000 juanów w drugim kwartale, a kwartalna strata netto poszerzyła się do 1 340 000 000 juanów z 480 000 000 juanów rok wcześniej. Operatorzy telekomunikacyjni idą tą samą drogą. Light Reading raportowało 30 września, że StarHub i M1 prowadzą rozmowy o fuzji w Singapurze, gdzie Singtel miał ponoć 43% udział w rynku mobilnym w czerwcu, M1 22%, StarHub 21%, a Simba 14%. W Nowej Zelandii 2degrees i OneNZ zaproponowały połączenie swoich sieci radiowych dostępowych w wspólnie zarządzaną jednostkę, z decyzją Urzędu Ochrony Konkurencji oczekiwanej w przyszłym roku. Układ 5G China Telecom i China Unicom, największe takie partnerstwo, obejmuje 1 500 000 stacji bazowych i twierdzi o oszczędnościach na nakładach inwestycyjnych w wysokości $56 000 000 000.

Badania drążą też stronę programową. Artykuł złożony do arXiv 29 września, Demographic Pluralism, raportuje o redukcji odległości Jensena-Shannona o 8.4% do 26.4% w porównaniu z Modular Pluralism na czterech kręgosłupach na GlobalOpinionQA i VITAL, bez danych treningowych o rozkładzie opinii ani dostrojenia pod zadanie. Drugi artykuł przyjęty na NeurIPS 2026, FluxLite, raportuje o ulepszeniach w porównaniu z standardowymi bazowymi Feynman-Kac sequential Monte Carlo o do dwóch rzędów wielkości w końcowym KL na benchmarku CTMC o skończonym stanie oraz redukcjach MSE korelacji wierszowej przy próbkowaniu 2D Isinga o 5-7x w średniej geometrycznej i do 55x w szczycie.

Microsoft Research argumentowało 23 września, że uruchamianie inferencji fizycznego AI tylko na GPU na pokładzie ogranicza wydajność robotów, czas pracy baterii i skalę, a offloading do GPU na krawędzi lub w chmury poprawia wskaźniki sukcesu zadań i czas pracy w obciążeniach mobilnej manipulacji. Przedstawiło również narzędzia oparte na Kubernetes do konteneryzacji i orkiestracji obciążeń robotycznych w robotach, na krawędzi i w chmurze.

Jedno zastrzeżenie przebiega przez całość. Dane wydajnościowe od Magnitude, Ultium Cells i MaxLinear należą do dostawców, a zyski efektywności w dwóch artykułach z arXiv są mierzone na benchmarkach akademickich, a nie na ruchu produkcyjnym.

Komentarze 0

Źródła

11
  1. 01Launch HN: Magnitude (YC S25) - Self-optimizing inference engine for agentsEN
  2. 02MaxLinear claims new 'Puma 9' DOCSIS chip is a big cost-cutterEN
  3. 03Is AI jacking up healthcare costs?EN
  4. 04Driving An EV Now Costs Half As Much As Diesel, New Analysis ShowsEN
  5. 05The Human Cost Of Data Center PollutionEN
  6. 06GM's new EV battery tech will cut costs without sacrificing rangeEN
  7. 07Xpeng reportedly consolidates product lines to cut R&D costsEN
  8. 08Singapore, New Zealand operators seek partnerships to cut costsEN
  9. 09Demographic Pluralism: Inference-Time Modeling of Pluralistic Human Preference DistributionsEN
  10. 10FluxLite: Inference-Time Proposal Control for Discrete Diffusion ModelsEN
  11. 11Offloaded inference for real-world physical AI roboticsEN

Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.

Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.

Anna Kaczmarek

Anna Kaczmarek

AI, modele i technologie

Anna Kaczmarek pisze o technologiach, AI i modelach oraz mediach i internecie, opierając się na dokumentacji, repozytoriach i danych źródłowych, a nie na komunikatach prasowych. Przy testach modeli sprawdza karty techniczne, parametry wejściowe i liczy wyniki na tych samych zbiorach, zamiast powtarzać liczby od producentów. Czeka na premiery API i aktualizacje wag, rozmawia z inżynierami oraz porównuje wersje modeli pod kątem kosztów i opóźnień. Prywatnie self-hostuje usługi i konfiguruje sieci domowe, więc do redakcji wnosi praktykę z własnego serwera. Nie publikuje zapowiedzi ani parametrów, których nie może odtworzyć na własnym środowisku.

Redakcja →

Komentarze

0
  1. Brak komentarzy — bądź pierwszy.

Dodaj komentarz

Komentarze są widoczne publicznie. Nie publikujemy wulgaryzmów, spamu i treści reklamowych.