Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

I costi di inferenza si dividono in due: motori aperti si ottimizzano, i produttori di chip tagliano l'hardware

Un motore di inferenza open source lanciato su GitHub il 30 settembre afferma che i modelli aperti funzionano fino a 2 volte più velocemente rispetto a llama.cpp compilando e ottimizzando i kernel sul dispositivo dell'utente, mentre MaxLinear sostiene che il suo nuovo chip Puma 9 DOCSIS può ridurre i costi delle apparecchiature di premises del 30% al 50%.

IA e modelliAnalisiChiara RomanoPubblicato: 1 ottobre 20265 min di letturaFonti 11
I costi di inferenza si dividono in due: motori aperti si ottimizzano, i produttori di chip tagliano l'hardware

Magnitude, una società Y Combinator S25, ha pubblicato il suo repository il 30 settembre sotto licenza Apache 2.0. L'app desktop ottimizza i kernel su Apple Silicon, NVIDIA, AMD o CPU standard prima che un modello venga eseguito. MaxLinear ha utilizzato un briefing del 29 settembre per affermare che il suo silicio Puma 9 riduce i costi di modem e gateway del 30% al 50% rispetto al suo predecessore, il Puma 8 introdotto nel 2.023.

I numeri di Magnitude sono specifici: il README afferma un decode il 92% più veloce su Metal e il 19% su CUDA rispetto a llama.cpp, una memoria per agente inferiore del 27% che viene liberata quando gli agenti si fermano, e cache di prefisso condivise tra sessioni concorrenti. Si collega a Pi, OpenCode, Hermes, OpenClaw, Codex, Claude Code, Oh My Pi e Cline, gestendo tutto il resto tramite un'API compatibile con OpenAI. L'azienda afferma che prompt, file e modelli restano sulla macchina e non è necessaria internet una volta scaricato un modello. Questa è la proposta. Se regge sul tuo hardware è un'altra storia: il benchmark è quello del venditore e il repository non pubblica una replicazione di terze parti.

L'affermazione di MaxLinear si basa su un tipo diverso di ottimizzazione. Il Puma 9 supporta DOCSIS 4.0, DOCSIS 3.1+ e DOCSIS 3.1, aggiunge il supporto Wi-Fi 8 e passa per la prima volta alla linea Puma a un'architettura ARM, che MaxLinear ha ereditato attraverso l'acquisizione del 2.020 dell'unità Intel Home Gateway Platform.

Una fonte del settore familiare con il silicio ha detto a Light Reading che il passaggio ad ARM aiuta a ridurre il consumo energetico e alcuni costi di licenza. MaxLinear afferma che continuerà a supportare i prodotti x86 e che la piattaforma software RDK rende l'architettura CPU sottostante in gran parte trasparente per i clienti. Di fronte alle carenze di DDR4, il Puma 9 supporta anche DDR5. Puneet Sethi, SVP e GM dell'unità di business per infrastrutture di rete e carrier di MaxLinear, ha affermato che l'azienda ritiene che l'ecosistema, i prezzi e l'offerta di DDR5 diventeranno più rilassati rispetto allo stress visto con DDR4. Jeff Heynen di Dell'Oro Group ha detto a Light Reading che la maggior parte dei produttori passerà a DDR5 per unità Wi-Fi 8 più avanzate a causa della memoria aggiuntiva che le app e le diagnostiche potrebbero richiedere.

MaxLinear afferma di avere più impegni per il Puma 9, cita Askey, Fritz! GmbH e Gemtek come partner CPE, e ha il supporto dell'operatore australiano NBN Co. I modem e i gateway basati su di esso sono attesi nel 2.027.

La pressione sui costi non è confinata ai modem. In sanità, Endpoints News ha chiesto il 1 ottobre se l'AI sta aumentando i costi piuttosto che ridurli, inquadrando la domanda contro un'onda di finanziamenti: Parakeet Health ha raccolto 10M di dollari per automatizzare il contatto con i pazienti e Devoted Health ha raccolto 1.2B, entrambi riportati il 1 ottobre. CleanTechnica ha riportato il 29 settembre che l'analisi di Transport & Environment colloca i costi di funzionamento delle EV a meno della metà rispetto al diesel per chilometro, con i conducenti diesel che pagano 32 € in più per serbatoio rispetto all'inizio dell'anno, di cui circa 16 € di margine raffineria extra. Lo stesso outlet ha riportato il 28 settembre sugli operatori di data center che si rivolgono a generatori portatili alimentati a metano, e sulla lotta più antica contro le emissioni di diesel seguita alla classificazione del 2.012 dell'Organizzazione Mondiale della Sanità delle emissioni di diesel come cancerogene.

I produttori di hardware stanno cercando di rimuovere i costi anche dalle batterie. Electrek ha riportato il 29 settembre che Ultium Cells, la joint venture di GM con LG Energy Solution, produrrà in massa celle LMR prismatichiche a Spring Hill, Tennessee, affermando una densità energetica superiore del 33% rispetto a LFP a parità di costo. Il vicepresidente di GM Kurt Kelty ha affermato che l'aggiunta di LMR posiziona l'azienda per superare le chimiche più convenienti di oggi. Gli aggiornamenti iniziano più tardi quest'anno e dovrebbero essere completati entro il 2.028, aggiungendo 500 posti di lavoro a una forza lavoro di 1.700; il primo veicolo con batterie LMR è atteso nel 2.028.

Funzionamento più economico, costruzione più costosa

Il modello nel dossier è che inferenza e operazioni diventano più economiche mentre gli asset sottostanti restano costosi. Xpeng ha consolidato quattro linee di prodotto in due per concentrare la ricerca e sviluppo e tagliare i costi, come riportato da 36Kr lunedì tramite CnEVPost. I numeri dietro quella decisione: le consegne sono scese del 10.49% a 243.111 veicoli nei primi otto mesi del 2.026, le spese di ricerca e sviluppo sono aumentate del 32.1% su base annua a 2.910.000.000 di yuan nel secondo trimestre, e la perdita netta trimestrale si è allargata a 1.340.000.000 di yuan da 480.000.000 di yuan un anno prima. Gli operatori delle telecomunicazioni stanno seguendo la stessa strada. Light Reading ha riportato il 30 settembre che StarHub e M1 sono in trattativa di fusione a Singapore, dove Singtel ha detenuto una quota mobile del 43% a giugno, M1 il 22%, StarHub il 21% e Simba il 14%. In Nuova Zelanda, 2degrees e OneNZ hanno proposto di combinare le loro reti radio access in un'entità di proprietà congiunta, con la Commerce Commission che dovrebbe decidere l'anno prossimo. L'accordo 5G tra China Telecom e China Unicom, il più grande di questo tipo, copre 1.500.000 stazioni base e ha affermato risparmi capex di 56.000.000.000 di dollari.

La ricerca sta erodendo anche il lato software. Un paper inviato ad arXiv il 29 settembre, Demographic Pluralism, riporta una riduzione della distanza Jensen-Shannon dall'8.4% al 26.4% rispetto a Modular Pluralism su quattro backbones su GlobalOpinionQA e VITAL senza dati di addestramento sulla distribuzione delle opinioni o fine-tuning specifico del task. Un secondo paper accettato a NeurIPS 2026, FluxLite, riporta miglioramenti rispetto a baseline standard di Monte Carlo sequenziale Feynman-Kac fino a due ordini di grandezza su KL terminale in un benchmark CTMC a stato finito, e riduzioni di MSE di correlazione di riga su campionamento Ising 2D di 5-7 volte in media geometrica e fino a 55 volte al picco.

Microsoft Research ha argomentato il 23 settembre che eseguire l'inferenza di AI fisica solo su GPU di bordo limita le prestazioni dei robot, la durata della batteria e la scala, e che l'offloading a GPU edge o cloud ha migliorato i tassi di successo del task e il tempo operativo su carichi di lavoro di manipolazione mobile. Ha anche introdotto strumenti basati su Kubernetes per containerizzare e orchestrare i carichi di lavoro robotici tra robot, edge e cloud.

Una cautela attraversa tutto questo. I numeri di prestazioni da Magnitude, Ultium Cells e MaxLinear sono dei venditori, e i guadagni di efficienza nei due paper arXiv sono misurati su benchmark accademici piuttosto che su traffico di produzione.

Commenti 0

Fonti

11
  1. 01Launch HN: Magnitude (YC S25) - Self-optimizing inference engine for agentsEN
  2. 02MaxLinear claims new 'Puma 9' DOCSIS chip is a big cost-cutterEN
  3. 03Is AI jacking up healthcare costs?EN
  4. 04Driving An EV Now Costs Half As Much As Diesel, New Analysis ShowsEN
  5. 05The Human Cost Of Data Center PollutionEN
  6. 06GM's new EV battery tech will cut costs without sacrificing rangeEN
  7. 07Xpeng reportedly consolidates product lines to cut R&D costsEN
  8. 08Singapore, New Zealand operators seek partnerships to cut costsEN
  9. 09Demographic Pluralism: Inference-Time Modeling of Pluralistic Human Preference DistributionsEN
  10. 10FluxLite: Inference-Time Proposal Control for Discrete Diffusion ModelsEN
  11. 11Offloaded inference for real-world physical AI roboticsEN

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Chiara Romano

Chiara Romano

IA, modelli e tecnologie

Chiara Romano scrive di tecnologia, IA e modelli, media e internet per FLASH24, partendo da documentazione tecnica, repository e specifiche invece che da comunicati stampa. Per ogni modello o piattaforma che segue controlla versioni, licenze, parametri e benchmark, e verifica i numeri confrontandoli con i dati originali o con test indipendenti. Confronta le schede tecniche tra fornitori, parla con sviluppatori e amministratori di sistema, e tiene d'occhio le finestre di rilascio e le modifiche ai termini d'uso. Fuori dalla redazione gestisce self-hosting e reti domestiche, esperienza che le serve per capire come funzionano davvero i servizi che racconta. Non pubblica una notizia se la fonte primaria non è verificabile.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.