Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

Inferenza: un motore cinese moltiplica per 6,87 il throughput di DeepSeek V4.1 Flash su GPU PCIe

Su otto schede PCIe senza interconnessione ad alta velocità, il motore Meta-Infer di METASTONE è passato da 1.932 a 13.274 token al secondo. Tutto con il solo software, senza toccare il modello.

TecnologiaAnalisiChiara RomanoPubblicato: 24 settembre 20266 min di letturaFonti 2
Inferenza: un motore cinese moltiplica per 6,87 il throughput di DeepSeek V4.1 Flash su GPU PCIe

Il dibattito sui chip per l'IA si è spostato. Non conta più solo chi può comprare l'hardware più potente, ma chi riesce a sfruttare al meglio quello che ha già. È la tesi che METASTONE porta avanti con il suo motore di inferenza Meta-Infer, riferisce 量子位 (QbitAI).

La frattura tra framework e hardware

Molte schede grafiche sanno caricare un modello, scaricare i pesi e avviare un servizio. In apparenza funzionano. Nei test di carico, però, le prestazioni reali restano spesso molto sotto i livelli annunciati. Il modello non ha difetti e l'hardware non è guasto: il divario nasce dallo scarto tra framework e hardware. Queste schede non hanno interconnessioni ad alta velocità tra loro e non compaiono nelle matrici di validazione ufficiali dei framework aperti. Così alcuni operatori ricadono in silenzio su implementazioni generiche poco efficienti. I parametri di comunicazione restano tarati per altre architetture. La configurazione di memoria o di parallelismo riprende valori predefiniti pensati per un altro hardware.

Sei virgola otto sette volte più throughput

Meta-Infer affronta il problema con il solo software, senza modificare la struttura del modello né la semantica dei task. L'approccio si divide in quattro parti: completamento dei kernel, ottimizzazione degli operatori e riscrittura della comunicazione, regolazione del parallelismo e della capacità di memoria, infine riuso della cache.

La prima parte corregge metadati e dimensioni di pagina che bloccano l'esecuzione degli operatori ottimizzati nativi, sostituisce kernel vecchi e inadatti e allarga la soglia dei percorsi di comunicazione rapida. Su un ambiente di otto schede PCIe, con la versione community di riferimento per DeepSeek-V4.1-Flash, il throughput in ingresso era di soli 1.932 token al secondo. Dopo questa fase di correzione sale a 5.850 token al secondo.

La seconda parte attacca i colli di bottiglia. Su un'architettura PCIe la banda tra schede è molto inferiore a quella di un'interconnessione dedicata. Applicare le strategie predefinite significa passare il tempo in attese di comunicazione. Il motore fonde gli operatori, sovrappone il calcolo alla comunicazione e riscrive la logica di comunicazione collettiva. Arriva così a 13.274 token al secondo, un fattore di 6,87, con il supporto di contesti molto lunghi.

La metodologia vuole essere generica: su un altro modello il throughput in ingresso passa da 14.546 a 22.584 token al secondo. Già con la sola fase di co-adaptazione diversi modelli guadagnano tra il 20% e il 33% di throughput.

Un operatore terzo

METASTONE si presenta come operatore di calcolo end-to-end indipendente, non legato a un fornitore di modelli. L'azienda dichiara di gestire più di 20.000 petaflops di risorse, di utilizzare una decina di centri di calcolo intelligenti e due centri nazionali di supercalcolo, con un impegno di disponibilità superiore al 99,95%. Il suo team rivendica tre premi Gordon Bell.

Quando l'hardware è vincolato, l'ottimizzazione software diventa la leva principale delle prestazioni.

Commenti 0

Fonti

2
  1. 01量子位 (QbitAI) : PCIe 显卡被低估了 — DeepSeek 推理吞吐翻近 7 倍ZH
  2. 02量子位 (QbitAI) : page d'accueil de la rédactionZH

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Chiara Romano

Chiara Romano

IA, modelli e tecnologie

Chiara Romano scrive di tecnologia, IA e modelli, media e internet per FLASH24, partendo da documentazione tecnica, repository e specifiche invece che da comunicati stampa. Per ogni modello o piattaforma che segue controlla versioni, licenze, parametri e benchmark, e verifica i numeri confrontandoli con i dati originali o con test indipendenti. Confronta le schede tecniche tra fornitori, parla con sviluppatori e amministratori di sistema, e tiene d'occhio le finestre di rilascio e le modifiche ai termini d'uso. Fuori dalla redazione gestisce self-hosting e reti domestiche, esperienza che le serve per capire come funzionano davvero i servizi che racconta. Non pubblica una notizia se la fonte primaria non è verificabile.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.