Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

Come funzionano davvero gli acceleratori AI: core, cluster e memoria

SiFive concede ora in licenza un cluster acceleratore AI già pronto, costruito attorno a quattro core CPU RISC-V e a un motore di calcolo matriciale tutto suo. Lo ha riferito The Register il 19 settembre 2024.

TecnologiaSpiegatoChiara RomanoPubblicato: 27 settembre 20263 min di letturaFonti 5
Come funzionano davvero gli acceleratori AI: core, cluster e memoria

SiFive progetta da anni core CPU RISC-V per i chip AI di altre aziende. Adesso vende un progetto completo di acceleratore. Ogni cluster Intelligence XM mette insieme quattro core CPU RISC-V della serie X e un motore di calcolo matriciale interno, secondo The Register.

È un cambio di rotta. Le tensor processing unit di Google usano già i core X280 di SiFive per alimentare le unità di moltiplicazione matriciale. John Ronco, di SiFive UK, ha detto a The Register che i progetti dell'azienda sono alla base anche dei core CPU nell'acceleratore Blackhole di Tenstorrent. La differenza, ora, è che SiFive porta il proprio motore matriciale invece di agganciare i core a quello di terzi.

Cosa dicono i numeri, e cosa non dicono

Ogni cluster supporta fino a 1TB/sec di larghezza di banda di memoria attraverso un'interfaccia hub coerente. Dovrebbe fornire fino a 16 TOPS di INT8 o 8 teraFLOPS di BF16 per gigahertz. Il riferimento al gigahertz conta, perché un cluster non è un chip. Le prestazioni dipendono da quanti cluster un cliente colloca sul die, da come li collega, da cos'altro gli sta accanto e dalla frequenza finale del componente.

Ronco prevede che la maggior parte dei progetti userà da quattro a otto cluster. A 1GHz significherebbero da 4 a 8TB/sec di larghezza di banda di memoria di picco e da 32 a 64 teraFLOPS di BF16. Le slide di prodotto di SiFive suggeriscono che 512 cluster siano possibili. A 1GHz sarebbero circa quattro petaFLOPS di BF16, sopra i 2.5 petaFLOPS che Nvidia dichiara per le sue GPU Blackwell di vertice. Una Nvidia H100, per confronto, fornisce quasi un petaFLOPS di BF16 denso.

Il problema è la fisica. Tenere 1GHz su 512 cluster senza urtare limiti termici o di potenza è la questione aperta. Ronco non si è sbilanciato su quanto il progetto possa scalare. Si aspetta anche che i cluster non vengano usati largamente per l'addestramento AI. SiFive dice che pubblicherà un'implementazione di riferimento open source della sua SiFive Kernel Library.

La larghezza di banda di memoria è il collo di bottiglia ricorrente

Gli acceleratori sono costruiti così perché l'inferenza, specialmente la fase di decodifica, è limitata dalla memoria. d-Matrix, presentando a Hot Chips 2026, ha messo il problema senza giri di parole: 64 utenti con contesto da 1M possono significare circa 935GB di KV cache. Il suo progetto Raptor impila un die logico TSMC N4 su DRAM 3D, con uno stacking faccia a faccia da 36 micrometri a 32GB per scheda e un rack da 72 schede dimensionato per modelli di frontiera.

Rebellions ha mostrato un approccio diverso a Hot Chips 2025. Il suo REBEL-Quad stipa quattro ASIC di calcolo e quattro siti HBM3E per 144GB di memoria su un package Samsung SF4X e CoWoS-S, e usa UCIe-A come interconnessione chiplet. ServeTheHome l'ha visto eseguire Llama 3.3 70B su una scheda di sviluppo a 35.5 millisecondi di media per token di output.

Fornitori, packaging e la stretta a monte

Niente di tutto questo arriva sul mercato senza materiali di packaging. Tom's Hardware ha riferito a marzo 2026 che Nittobo controlla circa il 90% della fornitura globale di T-glass, il tessuto di vetro a basso CTE usato nei core dei substrati IC. I prezzi sono saliti del 20 al 30%, mentre i tempi di consegna dei laminati rivestiti di rame si sono allungati oltre 20 settimane rispetto alle normali 8-10. Nittobo sta triplicando la capacità nel suo stabilimento di Fukushima, ma la nuova offerta non arriverà sul mercato prima della metà del 2027. Bank of America stima che il segmento dei materiali elettronici quasi raddoppierà le vendite, da 40,9 miliardi di yen nel 2025 a 87,7 miliardi di yen entro marzo 2028.

Il livello politico è altrettanto intricato. TSMC avrebbe tagliato i rapporti con il progettista cinese Sophgo nell'ottobre 2024, dopo che un cliente aveva ordinato un chip simile all'Ascend 910B di Huawei. Sophgo ha negato qualsiasi rapporto con Huawei e ha detto di aver presentato un rapporto di indagine a TSMC.

Commenti 0

Fonti

5
  1. 01SiFive shifts from RISC-V cores for AI chips to designing its own acceleratorEN
  2. 02Shortages of crucial chip packaging material threatens AI accelerator supplyEN
  3. 03d-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN
  4. 04Rebellions REBEL-Quad UCIe and 144GB HBM3E Accelerator at Hot Chips 2025EN
  5. 05TSMC reportedly cuts off RISC-V chip designer linked to Huawei acceleratorsEN

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Chiara Romano

Chiara Romano

IA, modelli e tecnologie

Chiara Romano scrive di tecnologia, IA e modelli, media e internet per FLASH24, partendo da documentazione tecnica, repository e specifiche invece che da comunicati stampa. Per ogni modello o piattaforma che segue controlla versioni, licenze, parametri e benchmark, e verifica i numeri confrontandoli con i dati originali o con test indipendenti. Confronta le schede tecniche tra fornitori, parla con sviluppatori e amministratori di sistema, e tiene d'occhio le finestre di rilascio e le modifiche ai termini d'uso. Fuori dalla redazione gestisce self-hosting e reti domestiche, esperienza che le serve per capire come funzionano davvero i servizi che racconta. Non pubblica una notizia se la fonte primaria non è verificabile.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.