Bitget App
Trade smarter
Acquista CryptoMercatiTradingPerpsEarnAIPlazaAltro
Guo Mingchi: Nvidia riavvia il progetto del chip Rubin CPX per ottimizzare il pre-caricamento dell'inferenza

Guo Mingchi: Nvidia riavvia il progetto del chip Rubin CPX per ottimizzare il pre-caricamento dell'inferenza

华尔街见闻华尔街见闻2026/09/01 11:01
Mostra l'originale
Per:华尔街见闻

Un noto analista, Ming-Chi Kuo, ha condotto un'indagine che mostra che Nvidia sta rilanciando il chip di inferenza AI prefill “Rubin CPX”, prevedendo la produzione di massa all'inizio del 2027. La nuova versione utilizza una memoria HBM4 da 168 GB, un consumo energetico di 2300 watt e una potenza computazionale vicina al Rubin GPU standard. Il chip adotta un design modulare indipendente per il rack e una connessione a livelli stratificati; sarà distribuito in modo coordinato con Rubin GPU con un rapporto 1:1, specializzandosi nel prefill e nella generazione di KV Cache, al fine di ridurre i costi di inferenza per contesti lunghi.

Nvidia ha silenziosamente riavviato un progetto di chip che il mercato pensava fosse stato abbandonato, puntando direttamente alla fase di prefill dell'inferenza AI, notoriamente costosa.

Secondo una recente indagine di mercato dell’analista rinomato Ming-Chi Kuo, Nvidia ha riavviato il progetto GPU “Rubin CPX” per l'accelerazione del prefill nell’inferenza AI, apportando significative modifiche al design del prodotto. Secondo la pianificazione attuale, la nuova versione di Rubin CPX dovrebbe entrare in produzione nel primo trimestre del 2027.

La ripresa di questo progetto lancia un chiaro segnale: Nvidia sta intensificando gli sforzi per risolvere i colli di bottiglia di prestazioni e costi della fase di prefill nell’inferenza AI. Con l’aumento costante della lunghezza del contesto nei modelli di grandi dimensioni, la fase di prefill deve elaborare un enorme volume di dati in input e generare la KV Cache, la cui efficienza impatta direttamente sul costo complessivo e sulla convenienza del deployment dell’inferenza AI.

Ming-Chi Kuo afferma che oltre il 50% del carico di lavoro nell’inferenza AI attualmente proviene dall’elaborazione del contesto in input e dalla costruzione della KV Cache.

Specifiche del chip ampiamente riviste, potenza di calcolo vicina al Rubin standard

Le specifiche chiave della nuova Rubin CPX sono sostanzialmente cambiate rispetto al piano precedente.

In termini di potenza di calcolo e consumo energetico, le prestazioni della nuova CPX raggiungono quasi la GPU Rubin standard, con un consumo massimo per scheda di 2300 watt. Per quanto riguarda la memoria, la nuova CPX utilizza memoria video HBM4 da 168GB, un netto aggiornamento rispetto ai 128GB GDDR7 precedenti, anche se resta inferiore ai 288GB HBM4 della GPU Rubin standard.

Secondo Kuo, la capacità totale HBM4 di un vassoio di calcolo CPX a 8 schede è di circa 1,34TB, sufficiente a coprire la maggior parte dei carichi di lavoro prefill con contesti lunghi e le relative esigenze di KV Cache. Ciò significa che Rubin CPX non è progettata semplicemente per puntare a una potenza di calcolo più elevata, ma è stata ripensata in termini di capacità di memoria video ed efficienza del prefill per gli scenari con contesti estesi.

Da rack condiviso a deployment indipendente, configurazione più flessibile

Anche l’architettura dei rack è stata un punto chiave di questa revisione.

Nel progetto iniziale, la CPX doveva condividere il rack con la GPU Rubin; nella nuova versione, invece, si utilizza un rack MGX ETL indipendente, permettendo ai clienti di espandere la potenza di calcolo CPX in modo autonomo in base alle reali necessità.

Nel dettaglio, i clienti possono scegliere una scala di deployment da 64, 128, 192 o 256 GPU CPX. Ogni 64 GPU CPX costituiscono un modulo rack, composto da 8 vassoi di calcolo ciascuno equipaggiato con 8 GPU CPX e un vassoio switch.

Il design modulare significa che i clienti non sono vincolati all’acquisto di grandi rack Rubin fissi, ma possono aggiungere flessibilmente la potenza di calcolo CPX in base alle effettive esigenze del carico di lavoro prefill.

Design di interconnessione a livelli, riduzione dei costi di deployment del prefill

Per quanto riguarda l’architettura di interconnessione, Rubin CPX adotta un design a livelli, bilanciando prestazioni e costi.

All’interno di un singolo vassoio di calcolo, le 8 GPU CPX sono collegate tramite NVLink per un’estensione Scale-up. Ogni GPU CPX ha una banda NVLink di 1-1,5TB/s, inferiore ai 3,6TB/s della GPU Rubin standard.

A livello di connessione tra vassoi e all’interno del modulo rack (Scale-out), CPX utilizza link Spectrum-6 Ethernet full rame L1; per la connessione tra moduli rack, invece, l’interconnessione avviene tramite lo switch Spectrum-6 di ciascun modulo e cavi ottici OSFP.

Rispetto a soluzioni che fanno affidamento esclusivamente su interconnessioni GPU ad alta banda, questa architettura a livelli punta più sull’ottimizzazione dei costi per gli scenari di prefill.

Collaborazione con Rubin GPU, targeting su inferenza a lungo contesto

Rubin CPX non è una GPU general purpose indipendente, ma funge da acceleratore di prefill abbinato al Vera Rubin NVL72.

Secondo Kuo, Nvidia raccomanda un deployment CPX e Rubin GPU in rapporto 1:1: CPX è responsabile del calcolo della fase di prefill e della generazione della KV Cache, che poi viene trasferita via Ethernet RDMA alla GPU Rubin, incaricata della decodifica successiva.

Dal punto di vista del posizionamento del prodotto, il nocciolo di Rubin CPX non è sostituire la GPU Rubin standard, ma scomporre ulteriormente il processo di inferenza AI, affidando a GPU diverse i compiti di prefill e decodifica.

Kuo la definisce “la soluzione con il miglior rapporto prezzo/prestazioni per il prefill di contesti lunghi”. Con l’espansione continua delle finestre di contesto dei modelli AI, la quantità di calcolo e la scala della KV Cache nella fase di prefill crescono di conseguenza. La riattivazione del progetto CPX da parte di Nvidia potrebbe proprio puntare, tramite hardware dedicato e modalità di deployment eterogenee, a ridurre ulteriormente i costi dell’inferenza con contesti estesi.

0
0

Esclusione di responsabilità: il contenuto di questo articolo riflette esclusivamente l’opinione dell’autore e non rappresenta in alcun modo la piattaforma. Questo articolo non deve essere utilizzato come riferimento per prendere decisioni di investimento.

PoolX: Blocca per guadagnare
Almeno il 12% di APR. Sempre disponibile, ottieni sempre un airdrop.
Blocca ora!

Ti potrebbe interessare anche

Anthropic lancia Fable 5.1: prezzi ridotti fino al 75%, capacità di programmazione e ricerca potenziate

La principale novità di Fable 5.1 è la drastica riduzione del 75% delle tariffe per il "cache hit", che secondo l'azienda comporterà una significativa diminuzione dei costi complessivi. Oltre al ribasso dei prezzi, il nuovo modello è stato ottimizzato per completare gli stessi compiti con un numero inferiore di token. È stata inoltre introdotta la possibilità di conservare i dati sul cloud privato del cliente, per rispondere alle esigenze di clientela aziendale con requisiti rigorosi in materia di sovranità dei dati.

华尔街见闻2026/09/01 19:16

Besant incontra il governatore della Banca del Giappone: forti segnali di supporto degli Stati Uniti per un rafforzamento dello yen, sottolineando la necessità di evitare oscillazioni eccessive dei tassi di cambio.

Secondo il verbale dell'incontro pubblicato dal Dipartimento del Tesoro degli Stati Uniti, durante l’incontro con Kazuo Ueda domenica scorsa, la Segretaria al Tesoro USA, Yellen, ha "espresso un forte sostegno alle misure decisive adottate dal Giappone in materia di politica monetaria e di mercato, al fine di affrontare il problema dello yen chiaramente sottovalutato", sottolineando che l’indebolimento dello yen sta aumentando le pressioni inflazionistiche interne in Giappone. Secondo i media giapponesi, funzionari statunitensi hanno dichiarato che durante l’incontro, Yellen ha esortato il Giappone a ulteriori aumenti dei tassi d’interesse. Il mercato prevede ormai quasi al 100% una probabile rialzo dei tassi da parte della Banca del Giappone a settembre.

华尔街见闻2026/09/01 18:31