NVIDIA Mellanox 920-9B210-00FN-0D0 in Pratica: Costruire un Fabric NDR a Bassa Latenza per Modelli MoE da Mille Miliardi di Parametri
August 27, 2026
NVIDIA Mellanox 920-9B210-00FN-0D0 in pratica: costruzione di un tessuto NDR a bassa latenza per modelli MoE a trilioni di parametri
Sfida e sfide: quando il problema della formazione è tutto per tutti
Un'organizzazione leader nella ricerca sull'IA ha recentemente ridotto il suo grande cluster di formazione di modelli di linguaggio da 1.024 a 4.096 GPU NVIDIA H100, con l'ambizioso obiettivo di ridurre il tempo di formazione per un 1.Modello MoE (Mixture of Experts) di 8 trilioni di parametri da mesi a meno di due settimaneTuttavia, durante la convalida iniziale, the team discovered that their existing 200Gb/s HDR network was experiencing severe congestion during the all-to-all communication phase—a characteristic pattern of MoE architectures—causing GPU utilization to plummet from an expected 85% to just 52%, molto al di sotto della soglia necessaria per rispettare il termine di formazione.
L'analisi della rete ha rivelato che la comunicazione collettiva tutti-a-tutti rappresentava oltre il 40% dell'impronta di comunicazione del modello del Ministero dell'Economia.il traffico è diventato sempre più frammentato e frantumatoLa rete HDR esistente, dopo aver attivato i meccanismi di controllo della congestione, ha subito un drammatico aumento della latenza della coda, lasciando una parte significativa delle GPU inattive e in attesa.L'organizzazione aveva urgentemente bisogno di un tessuto di rete in grado di fornire latenza deterministica di sotto-microsegondi, il trasporto senza perdite e la massiccia scalabilità non bloccanteNVIDIA Mellanox 920-9B210-00FN-0D0E' stato progettato proprio per questa sfida.
Soluzione e implementazione: un'architettura Leaf-Spine NDR ottimizzata per il MoE
L'organizzazione ha utilizzato un tessuto a due livelli di foglie-spina dorsale costruito attorno al920-9B210-00FN-0D0 InfiniBand switch OPN. in ogni rack di calcolo, due920-9B210-00FN-0D0 MQM9790-NS2F 400 Gb/s NDRI commutatori sono stati distribuiti allo strato di foglia, fornendo connettività 400Gb/s a 64 server H100 a doppia porta tramite cavi ottici attivi OSFP-OSFP.16 interruttori 920-9B210-00FN-0D0 aggiuntivi interconnessi tutti gli interruttori a foglia, creando un tessuto completamente non bloccante con una larghezza di banda di bisezione aggregata di 51,2 Tb/s.
Il fulcro di questa soluzione è la tecnologia SHARPv3 (Scalable Hierarchical Aggregation and Reduction Protocol) integrata nello switch.la comunicazione tutto-a-tutti è stata scaricata direttamente sul tessuto degli interruttori, con gli switch che eseguono la riduzione e la ridistribuzione dei dati in rete.riducendo drasticamente le spese di comunicazione che avevano afflitto la precedente implementazione HDR. il920-9B210-00FN-0D0 scheda datisottolinea la latenza di taglio inferiore a 100 ns, che è stata convalidata durante la fase di prova del concetto e si è rivelata fondamentale per i severi requisiti di latenza del carico di lavoro del Ministero dell'Economia.
Il920-9B210-00FN-0D0 specifiche- inclusi gli alimentatori a doppia ridondanza e i ventilatori scambiabili a caldo - hanno dato al team la fiducia di raggiungere il loro obiettivo di disponibilità del 99,999%.920-9B210-00FN-0D0 compatibileL'ecosistema comprendeva tutte le ottiche e i cavi OSFP già qualificati, eliminando i ritardi degli appalti e semplificando il calendario di implementazione.
Risultati e benefici misurabili: dal collo di bottiglia al facilitatore
Dopo che il tessuto NDR è stato completamente distribuito e il lavoro di formazione del Ministero dell'Economia è stato ripreso, l'organizzazione ha misurato i miglioramenti trasformativi in più dimensioni:
- Recupero dell' utilizzo della GPU:L'utilizzo medio della GPU è salito dal 52% all'89%, con un utilizzo massimo che ha raggiunto il 94% durante le fasi ad alta intensità di calcolo, un risultato diretto dell'eliminazione degli stallo indotti dalla rete.
- Riduzione della latenza all-to-all:Il tempo richiesto per uno scambio completo all-to-all su 4.096 GPU è sceso da 180ms a meno di 45ms, un miglioramento del 75% che si traduce direttamente in iterazioni di addestramento più veloci.
- Tempo di completamento del lavoro:Il calendario di formazione previsto per il modello 1.8T MoE è stato ridotto da 14 giorni a soli 9 giorni, con un'accelerazione del 36% che ha ridotto significativamente sia il tempo di commercializzazione che i costi di cloud computing.
- Efficienza operativa:Con 64 porte per interruttore, il numero di interruttori spinale richiesti è stato ridotto del 37% rispetto a un progetto HDR a 40 porte, semplificando il cablaggio e riducendo il consumo di energia per rack del 28%.
Dal punto di vista del costo totale di proprietà, il team finanziario dell'organizzazione ha osservato che, mentre920-9B210-00FN-0D0 prezzoInfatti, il costo di rete per GPU è diminuito a causa della maggiore radix e della riduzione del numero di switch layer.combinato con il drammatico miglioramento delle prestazioni, ha reso l'aggiornamento del NDR una chiara vittoria commerciale.920-9B210-00FN-0D0 InfiniBand switch OPN soluzioneintegrato perfettamente con la loro attuale distribuzione NVIDIA UFM, fornendo visibilità centralizzata e avvisi automatici che hanno ridotto i costi operativi del 40%.
Riassunto e prospettive: La Fondazione NDR per i carichi di lavoro del Ministero dell'Energia di nuova generazione
IlNVIDIA Mellanox 920-9B210-00FN-0D0si è rivelata la soluzione di trasformazione di cui questa organizzazione di ricerca sull'IA aveva bisogno per sfruttare il pieno potenziale del suo cluster H100 da 4096 GPU.e SHARPv3 in-network, il passaggio ha permesso loro di scalare da 1.024 a 4.096 GPU senza compromettere le prestazioni o la gestibilità, un'impresa che sarebbe stata impossibile con la loro precedente infrastruttura HDR.
Guardando al futuro, l'organizzazione prevede di espandersi a 8.192 GPU entro i prossimi 18 mesi, sfruttando la920-9B210-00FN-0D0 in venditaPer le organizzazioni che valutano i loro investimenti in reti AI e HPC di prossima generazione,il 920-9B210-00FN-0D0 offre una, una soluzione pronta per la produzione che soddisfa la promessa di ottimizzazione dell'interconnessione RDMA a bassa latenza a esa-scala.

