NVIDIA Mellanox 920-9B210-00FN-0D0 in pratica: costruzione di un tessuto NDR a bassa latenza per cluster AI a trilioni di parametri

August 26, 2026

ultime notizie sull'azienda NVIDIA Mellanox 920-9B210-00FN-0D0 in pratica: costruzione di un tessuto NDR a bassa latenza per cluster AI a trilioni di parametri

NVIDIA Mellanox 920-9B210-00FN-0D0 in pratica: costruzione di un tessuto NDR a bassa latenza per cluster AI a trilioni di parametri

Sfida e sfide: quando l'HDR soddisfa i modelli a trilioni di parametri

Un'organizzazione leader nella ricerca sull'IA ha recentemente ridimensionato il suo cluster di formazione di modelli di linguaggio da 1.024 a 4.096 GPU NVIDIA H100, con l'obiettivo di comprimere il calendario di formazione per un 1.Modello MoE (Mixture of Experts) di 8 trilioni di parametri da mesi a meno di due settimaneTuttavia, durante la convalida iniziale, il team ha osservato una grave congestione nella fase di comunicazione all-to-all sul loro tessuto HDR esistente da 200Gb/s,L'utilizzo delle GPU è sceso dall'85% previsto al 52% – ben al di sotto della soglia richiesta per rispettare l'ambizioso termine di formazione..

L'analisi della rete ha rivelato che le operazioni collettive all-to-all, che sono intrinseche alle architetture MoE,La maggior parte dei collegamenti HDR sono stati saturi e innescare meccanismi di controllo della congestione che ulteriormente amplificato la latenzaL'organizzazione aveva bisogno di un tessuto che potesse fornire deterministica,latenza di sotto-microsegondi su migliaia di endpoint, fornendo al contempo la banda larga per assorbire gli scoppi di traffico senza collasso delle prestazioniQuesta è proprio la sfida che l'Unione deve affrontare.NVIDIA Mellanox 920-9B210-00FN-0D0Il programma è stato progettato per affrontare.

Soluzione e distribuzione: un tessuto NDR da 400 Gb/s per l'IA exascale

L'organizzazione ha utilizzato il920-9B210-00FN-0D0 InfiniBand switch OPN(Ordering Part Number) come base di un nuovo tessuto a doppio livello di spina dorsale a foglie.920-9B210-00FN-0D0 MQM9790-NS2F 400 Gb/s NDRswitch, che forniscono 128 porte di connettività a 400 Gb/s a 64 server H100 a doppia porta per rack tramite cavi ottici attivi OSFP-OSFP.16 interruttori 920-9B210-00FN-0D0 aggiuntivi interconnessi tutti gli interruttori a foglia, creando un albero di grasso non bloccante con larghezza di banda di bisezione completa di 51,2 Tb/s per livello spinale.

Ciò che ha reso questa soluzione particolarmente interessante è stata la tecnologia SHARPv3 (Scalable Hierarchical Aggregation and Reduction Protocol) integrata nello switch.la comunicazione tutto-a-tutti è stata scaricata direttamente sul tessuto degli interruttori, con gli switch che eseguono la riduzione e la ridistribuzione dei dati in rete.riducendo drasticamente le spese di comunicazione che avevano afflitto la precedente implementazione HDR.

Secondo il920-9B210-00FN-0D0 scheda datiIn particolare, l'interruttore fornisce una latenza di taglio inferiore a 100 ns, che è stata convalidata durante la fase di prova di concetto.920-9B210-00FN-0D0 compatibileL'ecosistema comprendeva tutte le ottiche e i cavi OSFP già qualificati, eliminando i ritardi degli appalti.920-9B210-00FN-0D0 specifiche- inclusi gli alimentatori dual-redundant e i ventilatori scambiabili a caldo - hanno dato al team la fiducia di raggiungere il loro obiettivo di disponibilità del 99,999% per il cluster di produzione.

Risultati e benefici misurabili: dal collo di bottiglia al facilitatore

Dopo che l'intero tessuto NDR è stato distribuito e il lavoro di formazione del Ministero dell'Economia è stato ripreso, l'organizzazione ha misurato i miglioramenti trasformativi in più dimensioni:

  • Recupero dell' utilizzo della GPU:L'utilizzo medio della GPU è salito dal 52% all'89%, con un utilizzo massimo che ha raggiunto il 94% durante le fasi ad alta intensità di calcolo, un risultato diretto dell'eliminazione degli stallo indotti dalla rete.
  • Riduzione della latenza all-to-all:Il tempo richiesto per uno scambio completo all-to-all su 4.096 GPU è sceso da 180ms a meno di 45ms, un miglioramento del 75% che si traduce direttamente in iterazioni di addestramento più veloci.
  • Tempo di completamento del lavoro:Il calendario di formazione previsto per il modello 1.8T MoE è stato ridotto da 14 giorni a soli 9 giorni, con un'accelerazione del 36% che ha ridotto significativamente sia il tempo di commercializzazione che i costi di cloud computing.
  • Efficienza operativa:Con 64 porte per interruttore, il numero di interruttori spinale richiesti è stato ridotto del 37% rispetto a un progetto HDR a 40 porte, semplificando il cablaggio e riducendo il consumo di energia per rack del 28%.

Dal punto di vista del costo totale di proprietà, il team finanziario dell'organizzazione ha osservato che, mentre il920-9B210-00FN-0D0 prezzoIn particolare, il costo di rete per GPU è in realtà diminuito a causa dell'aumento del radix e della riduzione del numero di switch layer.combinato con il drammatico miglioramento delle prestazioni, ha reso l'aggiornamento del NDR una chiara vittoria commerciale.920-9B210-00FN-0D0 InfiniBand switch OPN soluzioneintegrato perfettamente con la loro attuale distribuzione NVIDIA UFM, fornendo visibilità centralizzata e avvisi automatici che hanno ridotto i costi operativi del 40%.

Riassunto e prospettive: La Fondazione NDR per l'IA di nuova generazione

IlNVIDIA Mellanox 920-9B210-00FN-0D0si è rivelata la soluzione di trasformazione di cui questa organizzazione di ricerca sull'IA aveva bisogno per sfruttare il pieno potenziale del suo cluster H100 da 4096 GPU.e SHARPv3 in-network, il passaggio ha permesso loro di scalare da 1.024 a 4.096 GPU senza compromettere le prestazioni o la gestibilità, un'impresa che sarebbe stata impossibile con la loro precedente infrastruttura HDR.

Guardando al futuro, l'organizzazione prevede di espandersi a 8.192 GPU entro i prossimi 18 mesi, sfruttando la920-9B210-00FN-0D0 in venditaPer le organizzazioni che valutano i loro investimenti in reti AI e HPC di prossima generazione,il 920-9B210-00FN-0D0 offre una, una soluzione pronta per la produzione che soddisfa la promessa di ottimizzazione dell'interconnessione RDMA a bassa latenza a esa-scala.