NVIDIA Mellanox 920-9B110-00FH-0D0 in pratica: ottimizzazione dei tessuti RDMA a bassa latenza per cluster HPC e AI
August 25, 2026
NVIDIA Mellanox 920-9B110-00FH-0D0 in Pratica: Ottimizzazione di Fabric RDMA a Bassa Latenza per Cluster HPC e AI
Contesto e Sfida: Quando le Prestazioni HDR Incontrano la Realtà del Budget
Un laboratorio di ricerca AI di medie dimensioni si è recentemente trovato di fronte a una sfida familiare: il loro attuale fabric InfiniBand EDR da 100 Gb/s stava diventando un collo di bottiglia per il loro cluster GPU in espansione, cresciuto da 128 a 512 nodi NVIDIA A100. I tempi di addestramento per modelli transformer su larga scala erano aumentati di oltre il 40% a causa della congestione di rete durante le operazioni all-reduce, e il team necessitava di un aggiornamento in grado di fornire significativi miglioramenti delle prestazioni senza la spesa in conto capitale richiesta per un dispiegamento completo NDR da 400 Gb/s.
Il laboratorio ha valutato diverse opzioni e ha identificato l'HDR da 200 Gb/s come l'equilibrio ideale tra prestazioni e costi. Tuttavia, necessitavano di uno switch in grado di fornire un'elevata densità di porte, un controllo avanzato della congestione e un'integrazione senza interruzioni con i loro attuali cavi e transceiver compatibili con HDR. È qui che è entrato in gioco il NVIDIA Mellanox 920-9B110-00FH-0D0—uno switch progettato appositamente per ambienti in cui l'HDR fornisce una larghezza di banda sufficiente senza sovradimensionamento.
Soluzione e Dispiegamento: Un Fabric HDR Ottimizzato per i Costi
Il laboratorio ha distribuito lo switch InfiniBand 920-9B110-00FH-0D0 (Ordering Part Number) come pietra angolare della loro nuova architettura leaf-spine. Ogni rack di calcolo ha ricevuto uno switch basato su MQM8790-HS2F—la piattaforma siliconica alla base del 920-9B110-00FH-0D0 MQM8790-HS2F 200Gb/s HDR—fornendo 40 porte di connettività a 200 Gb/s ai server GPU tramite cavi direct-attach OSFP-to-OSFP. A livello di spine, quattro switch 920-9B110-00FH-0D0 aggiuntivi hanno interconnesso tutti gli switch leaf, creando un fabric fat-tree non bloccante con larghezza di banda di bisezione completa.
Ciò che ha reso questo dispiegamento particolarmente efficace è stata la tecnologia integrata SHARPv2 (Scalable Hierarchical Aggregation and Reduction Protocol) dello switch, che ha scaricato le operazioni di comunicazione collettiva direttamente sul fabric dello switch. In pratica, ciò significava che le operazioni all-reduce, che in precedenza consumavano cicli significativi della CPU host e larghezza di banda di rete, venivano ora completate in un unico passaggio attraverso il fabric—riducendo drasticamente i tempi di completamento dei job.
Secondo il datasheet del 920-9B110-00FH-0D0, lo switch offre una latenza cut-through inferiore a 200 ns, che si allineava strettamente ai requisiti di prestazioni del laboratorio. Il team di ingegneri ha anche confermato che l'ecosistema compatibile con il 920-9B110-00FH-0D0 includeva tutti i tipi di cavi e ottiche su cui si erano già standardizzati, eliminando la necessità di costosi sforzi di ricablaggio.
Risultati e Guadagni Misurabili: Da Collo di Bottiglia a Abilitatore
Dopo il dispiegamento, il laboratorio ha misurato miglioramenti in diverse dimensioni critiche:
- Riduzione dei tempi di completamento dei job: Le iterazioni di addestramento per un modello da 13 miliardi di parametri sono diminuite del 35%, con la latenza all-reduce scesa da 12 μs a meno di 5 μs per dimensioni collettive tipiche.
- Utilizzo della rete: L'utilizzo medio del fabric è aumentato dal 58% all'83% senza innescare congestione, grazie ai meccanismi di routing adattivo e controllo della congestione dello switch.
- Efficienza energetica e di raffreddamento: Rispetto al precedente fabric EDR, la nuova infrastruttura HDR ha ridotto il consumo energetico per porta del 30%, consentendo al laboratorio di aggiungere più nodi di calcolo senza superare il proprio budget energetico del data center.
Dal punto di vista del costo totale di proprietà, il prezzo del 920-9B110-00FH-0D0 per porta era significativamente inferiore alle alternative NDR, consentendo al laboratorio di aggiornare l'intero fabric entro il proprio budget esistente. Le specifiche del 920-9B110-00FH-0D0 hanno anche evidenziato gli alimentatori dual-redundant dello switch e i moduli ventola hot-swappable, che hanno contribuito all'obiettivo del laboratorio di disponibilità del 99,999% per i loro job di addestramento di produzione.
Gli ingegneri di rete hanno notato che la soluzione switch InfiniBand 920-9B110-00FH-0D0 OPN si integrava perfettamente con NVIDIA Unified Fabric Manager (UFM), fornendo visibilità centralizzata sullo stato del fabric e avvisi automatizzati. Ciò ha ridotto significativamente il tempo dedicato alla risoluzione dei problemi e alla manutenzione proattiva, liberando il team per concentrarsi sull'ottimizzazione delle loro pipeline di addestramento piuttosto che sulla gestione della rete.
Riepilogo e Prospettive: La Fondazione HDR della Giusta Dimensione
Il NVIDIA Mellanox 920-9B110-00FH-0D0 si è rivelato la scelta giusta per questo laboratorio di ricerca, offrendo le prestazioni dell'HDR da 200 Gb/s a una struttura di costi economicamente vantaggiosa. Sfruttando la densità di 40 porte dello switch, le capacità di calcolo in rete e le robuste funzionalità di gestione, il laboratorio ha trasformato la propria rete da un collo di bottiglia prestazionale a una base scalabile per la crescita futura.
Guardando avanti, il laboratorio prevede di espandere il proprio cluster a 1.024 nodi nei prossimi 18 mesi. Con il supporto del 920-9B110-00FH-0D0 per topologie più grandi attraverso più livelli di spine, hanno la certezza che la loro rete possa crescere insieme alla loro capacità di calcolo. Per le organizzazioni che valutano le loro opzioni di infrastruttura HDR, il 920-9B110-00FH-0D0 in vendita tramite i partner di canale NVIDIA offre una soluzione convincente e validata in produzione che bilancia prestazioni, densità e costi.

