Mellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0 InfiniBand Switch in pratica
July 15, 2026
Mellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0 Switch InfiniBand in pratica | Ottimizzazione dell'interconnessione a bassa latenza per cluster RDMA/HPC/AI
Contesto e sfide: quando la scala del cluster incontra i colli di bottiglia dell'interconnessione
La divisione di ricerca sull'intelligenza artificiale di un'importante società Internet si è trovata a un bivio familiare. La loro crescente flotta di server GPU, distribuiti su più rack e sempre più utilizzati per l'addestramento di modelli linguistici di grandi dimensioni, soffriva di tempi di completamento dei lavori imprevedibili. La struttura esistente basata su Ethernet, sebbene adeguata per carichi di lavoro generici, non era in grado di gestire i modelli di traffico sincronizzati e a raffica della formazione distribuita. Le operazioni di riduzione totale si bloccavano regolarmente a causa della perdita di pacchetti e della congestione del cast, spingendo i cicli di addestramento da giorni a settimane. Il team dell'infrastruttura aveva bisogno di un cambiamento fondamentale nel modo in cui la rete backend gestiva il traffico RDMA e ne aveva bisogno senza rivedere l'intera architettura del data center.
Progettazione della soluzione: distribuzione dello switch InfiniBand 920-9B210-00FN-0D0 OPN
Dopo aver valutato diverse opzioni di interconnessione, il team ha selezionato laMellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0come pietra angolare del loro nuovo tessuto back-end. L'implementazione era incentrata su una topologia leaf-spine a due livelli, con ogni switch leaf che collegava fino a 40 nodi GPU tramite collegamenti da 400 Gb/s. IL920-9B210-00FN-0D0 MQM9790-NS2F NDR da 400 Gb/sLa variante è stata scelta specificatamente per la sua architettura non bloccante e per le capacità di elaborazione in rete SHARPv3 integrate. Ciò ha consentito al team di scaricare le operazioni di comunicazione collettiva direttamente sullo switch fabric, riducendo il sovraccarico della CPU e liberando i cicli della GPU per il calcolo effettivo.
In termini di implementazione fisica, gli switch sono stati installati con un flusso d'aria dalla parte anteriore a quella posteriore per adattarsi alla configurazione esistente di corridoio caldo/corridoio freddo. Il team ha sfruttato ilScheda tecnica 920-9B210-00FN-0D0per verificare i requisiti di alimentazione e raffreddamento, garantendo una perfetta integrazione nelle unità di distribuzione dell'alimentazione esistenti. Il cablaggio è stato mantenuto coerente utilizzando i ricetrasmettitori QSFP-DD, con ilCompatibile con 920-9B210-00FN-0D0ottiche convalidate per l'intero budget di collegamento, comprese le connessioni spina-foglia fino a 100 metri.
Approccio alla distribuzione: integrazione passo dopo passo
- Fase 1 – Convalida in laboratorio:Per valutare la latenza e il throughput è stato utilizzato un banco di prova su piccola scala con 8 nodi GPU e due switch. ILNVIDIA Mellanox 920-9B210-00FN-0D0ha dimostrato una latenza di commutazione inferiore a 600 ns, un miglioramento del 60% rispetto alla precedente generazione HDR.
- Fase 2 – Lancio graduale:Il team ha migrato un pod di formazione alla volta, utilizzando Unified Fabric Manager di NVIDIA per monitorare lo stato dei collegamenti e i parametri di congestione in tempo reale. Ciò ha ridotto al minimo le interruzioni dei carichi di lavoro di produzione in corso.
- Fase 3 – Integrazione su vasta scala:Tutti i 18 switch sono stati distribuiti su tre rack, formando una struttura completamente non bloccante con uplink da 400 Gb/s. È stato abilitato il routing adattivo per bilanciare dinamicamente il traffico ed evitare abbonamenti eccessivi durante i picchi di invio dei lavori.
Durante tutta l'implementazione, il team di ingegneri ha fatto riferimento al sistema completoSpecifiche 920-9B210-00FN-0D0per ottimizzare le impostazioni del buffer e i parametri di controllo della congestione. La telemetria avanzata dello switch ha fornito visibilità granulare sul conteggio degli errori per porta e sull'utilizzo dei collegamenti, consentendo una manutenzione proattiva e una pianificazione della capacità.
Risultati misurabili e vantaggi operativi
Entro due settimane dall’implementazione su vasta scala, i miglioramenti erano tangibili. I tempi di completamento della riduzione totale per un processo di formazione standard da 1.024 GPU sono scesi da 12,3 secondi a 7,8 secondi, con una riduzione del 37% del sovraccarico di comunicazione. I tempi di completamento del lavoro per un tipico modello in stile GPT sono migliorati di quasi il 30%, consentendo al team di ricerca di eseguire iterazioni più velocemente ed eseguire più esperimenti a settimana. Il motore SHARPv3 integrato ha scaricato in media il 18% delle operazioni collettive, traducendosi direttamente in un maggiore utilizzo della GPU e un minore consumo energetico per ogni esecuzione di allenamento.
Dal punto di vista operativo, il team IT ha segnalato un minor numero di errori di lavoro legati alla rete e una notevole riduzione del tempo dedicato alla diagnosi dei problemi a livello di collegamento. IL920-9B210-00FN-0D0 Soluzione OPN switch InfiniBandsi è rivelato straordinariamente stabile, con zero interruzioni non pianificate durante il periodo di osservazione di tre mesi. L'interfaccia di gestione unificata ha ridotto la curva di apprendimento del team operativo di rete, che ora poteva gestire l'intera struttura da un unico pannello di controllo.
Considerazioni sui costi e sull'approvvigionamento
Mentre l'iniziale920-9B210-00FN-0D0 prezzoposizionato il passaggio nella fascia premium del mercato, l'analisi del costo totale di proprietà ha raccontato una storia diversa. Riducendo i tempi di completamento dei lavori e migliorando l'utilizzo della GPU, l'organizzazione ha ottenuto una riduzione del 22% dei costi delle istanze cloud per una capacità di elaborazione equivalente. Inoltre, il920-9B210-00FN-0D0 in venditaattraverso più partner di canale hanno consentito gare d'appalto competitive e l'impegno di supporto a lungo termine da parte di NVIDIA Mellanox ha dato fiducia nell'investimento.
Riepilogo e prospettive: un progetto per l'infrastruttura AI di prossima generazione
Lo schieramento delMellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0in questa struttura di ricerca sull’intelligenza artificiale su larga scala funge da architettura di riferimento convincente per le organizzazioni che affrontano sfide di interconnessione simili. La combinazione di velocità NDR da 400 Gb/s, latenza inferiore al microsecondo e capacità di elaborazione in rete risolve i principali punti critici dei cluster HPC e AI basati su RDMA. Gli architetti di rete apprezzeranno la flessibilità di920-9B210-00FN-0D0 Interruttore InfiniBand OPNin varie topologie, mentre i responsabili IT possono fare affidamento su strumenti di gestione robusti e completiScheda tecnica 920-9B210-00FN-0D0per la pianificazione della capacità.
Guardando al futuro, l’organizzazione sta già pianificando di espandere l’infrastruttura per supportare cluster GPU più grandi, inclusa l’integrazione di DPU BlueField-3 per ulteriore offload dello storage e isolamento della sicurezza. ILCompatibile con 920-9B210-00FN-0D0L'ecosistema garantisce che gli aggiornamenti futuri, sia alle schede NIC più recenti che alle tecnologie ottiche, saranno supportati senza problemi. Per qualsiasi azienda che distribuisce carichi di lavoro AI o HPC su larga scala, questo passaggio rappresenta non solo un aggiornamento incrementale, ma un abilitatore fondamentale delle prestazioni su larga scala.

