NVIDIA Mellanox MQM8790-HS2F InfiniBand Switch White Paper Tecnico
August 21, 2026
NVIDIA Mellanox MQM8790-HS2F InfiniBand Switch Technical White Paper: Ottimizzazione dell'interconnessione a bassa latenza per cluster RDMA/HPC/AI
Questo white paper tecnico è destinato agli architetti di rete, agli ingegneri prevendite e ai responsabili delle operazioni.NVIDIA Mellanox MQM8790-HS2Fswitch HDR InfiniBand da 200 Gb/s, che fornisce una progettazione completa di soluzioni per l'ottimizzazione delle interconnessioni a bassa latenza nel computing ad alte prestazioni (HPC) accelerato da RDMA,e cluster di intelligenza artificiale (IA)Il documento copre la progettazione dell'architettura, le tecnologie chiave, le strategie di implementazione e di scalabilità, il monitoraggio delle operazioni,e valutazione del valore, offrendo un progetto riproducibile per l'infrastruttura di calcolo ad alta intensità di dati di prossima generazione..
1. Analisi del contesto e dei requisiti del progetto
Poiché i parametri del modello AI raggiungono magnitudini su scala triliardaria e le simulazioni HPC richiedono una risoluzione sempre più fine,il tessuto di rete sottostante è passato da componente di supporto a determinante primario delle prestazioniI lavori di formazione distribuiti, ad esempio, possono impiegare dal 40 al 60% del loro tempo di funzionamento in operazioni di comunicazione collettiva se l'interconnessione non presenta caratteristiche di larghezza di banda e di latenza sufficienti.Per i team IT aziendali, ciò si traduce direttamente in tempi di commercializzazione più lunghi per le iniziative di IA e investimenti in GPU sottoutilizzati.
I requisiti chiave individuati attraverso un ampio coinvolgimento dei clienti includono:
- Latenza ultra-bassa e prevedibile:Sub-200ns di commutazione per il traffico MPI e RDMA, con un minimo di jitter.
- Trasmissione non bloccante:Performance di velocità di linea sostenuta in tutti i porti contemporaneamente, eliminando la formazione di hotspot e il degrado della latenza della coda.
- Calcolo in rete:Accelerazione hardware per operazioni collettive (all-reduce, broadcast, barrier) per scaricare le CPU host e ridurre il movimento dei dati.
- Supporto per la topologia scalabile:Capacità di costruire topologie fat-tree, torus o dragonfly+ che spaziano da centinaia a migliaia di nodi senza strati di commutazione eccessivi.
- Gestione semplificata:Monitoraggio unificato del tessuto, scoperta automatizzata della topologia e rilevamento proattivo dei guasti per ridurre i costi operativi.
IlMQM8790-HS2FL'architettura di questa soluzione è stata selezionata come il pilastro ottimale, con la suafoglio dati MQM8790-HS2Fconfermando 40 porte di HDR a 200 Gb/s, latenza di taglio inferiore a 130 ns e supporto per le capacità di calcolo in rete SHARP v3.0 che si mappano direttamente ai requisiti di cui sopra.
2. Progettazione complessiva dell'architettura di rete / sistema
L'architettura proposta impiega una topologia a due livelli di legno-spina dorsale-albero grasso per cluster fino a 1.200 nodi, con la possibilità di estendersi a tre livelli per distribuzioni più grandi.Questa topologia bilancia le prestazioni, costi e gestibilità, fornendo larghezza di banda di bisezione completa e latenza deterministica su tutto il tessuto.
| Livello | Tipo di dispositivo | Numero di porti (utilizzati) | Ruolo della connettività |
|---|---|---|---|
| Foglia | MQM8790-HS2F | 32 x 200Gb/s (16 per i nodi, 16 per le spine) | Aggregati calcolano il traffico dei nodi |
| Colonna vertebrale | MQM8790-HS2F | 40 x 200Gb/s (tutti agli interruttori a foglia) | Collegamento incrociato non bloccante tra foglie |
Ogni leaf switch connette fino a 16 nodi di calcolo tramite gli adattatori di canale host NVIDIA ConnectX-6 o ConnectX-7 HDR, utilizzando ilMQM8790-HS2F compatibileL'ecosistema ottico comprende sia i cavi ottici attivi (AOC) che i DAC in rame passivo, a seconda della distanza di collegamento.MQM8790-HS2F 200Gb/s HDR 40 porte QSFP56Il design fornisce una grande densità per l'aggregazione a livello di rack mantenendo un fattore di forma 1U per un utilizzo efficiente dello spazio di rack.
Per i cluster superiori a 1.200 nodi, si raccomanda una topologia a tre livelli con un ulteriore strato super-spina dorsale.MQM8790-HS2F Soluzione di interruttore InfiniBandmantiene il suo ruolo in tutti i livelli, semplificando la gestione della conservazione e della configurazione.
3. Ruolo e caratteristiche chiave del NVIDIA Mellanox MQM8790-HS2F
IlNVIDIA Mellanox MQM8790-HS2Fserve come elemento di commutazione fondamentale in questa architettura, fornendo le seguenti capacità differenzianti che guidano direttamente l'ottimizzazione delle interconnessioni a bassa latenza:
- velocità della porta HDR 200 Gb/s:raddoppia la larghezza di banda dell'EDR di generazione precedente (100Gb/s) mantenendo la compatibilità con HDR100 (100Gb/s) per ambienti a velocità mista, proteggendo gli investimenti precedenti.
- Commutazione cut-through con latenza inferiore a 130ns:Minimizza il tempo trascorso dai pacchetti all'interno dello switch, fondamentale per le operazioni RDMA sensibili alla latenza e i modelli di comunicazione collettiva.
- SHARP v3.0 in-network computing:Offloads le operazioni di riduzione dalle CPU host al tessuto di switch, riducendo il traffico dati fino al 30% e accelerando le prestazioni all-reduce per l'addestramento dell'IA fino a 2 volte.
- Routing e controllo della congestione adattivo:Distribuisce in modo dinamico il traffico su più percorsi per evitare i punti critici, con segnali di congestione e controllo del flusso basato sul credito che garantisce un funzionamento senza perdite, un prerequisito per le prestazioni RDMA.
- Telemetria e diagnostica integrate:Fornisce visibilità granulare sull'occupazione del buffer per porta, sui tassi di errore del collegamento e sui modelli di traffico, consentendo un'ottimizzazione proattiva e un rapido isolamento dei guasti.
Secondo i dettagliLe specifiche MQM8790-HS2F, l'interruttore supporta sia le varianti di flusso d'aria in avanti che in indietro, accogliendo diversi modelli di raffreddamento del data center.Le sue doppie sorgenti di alimentazione ridondanti e i moduli dei ventilatori intercambiabili a caldo migliorano ulteriormente l'affidabilità e la manutenzione.
4. Raccomandazioni di distribuzione ed espansione (con topologia tipica)
Per una distribuzione iniziale equilibrata ed economica, si raccomandano le seguenti migliori pratiche:
- Connettività nodo-foglia:Utilizzare cavi HDR da 200 Gb/s (copper DAC per ≤3m, AOC per ≤30m) con laMQM8790-HS2F compatibileAssicurarsi che gli adattatori del canale host siano configurati per la stessa velocità di collegamento e impostazioni FEC delle porte di commutazione.
- Connettività foglia-spina dorsale:L'impiego di AOC a 200 Gb/s o di trasmettitori multimodali in fibra ottica per distanze fino a 100 m.MQM8790-HS2FNegozia automaticamente i parametri del collegamento, semplificando la distribuzione.
- Pianificazione della sovrascrizione:Per i carichi di lavoro AI / HPC di uso generale, un rapporto di sovra-sottoscrizione di 2: 1 (due nodi di calcolo per 200Gb / s uplink) fornisce un punto dolce di costi e prestazioni.considerando 11 (piena) sovrascrizione.
- Percorso di espansione:Quando si aggiungono nuovi rack, è sufficiente distribuire ulteriori interruttori a foglia e collegarli agli interruttori di spina dorsale esistenti.aggiornare lo strato della colonna vertebrale a una radice più alta o aggiungere un livello super-colonna vertebrale.
Nel valutare laMQM8790-HS2F prezzoe costo totale di proprietà,Considerare che l'architettura unificata utilizzando lo stesso tipo di interruttore in tutti i livelli di tessuto riduce i requisiti di inventario di ricambi di circa il 70% rispetto agli approcci multi-SKUQuesta semplificazione accelera la risposta agli incidenti e riduce al minimo i tempi di inattività durante i guasti hardware.
5. Monitoraggio delle operazioni, risoluzione dei problemi e ottimizzazione
Gestione efficace di unMQM8790-HS2F InfiniBand switchL'ambiente richiede un approccio sistematico al monitoraggio, alla diagnosi e alla regolazione delle prestazioni.
Monitoraggio delle migliori pratiche:
- Implementare l'Unified Fabric Manager (UFM) di NVIDIA per una visibilità centralizzata del tessuto, incluse mappe topologiche, heatmap di utilizzo per collegamento e istogrammi di latenza in tempo reale.
- Monitorare i contatori di errori per porta, in particolare gli errori CRC, gli errori di simbolo e gli eventi di disconnessione, per individuare in anticipo le ottiche o i cavi degradanti.Impostare trappole SNMP per soglie predefinite per consentire la manutenzione proattiva.
- Monitorare l'efficienza dell'operatività collettiva SHARP attraverso i contatori di prestazioni integrati dell'interruttore, identificando opportunità per ottimizzare i modelli di comunicazione collettiva a livello di applicazione.
Risoluzione di problemi comuni:
- Errori di collegamento CRC su porte specifiche:Verificare la posizione del cavo e la pulizia dei connettori ottici.foglio dati MQM8790-HS2Ffornisce soglie diagnostiche dettagliate per porto.
- Spike di latenza inaspettati:Controllare gli hotspot di congestione utilizzando l'analisi del flusso di traffico di UFM.non minime).
- Problemi di partizione del tessuto:Assicurare la corretta chiave di partizione (PKey) e la configurazione del subnet manager IPoIB.ma possono essere necessarie regolazioni manuali per ambienti multi-tenant.
Suggerimenti per ottimizzare le prestazioni:
- Per i carichi di lavoro di addestramento dell'IA, abilitare SHARP v3.0 e configurare le librerie di comunicazione collettiva (NCCL, OpenMPI) per utilizzare le funzionalità di offload dello switch.Questo può ridurre la latenza all-reduce fino a 2x per le grandi dimensioni del messaggio.
- Per le applicazioni HPC sensibili alla latenza, considerare la disabilitazione del routing adattivo per far rispettare la selezione del percorso deterministico, scambiando una certa diversità di percorso per una latenza prevedibile.
- Revisare e aggiornare periodicamente il firmware degli switch, poiché NVIDIA rilascia regolarmente miglioramenti delle prestazioni e patch di sicurezza.foglio dati MQM8790-HS2Fper le matrici di compatibilità delle versioni.
6. Riassunto e valutazione del valore
IlNVIDIA Mellanox MQM8790-HS2Foffre una proposta di valore convincente per le organizzazioni che costruiscono o aggiornano cluster RDMA/HPC/AI.e accelerazione di calcolo in rete entro 1U, il commutatore soddisfa i più severi requisiti di interconnessione dei moderni carichi di lavoro ad alta intensità di dati.
I principali fattori di valore includono:
- Scalabilità delle prestazioni:L'architettura non-bloccante dell'albero di grasso costruita intornoMQM8790-HS2F 200Gb/s HDR 40 porte QSFP56i nodi sono scalati da 200 a 10.000+ nodi senza modifiche di topologia fondamentali.
- Efficienza operativa:Un singolo tipo di interruttore su tutti i livelli di tessuto riduce l'inventario di ricambi, semplifica l'addestramento e accelera la risoluzione dei problemi.
- Protezione degli investimenti:La retrocompatibilità con HDR100 e EDR consente aggiornamenti graduali, mentre il fattore di forma e la densità delle porte dello switch si allineano alle future roadmap 400G (NDR).
- Ecosistema comprovato:L'integrazione profonda con gli adattatori ConnectX di NVIDIA, le DPU BlueField e la piattaforma di gestione UFM garantisce una prevedibilità delle prestazioni end-to-end.
Per le organizzazioni pronte a implementare, ilMQM8790-HS2F in venditaattraverso la rete globale di distributori autorizzati di NVIDIA include opzioni di supporto complete, tra cui ricambi in loco, sostituzione avanzata e abbonamenti di aggiornamento del firmware.Le specifiche MQM8790-HS2Fe progetti di riferimento sono disponibili tramite il portale di documentazione tecnica di NVIDIA, e la consulenza topologica personalizzata è offerta per le implementazioni in campo verde o in campo verde su larga scala.

