NVIDIA Mellanox MQM8790-HS2F InfiniBand Switch in azione: ottimizzazione dell'interconnessione a bassa latenza per cluster RDMA/HPC/AI

August 21, 2026

ultime notizie sull'azienda NVIDIA Mellanox MQM8790-HS2F InfiniBand Switch in azione: ottimizzazione dell'interconnessione a bassa latenza per cluster RDMA/HPC/AI

NVIDIA Mellanox MQM8790-HS2F InfiniBand Switch in Azione: Ottimizzazione dell'Interconnessione a Bassa Latenza per Cluster RDMA/HPC/AI

Nel campo dell'addestramento di modelli AI su larga scala e del calcolo ad alte prestazioni (HPC), la latenza di rete diventa spesso il collo di bottiglia critico che limita la scalabilità e l'efficienza del cluster. Un centro di supercalcolo a livello nazionale ha recentemente completato un importante aggiornamento dell'infrastruttura, passando da un fabric InfiniBand EDR da 100 Gb/s a una soluzione HDR da 200 Gb/s basata sullo switch InfiniBand NVIDIA Mellanox MQM8790-HS2F. Questo studio di caso esamina le sfide affrontate, la strategia di implementazione e i guadagni di prestazioni misurabili ottenuti attraverso questa interconnessione di nuova generazione.

Contesto e Sfide: Quando la Latenza Diventa il Limite delle Prestazioni

Il centro di supercalcolo gestisce un cluster eterogeneo composto da oltre 2.000 nodi GPU, che supporta un mix di carichi di lavoro diversificati tra cui simulazioni meteorologiche, ricerca genomica e addestramento di modelli linguistici di grandi dimensioni. Con la precedente rete EDR da 100 Gb/s, il team operativo ha osservato che le operazioni di comunicazione collettiva — come all-reduce e all-gather — stavano consumando una quota crescente del tempo di esecuzione totale dei job all'aumentare del numero di nodi. In alcuni job di addestramento distribuiti, l'overhead legato alla rete rappresentava quasi il 40% del tempo di esecuzione end-to-end, limitando gravemente l'utilizzo della GPU e prolungando i cicli di convergenza del modello.

Ulteriori sfide includevano:

  • Hotspot di congestione: I pattern di traffico nell'addestramento AI sono spesso a raffica e imprevedibili, portando a blocchi head-of-line e picchi di latenza di coda che interrompevano la pianificazione dei job.
  • Accelerazione insufficiente in rete: Il fabric legacy mancava del supporto per funzionalità avanzate di offload collettivo, costringendo tutte le operazioni di riduzione ad attraversare la CPU host e la gerarchia di memoria.
  • Complessità di gestione: La risoluzione dei problemi di prestazioni richiedeva un'analisi manuale di molteplici strumenti di monitoraggio, rendendo difficile individuare le cause principali in implementazioni su larga scala.

Dopo aver valutato diverse opzioni di interconnessione, il centro ha selezionato il MQM8790-HS2F come base per il suo nuovo fabric. Secondo il datasheet MQM8790-HS2F, questo switch offre 40 porte di throughput non bloccante HDR da 200 Gb/s, latenza cut-through inferiore a 130 ns e supporto per l'offload collettivo SHARP v3.0 — funzionalità che hanno affrontato direttamente i loro principali punti dolenti.

Soluzione e Implementazione: Costruire un Fabric a Bassa Latenza per AI/HPC

L'implementazione ha adottato una topologia fat-tree a due livelli, con 24 switch MQM8790-HS2F 200Gb/s HDR 40-port QSFP56 distribuiti come nodi leaf e 8 unità come switch spine. Questa configurazione ha fornito un oversubscription di 2:1 sull'intero cluster — sufficiente per il loro attuale carico di lavoro, consentendo al contempo margine per espansioni future.

Livello di Implementazione Numero di Switch Porte Utilizzate Connettività
Leaf (per rack) 24 32 porte ciascuna Server ToR + uplink spine
Spine 8 36 porte ciascuna Full mesh a tutti gli switch leaf

Ogni switch leaf si collega ai nodi di calcolo tramite schede host NVIDIA ConnectX-6 HDR. L'ecosistema di ottiche e cavi compatibili con MQM8790-HS2F ha permesso al team di riutilizzare i cavi QSFP56 esistenti, accelerando l'implementazione e riducendo i costi di approvvigionamento. L'intera installazione fisica è stata completata entro due settimane, con il piano di controllo che ha sfruttato l'Unified Fabric Manager (UFM) di NVIDIA per la scoperta automatica della topologia e il provisioning.

Il supporto dello switch per il routing adattivo e il controllo della congestione si è rivelato fondamentale per gestire il traffico a raffica caratteristico dei carichi di lavoro AI. Ridistribuendo dinamicamente i flussi sui percorsi disponibili, lo switch InfiniBand MQM8790-HS2F ha minimizzato la formazione di hotspot e mantenuto prestazioni costanti anche durante i periodi di picco di pianificazione dei job.

Risultati e Guadagni: Miglioramenti Misurabili nel Throughput dei Job e nell'Utilizzo della GPU

Dopo tre mesi di operatività in produzione, il centro di supercalcolo ha riportato significativi miglioramenti delle prestazioni su più dimensioni:

  • Riduzione della latenza: La latenza media MPI ping-pong è diminuita da 680 ns sul precedente fabric EDR a meno di 130 ns con NVIDIA Mellanox MQM8790-HS2F, rappresentando un miglioramento di 5 volte nell'efficienza dello scambio di messaggi.
  • Accelerazione delle operazioni collettive: La latenza di all-reduce per job da 1024 nodi è diminuita del 62%, grazie all'offload SHARP v3.0 che esegue le operazioni di riduzione direttamente all'interno del fabric dello switch.
  • Utilizzo della GPU: L'effetto combinato di latenza inferiore e larghezza di banda maggiore ha spinto l'utilizzo medio della GPU dal 72% al 91%, traducendosi in una riduzione del 26% del tempo per ottenere la soluzione per i cicli di addestramento di modelli linguistici di grandi dimensioni.
  • Efficienza della pianificazione dei job: La ridotta varianza della latenza di coda ha permesso allo scheduler SLURM di inserire più job sullo stesso set di nodi senza interferenze di prestazioni, aumentando il throughput complessivo del cluster di circa il 18%.

Quando il team ha successivamente confrontato il prezzo MQM8790-HS2F con switch alternativi di altri fornitori, ha scoperto che il costo totale per Gb/s erogato era altamente competitivo, soprattutto se si considera la ridotta overhead di gestione e la capacità dello switch di supportare velocità di collegamento sia HDR che HDR100, proteggendo gli investimenti in ambienti a velocità mista.

Da una prospettiva operativa, la piattaforma UFM integrata ha fornito un'unica interfaccia per monitorare lo stato del fabric, i pattern di traffico e gli errori a livello di collegamento. Questa visibilità ha permesso al team di identificare proattivamente cavi degradati e sostituirli durante la manutenzione programmata, evitando tempi di inattività imprevisti.

Riepilogo e Prospettive: Un Modello per Fabric a Bassa Latenza di Nuova Generazione

Questo studio di caso dimostra che la soluzione switch InfiniBand MQM8790-HS2F è più di un semplice aggiornamento di velocità: è un componente trasformativo per le organizzazioni che cercano di sbloccare il pieno potenziale prestazionale della loro infrastruttura AI e HPC. Combinando alta densità di porte, latenza ultra-bassa e capacità di calcolo in rete, lo switch affronta direttamente i colli di bottiglia di comunicazione che storicamente hanno limitato la scalabilità del cluster.

Guardando al futuro, il centro di supercalcolo prevede di espandere il proprio fabric a 2.400 nodi nel prossimo anno fiscale, sfruttando la stessa architettura MQM8790-HS2F con switch spine aggiuntivi. Il team sta anche esplorando il supporto dello switch per gli algoritmi di riduzione migliorati di SHARP v3.0, che promettono di accelerare ulteriormente i carichi di lavoro emergenti come le reti neurali grafiche e l'apprendimento per rinforzo.

Per i responsabili IT, gli architetti di rete e gli ingegneri che valutano opzioni di interconnessione per le proprie costruzioni di cluster, NVIDIA Mellanox MQM8790-HS2F offre un percorso comprovato e validato sul campo per ottenere latenza sub-microsecondo, utilizzo massimo della GPU e gestione semplificata del fabric. Dettagliate specifiche MQM8790-HS2F e progetti di riferimento sono disponibili sul portale di documentazione tecnica di NVIDIA, e lo switch è ora ampiamente disponibile: cerca MQM8790-HS2F in vendita per individuare un partner regionale.