Mellanox (NVIDIA Mellanox) MQM9790-NS2F InfiniBand Switch in azione ¢ Ottimizzazione dell'interconnessione a bassa latenza per RDMA/HPC
July 13, 2026
Mellanox (NVIDIA Mellanox) MQM9790-NS2F Switch InfiniBand in azione – Ottimizzazione dell'interconnessione a bassa latenza per cluster RDMA/HPC/AI
Poiché i cluster di addestramento dell’intelligenza artificiale si espandono da migliaia a decine di migliaia di GPU, la latenza di rete e il controllo della congestione diventano fattori decisivi per un utilizzo efficace del calcolo. Un'organizzazione leader mondiale nella ricerca sull'intelligenza artificiale ha recentemente implementato ilMellanox (NVIDIA Mellanox) MQM9790-NS2Fpassare a sostenere la sua struttura di supercalcolo di prossima generazione, supportando modelli linguistici su larga scala, simulazioni di dinamica molecolare e apprendimento profondo distribuito. Questo articolo esamina l'implementazione nel mondo reale, descrivendo in dettaglio come questo switch InfiniBand trasforma il trasporto RDMA, la comunicazione HPC e i tessuti di addestramento parallelo dei dati AI.
Contesto e sfide: dal compromesso Ethernet all'imperativo dell'interconnessione senza perdite
Inizialmente l'organizzazione si affidava a una struttura Ethernet da 100 GbE con RoCEv2. Tuttavia, quando i loro nodi GPU sono cresciuti fino a raggiungere oltre 1.200 server (ciascuno con 8 GPU NVIDIA H100), hanno riscontrato blocchi persistenti del PFC, complesse regolazioni ECN e perdite occasionali di pacchetti che hanno causato blocchi dell'addestramento. Questi problemi prolungavano i tempi medi di completamento dei lavori di oltre il 35% e richiedevano un notevole impegno tecnico nella risoluzione dei problemi di rete. L’infrastruttura esistente non era più in grado di fornire la latenza deterministica a livello di microsecondi e il throughput privo di congestione necessari per massicce operazioni collettive all-reduce e all-to-all.
Soluzione e distribuzione: ilInterruttore InfiniBand MQM9790-NS2Fcome la spina dorsale del tessuto
Dopo aver valutato più alternative, il team ha selezionato laNVIDIA Mellanox MQM9790-NS2Fcome elemento fondamentale per una nuova architettura a due livelli foglia-spina. Ogni rastrelliera per foglie è dotata di dueMQM9790-NS2F OSFP NDR a 64 porte da 400 Gb/sswitch, fornendo 64 porte OSFP per unità e una capacità di commutazione totale di 25,6 Tb/s. La velocità NDR di 400 Gb/s per porta, combinata con lo switching cut-through e il routing adattivo, consente una latenza da porta a porta inferiore a 600 ns, un requisito fondamentale per i carichi di lavoro ad uso intensivo di GPU. La distribuzione ha sfruttato ilSoluzione switch InfiniBand MQM9790-NS2Fintegrato con il firmware NVIDIA Quantum‑2, garantendo continuitàCompatibile con MQM9790-NS2Ffunzionamento con gli adattatori ConnectX‑7 e le DPU BlueField‑3 esistenti.
Le scelte chiave di distribuzione includevano:
- Topologia:Fat‑tree non bloccante con ricetrasmettitori ottici OSFP a 400G a 64 porte, che consentono una larghezza di banda a bisezione completa per tutti i nodi GPU.
- Gestione:NVIDIA UFM (Unified Fabric Manager) per telemetria in tempo reale, rilevamento di congestioni e reinstradamento proattivo del percorso.
- Scarico collettivo:SHARPv3 ha consentito di accelerare le operazioni di riduzione totale, scaricando la comunicazione dalle CPU host.
Per garantire una transizione graduale, il team ha consultato ilScheda tecnica MQM9790-NS2FESpecifiche MQM9790-NS2Fper convalidare i requisiti di alimentazione e cablaggio. Il fattore di forma 1U e gli alimentatori ridondanti si adattano perfettamente alla densità del rack esistente e le porte OSFP supportano sia cavi DAC che moduli ottici, offrendo flessibilità per espansioni future.
Risultati e benefici misurati – Guadagni quantificabili in termini di prestazioni ed efficienza
Dopo l'implementazione e l'ottimizzazione complete, l'organizzazione ha documentato miglioramenti significativi su più dimensioni:
| Metrico | Prima (RoCEv2) | Dopo (MQM9790-NS2F) |
|---|---|---|
| Latenza media di riduzione totale (1 GB) | ~18 μs | < 8 µs |
| Latenza della coda (99,9% ile) | > 150 μs | < 15 µs |
| Utilizzo efficace della GPU | ~72% | ~91% |
| Tempo di completamento del lavoro (medio) | Linea di base | ‑28% (1,4 volte più veloce) |
Al di là dei numeri grezzi, il team ha segnalato interruzioni legate alla congestione vicine allo zero, semplificando notevolmente le operazioni di rete. La telemetria integrata e il routing adattivo diNVIDIA Mellanox MQM9790-NS2Fha consentito il bilanciamento automatico del carico su tutte le 64 porte OSFP, eliminando la regolazione manuale dell'ECN. Inoltre, ilInterruttore InfiniBand MQM9790-NS2Ffornivano prestazioni deterministiche anche con un utilizzo del collegamento inferiore al 95%, un'impresa impossibile con la precedente configurazione Ethernet.
L'organizzazione ha inoltre osservato chePrezzo MQM9790-NS2F, se ammortizzato nel corso del ciclo di vita di 5 anni, è stato compensato da un ridotto consumo energetico per porta (≈1,5 W per porta 400G) e da minori costi di cablaggio dovuti alla maggiore densità di porte. Con la disponibilità generale ormai matura, lo hanno confermatoMQM9790-NS2F in venditaattraverso canali autorizzati hanno reso l'approvvigionamento semplice e ilScheda tecnica MQM9790-NS2Ffornito tutti i dettagli necessari sull'installazione e sulla conformità.
Riepilogo e prospettive: un progetto per le infrastrutture IA di nuova generazione
L'adozione delMellanox (NVIDIA Mellanox) MQM9790-NS2Fin questo cluster HPC/AI su larga scala dimostra che un tessuto InfiniBand appositamente costruito non è più un lusso ma una necessità per le organizzazioni che spingono i confini dell'intelligenza artificiale e dell'informatica scientifica. Offrendo una latenza inferiore al microsecondo, un trasporto RDMA senza perdite e un'accelerazione informatica in rete, ilMQM9790-NS2F OSFP NDR a 64 porte da 400 Gb/sLo switch consente ai data center di raggiungere una scalabilità quasi lineare fino a decine di migliaia di GPU.
Guardando al futuro, il team prevede di espandere il tessuto con ulteriori contenutiInterruttore InfiniBand MQM9790-NS2Funità per supportare i futuri carichi di lavoro di classe exascale, tra cui la modellazione climatica e la genomica. ILCompatibile con MQM9790-NS2FL'ecosistema con le future generazioni NVIDIA garantisce la protezione degli investimenti. Per architetti e responsabili IT che valutano aggiornamenti simili, questo caso reale conferma cheSoluzione switch InfiniBand MQM9790-NS2Foffre un percorso collaudato ed economicamente vantaggioso verso reti di cluster ad alte prestazioni e a bassa latenza: un fattore abilitante fondamentale per il prossimo decennio di innovazione dell'intelligenza artificiale.

