NVIDIA Mellanox MCX631432AN-ADAB in Azione: Trasporto RDMA/RoCE a Bassa Latenza e Ottimizzazione del Throughput del Server
July 28, 2026
NVIDIA Mellanox MCX631432AN-ADAB in azione: RDMA/RoCE Trasporto a bassa latenza e ottimizzazione del throughput del server
Sfondo e sfide: il collo di bottiglia della rete in un cluster di formazione sull'IA
Un'azienda fintech leader ha recentemente implementato un cluster di IA basato su GPU a 64 nodi progettato per l'addestramento della strategia di trading ad alta frequenza, con ogni server dotato di storage NVMe ad alte prestazioni.,Dopo l'entrata in funzione, il volume effettivo di formazione è diminuito significativamente al di sotto delle aspettative.L'analisi post-implementazione ha rivelato che il tessuto di comunicazione inter-nodo basato su TCP/IP 10GbE era diventato il principale collo di bottigliaLe operazioni di comunicazione collettiva All-Reduce hanno mostrato una latenza fino a 4-5 millisecondi.mentre il sovraccarico della CPU per l'elaborazione del protocollo di rete ha superato il 40% Il team aveva urgentemente bisogno di una soluzione di rete che potesse ridurre drasticamente la latenza della comunicazione e recuperare la capacità di calcolo della CPU.
Soluzione e implementazione: costruzione di una rete RoCE senza perdite con MCX631432AN-ADAB
Dopo un'ampia valutazione tecnica, il team ha selezionatoNVIDIA Mellanox MCX631432AN-ADABOgni server è stato dotato di unMCX631432AN-ADAB ConnectX-6 Lx a doppia porta 25GbE SFP28Adapter, con entrambe le porte SFP28 collegate a switch NVIDIA Spectrum-3 ridondanti per stabilire un'architettura altamente disponibile.
La distribuzione è stata eseguita in tre fasi distinte:
- Fase 1 ¢ pilota (8 nodi):Il team ha installato ilMCX631432AN-ADAB scheda di adattatore Ethernetsu un sottoinsieme di server GPU, configurando RoCEv2 con Priority Flow Control (PFC) e Explicit Congestion Notification (ECN) per creare un tessuto Ethernet senza perdite.NCCL (NVIDIA Collective Communications Library) è stato ricompilato con il supporto RDMA.
- Fase 2 Tuning e convalida:Utilizzando i dati telemetrici dettagliati nelFogli di dati MCX631432AN-ADAB, il team ha perfezionato i parametri DCB e le soglie di buffer per eliminare le tempeste di pausa PFC mantenendo una perdita di pacchetti quasi zero.Specificativi MCX631432AN-ADABha guidato l'ottimizzazione della moderazione delle interruzioni e della profondità delle code per il profilo specifico del carico di lavoro.
- Fase 3 Completo sviluppo della produzione (64 nodi):Dopo una validazione riuscita, i nodi rimanenti sono stati trasferiti al nuovo adattatore.MCX631432AN-ADAB compatibiledriver integrati perfettamente con l'ambiente esistente basato su Ubuntu e lo stack Mellanox OFED.
Il team ha osservato che ilMCX631432AN-ADAB soluzione per schede di adattamento EthernetL'applicazione di un sistema di controllo della velocità di carica è stata applicata in modo da consentire ai sistemi di controllo della velocità di carica di un sistema di controllo della velocità di carica di un sistema di controllo della velocità di carica.
Risultati e benefici: trasformazione misurabile della latenza e del throughput
I miglioramenti delle prestazioni ottenuti attraverso laNVIDIA Mellanox MCX631432AN-ADABLa tabella seguente riassume le metriche chiave prima e dopo l'aggiornamento:
| Metrica | Pre-upgrade (10GbE TCP/IP) | Post-upgrade (MCX631432AN-ADAB con RoCE) | Miglioramento |
|---|---|---|---|
| Ritardo di riduzione totale (in media) | 4.7 ms | 0.32 ms | 14.7× riduzione |
| Utilizzazione della CPU di rete (per nodo) | 42% | 9% | 33 pp liberato |
| Utilizzazione della GPU (fase di caricamento dei dati) | 61% | 89% | +28% |
| Prodotto di formazione in cluster | 1.8x valore di riferimento | 4.3x valore di riferimento | 2.4x aumento |
Oltre a questi guadagni quantitativi, il team ha osservato miglioramenti operativi che hanno avuto un impatto diretto sulla produttività degli sviluppatori.Corse di formazione modello che in precedenza richiedevano 36 ore completate in sole 15 oreL'offload NVMe-oF basato sull'hardware ha anche ridotto la latenza di accesso allo storage del 35%, accelerando ulteriormente le operazioni di checkpoint ad alta intensità di dati.Per le organizzazioni che valutano il business case, ilMCX631432AN-ADAB prezzoIl team ha anche osservato che la capacità di acquisizione di server GPU aggiuntivi è risultata molto competitiva rispetto al guadagno di throughput di 2,4 volte e alla capacità di rinviare l'acquisizione di server GPU aggiuntivi.MCX631432AN-ADAB in venditaI pacchetti con switch NVIDIA Spectrum offrivano il percorso più conveniente per la futura scalabilità.
Riassunto e prospettive: una base per l'innovazione del futuro carico di lavoro
Questo sviluppo della produzione dimostra che laNVIDIA Mellanox MCX631432AN-ADABè molto di più di un aggiornamento di routine della rete, è un elemento di infrastruttura trasformativa che sblocca il pieno potenziale del moderno calcolo accelerato da GPU.La combinazione di 50 Gb/s di larghezza di banda aggregata, latenza di comunicazione collettiva inferiore a 0,4 ms, e capacità drammatiche di scarico della CPU posizionano questo adattatore come una scelta ideale per le organizzazioni che eseguono AI distribuita, HPC,e carichi di lavoro di analisi in tempo reale.
Guardando al futuro, il team fintech sta esplorando l'integrazione con NVIDIA DOCA per accelerare ulteriormente la programmabilità del percorso dei dati e per implementare il provisioning zero-touch per le future espansioni dei cluster.Sono inoltre in fase di valutazione delle capacità di telemetria dell'adattatoreFogli di dati MCX631432AN-ADAB costruire modelli predittivi di gestione della congestione.MCX631432AN-ADAB soluzione per schede di adattamento Ethernetcontinua a dimostrare il suo valore, la società prevede di standardizzare su questa piattaforma per tutti i futuri investimenti infrastrutturali,sono fiduciosi che fornisca una base solida e scalabile per la prossima generazione di applicazioni finanziarie basate sull'IA.

