NVIDIA Mellanox MCX653105A-HDAT in Azione: Trasporto a Bassa Latenza RDMA/RoCE e Ottimizzazione del Throughput del Server

July 29, 2026

ultime notizie sull'azienda NVIDIA Mellanox MCX653105A-HDAT in Azione: Trasporto a Bassa Latenza RDMA/RoCE e Ottimizzazione del Throughput del Server

NVIDIA Mellanox MCX653105A-HDAT in Azione: Trasporto a Bassa Latenza RDMA/RoCE e Ottimizzazione del Throughput del Server

Contesto e Sfide: Il Collo di Bottiglia della Rete in un Cluster AI/HPC

Una grande azienda tecnologica ha recentemente implementato un cluster accelerato da GPU a 128 nodi per l'addestramento di modelli linguistici di grandi dimensioni (LLM), con ogni nodo dotato di otto GPU NVIDIA H100 e storage NVMe ad alte prestazioni. Tuttavia, dopo aver scalato oltre i 32 nodi, il cluster ha subito un drastico degrado delle prestazioni. La latenza della comunicazione collettiva All-Reduce è salita a 8-10 millisecondi, mentre lo stack di rete TCP/IP consumava oltre il 45% delle risorse CPU per nodo. La rete — costruita su più collegamenti 25GbE — era diventata il principale collo di bottiglia, limitando gravemente l'utilizzo della GPU e prolungando i cicli di addestramento ben oltre le tempistiche accettabili. Il team richiedeva urgentemente una soluzione in grado di fornire sia latenza ultra-bassa che larghezza di banda massiccia, scaricando al contempo l'elaborazione di rete intensiva per la CPU.

Soluzione e Implementazione: Trasformare il Fabric con il MCX653105A-HDAT

Dopo un'approfondita valutazione tecnica, il team ha selezionato il NVIDIA Mellanox MCX653105A-HDAT come base per la trasformazione della propria rete. Ogni nodo GPU è stato dotato di una scheda di rete PCIe MCX653105A-HDAT ConnectX adapter, configurata con connettività dual-port 100GbE per fornire 200 Gb/s di larghezza di banda aggregata per server.

L'implementazione è stata eseguita in quattro fasi strutturate:

  • Fase 1 — Installazione Hardware (128 nodi): Ogni server ha ricevuto la scheda adattatore Ethernet MCX653105A-HDAT, con entrambe le porte QSFP28 collegate a switch leaf NVIDIA Spectrum-4 ridondanti. Gli adattatori sono stati installati con il firmware più recente e lo stack driver NVIDIA OFED.
  • Fase 2 — Configurazione RoCEv2: Il team ha abilitato RoCEv2 sull'intero fabric, ottimizzando attentamente i parametri di Priority Flow Control (PFC) e Explicit Congestion Notification (ECN) per stabilire un ambiente Ethernet lossless. Le funzionalità avanzate di gestione della congestione dettagliate nella scheda tecnica MCX653105A-HDAT sono state fondamentali per ottenere un'allocazione ottimale dei buffer.
  • Fase 3 — Ottimizzazione NCCL: La NVIDIA Collective Communications Library (NCCL) è stata riconfigurata per sfruttare le capacità RDMA dell'adattatore, con regole di traffico personalizzate programmate nei motori di elaborazione integrati dell'adattatore per ottimizzare i pattern specifici di all-reduce e all-gather del carico di lavoro LLM.
  • Fase 4 — Validazione e Fine-Tuning: Utilizzando i dati di telemetria esposti dalle specifiche MCX653105A-HDAT, il team ha validato la configurazione, ottimizzato le impostazioni di interrupt moderation e stabilito metriche di performance di base per il monitoraggio continuo.

In particolare, l'adattatore si è dimostrato compatibile con MCX653105A-HDAT con l'infrastruttura di cablaggio esistente, poiché le porte QSFP28 supportavano ottiche sia 100GbE che 25GbE, consentendo una migrazione fluida senza sostituzioni disruptive dei cavi. Il team ha inoltre sfruttato le capacità multi-host dell'adattatore per supportare funzioni di calcolo e storage sulla stessa porta fisica.

Risultati e Benefici: Guadagni Misurabili nelle Prestazioni di Addestramento

I miglioramenti delle prestazioni forniti dal NVIDIA Mellanox MCX653105A-HDAT hanno superato tutte le proiezioni iniziali. Le metriche chiave di performance prima e dopo l'aggiornamento sono riassunte di seguito:

Metrica Pre-Aggiornamento (25GbE TCP/IP) Post-Aggiornamento (MCX653105A-HDAT con RoCE) Miglioramento
Latenza All-Reduce (128 nodi) 9.2 ms 0.28 ms Riduzione di 32.8×
Utilizzo CPU di Rete (per nodo) 47% 6% 41 pp recuperati
Utilizzo GPU (fase di addestramento) 58% 94% Aumento del +36%
Throughput di Addestramento del Cluster 1.9x baseline 5.7x baseline Aumento di 3×

Oltre a questi successi quantitativi, il team ha osservato significativi benefici operativi. Le esecuzioni di addestramento che in precedenza richiedevano 12 giorni sono state completate in soli 4 giorni, accelerando drasticamente i cicli di iterazione del modello. Il data-path programmabile dell'adattatore ha consentito uno shaping del traffico personalizzato per i flussi prioritari, garantendo che il traffico di comunicazione collettiva critico non subisse mai contesa. Per le organizzazioni che valutano il ritorno sull'investimento, il prezzo MCX653105A-HDAT si è rivelato pienamente giustificato dal guadagno di throughput di 3× e dalla capacità di posticipare l'acquisizione di ulteriori server GPU di almeno 12 mesi. Il team ha notato che i bundle MCX653105A-HDAT in vendita con switch NVIDIA Spectrum-4 offrivano l'economia più favorevole per l'implementazione dell'intero cluster.

Riepilogo e Prospettive: Una Base per l'Infrastruttura AI di Prossima Generazione

Questa implementazione su scala produttiva convalida che il NVIDIA Mellanox MCX653105A-HDAT è un componente trasformativo per i moderni cluster AI e HPC. La combinazione di larghezza di banda aggregata di 200 Gb/s, latenza di comunicazione collettiva inferiore a 0,3 millisecondi e offload hardware completi consente alle organizzazioni di ottenere uno scaling quasi lineare per i carichi di lavoro accelerati da GPU. Come soluzione di schede adattatore Ethernet MCX653105A-HDAT end-to-end, elimina il collo di bottiglia della rete che ha storicamente limitato l'efficienza dell'addestramento distribuito.

Guardando al futuro, l'azienda sta esplorando l'integrazione con NVIDIA DOCA per implementare ulteriore programmabilità del data-path per l'ottimizzazione specifica del carico di lavoro. Stanno inoltre sfruttando la telemetria avanzata dell'adattatore — ampiamente documentata nella scheda tecnica MCX653105A-HDAT — per costruire modelli predittivi delle prestazioni e strategie automatizzate di mitigazione della congestione. Il NVIDIA Mellanox MCX653105A-HDAT è diventato la pietra angolare della loro roadmap infrastrutturale AI, fornendo una base robusta e scalabile per la prossima generazione di sviluppo e implementazione di modelli fondazionali.