NVIDIA Mellanox MCX623106AN-CDAT Server Adapter in Azione | RDMA/RoCE a Bassa Latenza e Guadagni di Throughput del Server

July 22, 2026

ultime notizie sull'azienda NVIDIA Mellanox MCX623106AN-CDAT Server Adapter in Azione | RDMA/RoCE a Bassa Latenza e Guadagni di Throughput del Server

NVIDIA Mellanox MCX623106AN-CDAT Server Adapter in Azione | Trasporto a Bassa Latenza RDMA/RoCE e Aumento del Throughput del Server

Contesto e La Sfida: Quando i 200GbE Incontrano il Muro della Scalabilità AI

Un'organizzazione di ricerca AI in rapida crescita — chiamiamola "DeepCore Labs" — stava affrontando un collo di bottiglia critico nella scalabilità. Il loro cluster di punta per l'addestramento di modelli linguistici di grandi dimensioni, composto da 512 GPU NVIDIA H100 distribuite su 128 nodi, stava subendo un grave degrado delle prestazioni quando scalavano oltre i 64 nodi. Il problema non era il calcolo o la memoria, ma il fabric di rete. La sincronizzazione all-reduce dei gradienti richiedeva oltre 15 secondi per iterazione e l'utilizzo della GPU era sceso solo al 62% a causa di blocchi di rete. La loro infrastruttura 100GbE esistente, basata su TCP/IP via software, semplicemente non era in grado di gestire i pattern di comunicazione bursty e sensibili alla latenza dell'addestramento distribuito. Il team necessitava di una soluzione in grado di fornire un throughput 200GbE a velocità di linea con una latenza deterministica a livello di microsecondi.

La loro valutazione li ha portati al NVIDIA Mellanox MCX623106AN-CDAT — un adattatore server 200GbE progettato per i carichi di lavoro AI e HPC più esigenti. Il team di ricerca ha riconosciuto che la scheda di rete PCIe dell'adattatore MCX623106AN-CDAT ConnectX offriva gli offload avanzati e le capacità GPUDirect necessarie per eliminare il collo di bottiglia di rete e massimizzare l'utilizzo della GPU.

La Soluzione: Implementazione dell'Adattatore Ethernet MCX623106AN-CDAT

DeepCore Labs ha implementato la scheda adattatore Ethernet MCX623106AN-CDAT su tutti i 128 nodi di addestramento, con ogni server dotato di un adattatore dual-port QSFP112 collegato a un fabric leaf-spine basato su switch NVIDIA Spectrum-4. L'implementazione ha sfruttato il supporto nativo RoCE v2 dell'adattatore per abilitare il trasporto Ethernet lossless, eliminando la necessità di un fabric InfiniBand separato. Fondamentale per la soluzione è stata la capacità GPUDirect RDMA dell'adattatore, che ha consentito il movimento diretto dei dati tra le GPU attraverso la rete senza intervento della CPU — una funzionalità critica per ridurre l'overhead di sincronizzazione.

Il team ha configurato PFC (Priority Flow Control) ed ECN (Explicit Congestion Notification) a livello di switch, dedicando la priorità 3 al traffico di comunicazione collettiva e la priorità 4 all'I/O di storage. Hanno inoltre implementato la tecnologia di routing adattivo di NVIDIA per distribuire dinamicamente il traffico su più percorsi, minimizzando gli hotspot. Entro quattro settimane, l'intero fabric di addestramento funzionava su RDMA, con tutte le 512 GPU che comunicavano senza interruzioni tramite RoCE. L'ecosistema compatibile con MCX623106AN-CDAT si è dimostrato robusto: le schede si sono integrate perfettamente con i server basati su H100 e la libreria NCCL (NVIDIA Collective Communications Library) di NVIDIA senza alcuna modifica.

Il team ha fatto riferimento al datasheet MCX623106AN-CDAT per ottimizzare l'allocazione dei buffer e i parametri di controllo della congestione, ottenendo prestazioni ottimali per il loro ambiente di carico di lavoro misto — che includeva sia l'addestramento sincrono (dominato da all-reduce) che il checkpointing asincrono.

Risultati Misurabili: Efficienza di Scalabilità, Throughput e Utilizzo della GPU

L'incremento delle prestazioni è stato trasformativo. Con RDMA su RoCE abilitato tramite NVIDIA Mellanox MCX623106AN-CDAT, la latenza di sincronizzazione all-reduce è scesa da una media di 15,2 secondi a soli 1,8 secondi per iterazione — un miglioramento di 8,4 volte. Ciò si è tradotto direttamente in una convergenza più rapida del modello: il tempo totale di addestramento per il loro modello da 70 miliardi di parametri è diminuito da 42 giorni a 19 giorni, accelerando il loro ciclo di ricerca di oltre il 50%.

L'utilizzo della GPU, che era stagnante al 62% a causa di blocchi di rete, è salito al 94% dopo l'aggiornamento — un miglioramento del 52% della capacità di calcolo effettiva. L'avanzato motore di posizionamento dati fuori ordine e il packet pacing dell'adattatore hanno eliminato i micro-burst che causavano picchi di latenza di coda, garantendo prestazioni costanti su tutti i nodi.

Oltre alle prestazioni di addestramento, i guadagni di throughput del server sono stati altrettanto convincenti. Il motore di offload hardware — inclusi checksum offload, LSO/LRO e accelerazione RoCE — ha ridotto l'utilizzo della CPU per l'elaborazione di rete dal 38% a meno del 4% su tutti i nodi. Ciò ha liberato una significativa capacità della CPU per il pre-processing dei dati, la compressione dei checkpoint e altre attività ausiliarie che in precedenza erano limitate.

Metrica Prima (Scheda NIC 100GbE Legacy) Dopo (MCX623106AN-CDAT) Miglioramento
Latenza All-Reduce (per iter) 15,2 s 1,8 s 8,4x più veloce
Utilizzo GPU 62% 94% 52% più alto
Tempo di Addestramento Modello (70B parametri) 42 giorni 19 giorni 55% più veloce
Overhead di Rete CPU 38% < 4% 89% più basso
Latenza Lettura NVMe-oF (storage) 185 µs 12 µs 15x più veloce

Benefici Operativi: TCO ed Efficienza dell'Infrastruttura

Sebbene i guadagni di prestazioni siano stati notevoli, i benefici operativi e finanziari sono stati altrettanto degni di nota. La soluzione con scheda adattatore Ethernet MCX623106AN-CDAT ha ridotto il costo totale di proprietà eliminando la necessità di un fabric InfiniBand separato — risparmiando oltre $500K in costi di infrastruttura switch. Il design a basso consumo energetico dell'adattatore (meno di 20W per scheda) ha contribuito a risparmi energetici misurabili sull'intero cluster di 128 nodi, riducendo le spese annuali di raffreddamento di circa il 18%.

Per i responsabili IT che valutano il prezzo MCX623106AN-CDAT rispetto a soluzioni alternative, il direttore dell'infrastruttura di DeepCore ha osservato che il periodo di ammortamento è stato inferiore a sei mesi — guidato principalmente dalla riduzione del tempo di addestramento, che ha accelerato direttamente la loro pipeline di sviluppo prodotto. Il team ha anche apprezzato la longevità dell'adattatore: lo stesso MCX623106AN-CDAT in vendita oggi supporta 200GbE ma è anche compatibile con ottiche 100GbE e 50GbE, offrendo flessibilità per ambienti a velocità ibrida e aggiornamenti graduali.

Secondo le specifiche MCX623106AN-CDAT, l'adattatore include funzionalità di telemetria complete, tra cui la telemetria di rete in-band (INT) e il tracciamento della latenza per flusso. DeepCore ha integrato queste metriche nel loro stack Prometheus/Grafana, consentendo il rilevamento proattivo di micro-congestioni prima che influenzassero le prestazioni di addestramento. Il team ha inoltre sfruttato gli algoritmi di controllo della congestione dell'adattatore per regolare dinamicamente le soglie ECN, mantenendo un comportamento lossless anche durante le operazioni di checkpointing che generavano carico di rete aggiuntivo.

Riepilogo e Prospettive: Un Modello per il Networking su Scala AI

Il percorso di DeepCore Labs con NVIDIA Mellanox MCX623106AN-CDAT dimostra un chiaro modello per le organizzazioni che costruiscono o scalano infrastrutture AI. Combinando throughput dual-port 200GbE, interfaccia host PCIe 5.0 e RDMA abilitato da GPUDirect, la scheda adattatore Ethernet MCX623106AN-CDAT trasforma la rete da un collo di bottiglia di scalabilità a un moltiplicatore di prestazioni. I risultati — 8,4 volte più veloce all-reduce, 94% di utilizzo della GPU e cicli di addestramento il 55% più veloci — testimoniano la capacità dell'adattatore di fornire risultati di business tangibili negli ambienti di calcolo più esigenti.

Guardando al futuro, poiché le dimensioni dei modelli continuano a raddoppiare ogni pochi mesi e i cluster di addestramento distribuiti si espandono a migliaia di GPU, la scheda di rete PCIe dell'adattatore MCX623106AN-CDAT ConnectX fornisce una solida base per fabric lossless a latenza ultra-bassa. Per architetti e leader IT che pianificano il loro prossimo investimento in infrastrutture AI, questo adattatore rappresenta non solo un componente, ma un abilitatore strategico per la differenziazione competitiva. Parametri di tuning dettagliati, script di implementazione e report di benchmark delle prestazioni sono disponibili nel datasheet MCX623106AN-CDAT ufficiale — un riferimento essenziale per qualsiasi implementazione AI su larga scala.