NVIDIA Mellanox MCX653106A-HDAT in Azione: Trasporto a Bassa Latenza RDMA/RoCE e Ottimizzazione del Throughput del Server

July 30, 2026

ultime notizie sull'azienda NVIDIA Mellanox MCX653106A-HDAT in Azione: Trasporto a Bassa Latenza RDMA/RoCE e Ottimizzazione del Throughput del Server
NVIDIA Mellanox MCX653106A-HDAT in azione: RDMA/RoCE Trasporto a bassa latenza e ottimizzazione del throughput del server
Sfondo e sfide: collo di bottiglia della rete del fornitore di cloud hyperscale

A major hyperscale cloud provider operating a 256-node cluster for distributed AI training and real-time analytics began experiencing severe network performance degradation as their infrastructure scaledIl tessuto basato su TCP/IP 25GbE ha mostrato latenze All-Reduce superiori a 6 millisecondi su 128 nodi.mentre l'utilizzo della CPU per l'elaborazione della rete consumava oltre il 40% della capacità di calcolo di ciascun serverQuesto collo di bottiglia ha limitato l'utilizzo della GPU a appena il 55%, estendendo notevolmente i cicli di formazione e riducendo la capacità di generare entrate.Il team aveva bisogno di una soluzione in grado di fornire sia latenza su scala di microsecondi che larghezza di banda massiccia, fornendo al contempo la programmabilità necessaria per l'ottimizzazione del traffico specifico del carico di lavoro.

Soluzione e implementazione: trasformazione del tessuto con MCX653106A-HDAT

Dopo un'approfondita valutazione tecnica, il fornitore ha selezionatoNVIDIA Mellanox MCX653106A-HDATIl progetto è stato realizzato con l'obiettivo di sviluppare un sistema di distribuzione integrata di dati, che sia la pietra angolare della trasformazione della rete.MCX653106A-HDAT ConnectX adattatore scheda di rete PCIe, configurato con connettività 100GbE a doppia porta per fornire 200 Gb/s di larghezza di banda aggregata per nodo.

  • Fase 1 ¢ pilota (8 nodi):Il team ha installato ilscheda di adattatore Ethernet MCX653106A-HDATGli adattatori sono stati accoppiati con switch NVIDIA Spectrum-4 per la gestione della congestione end-to-end.
  • Fase 2 Validazione e sintonizzazione:Utilizzando i dati telemetrici documentati nelFogli di dati MCX653106A-HDAT, il team ha convalidato la configurazione, ha perfezionato i parametri DCB e ha ottimizzato le impostazioni di comunicazione collettiva NCCL.Le caratteristiche avanzate di programmabilità dell'adattatore hanno permesso la regolazione del traffico personalizzata per i modelli specifici di riduzione totale del carico di lavoro.
  • Fase 3 Completo sviluppo della produzione (256 nodi):Dopo una validazione riuscita, l'intero cluster è stato trasferito al nuovo adattatore.Compatibile con MCX653106A-HDATLa natura della soluzione ha assicurato un'integrazione senza soluzione di continuità con i server esistenti e le distribuzioni Linux.
  • Fase 4: Ottimizzazione continua:Il team ha sfruttato la telemetria in linea e il percorso dei dati programmabili dell'adattatore per implementare politiche di routing consapevoli del carico di lavoro, ottimizzando ulteriormente le prestazioni per i lavori di formazione dell'IA.

Il team ha osservato che ilSoluzione per schede di adattamento Ethernet MCX653106A-HDATha fornito un percorso di migrazione semplice, poiché le porte QSFP56 hanno supportato sia l'ottica 100GbE che quella 25GbE, consentendo una transizione elegante senza interrompere la connettività esistente.

Risultati e benefici: trasformazione misurabile delle prestazioni ed efficienza
Metrica Pre-upgrade (25GbE TCP/IP) Post-upgrade (MCX653106A-HDAT con RoCE) Miglioramento
All-Reduce Latency (256 nodi) 6.8 ms 0.22 ms 30.9* riduzione
Utilizzazione della CPU di rete (per nodo) 43% 5% 38 pp recuperato
Utilizzazione della GPU (fase di formazione) 55% 93% Aumento del +38%
Prodotto di formazione in cluster 2.1x valore di riferimento 6.4x valore di riferimento 3.0* aumento

Oltre a questi guadagni quantitativi, il fornitore ha osservato benefici operativi significativi: le sessioni di formazione che in precedenza richiedevano 14 giorni sono state completate in soli 4,5 giorni, mentre le sessioni di formazione di base sono state completate in soli 10 giorni.accelerare drasticamente il time-to-market per i nuovi servizi di IAIl percorso di dati programmabile dell'adattatore ha consentito di modellare il traffico personalizzato per i flussi prioritari, garantendo che il traffico di comunicazione collettiva critica non abbia mai avuto conflitti.Per le organizzazioni che valutano il ritorno sull'investimento, ilMCX653106A-HDAT prezzoIl team ha inoltre osservato che il miglioramento del rendimento di 3* e la possibilità di rinviare l'acquisizione di server aggiuntivi di oltre 18 mesi hanno dimostrato di essere pienamente giustificati.MCX653106A-HDAT in venditaI pacchetti con switch NVIDIA Spectrum-4 offrivano le economie più favorevoli per le distribuzioni su larga scala.

Il fornitore ha anche sfruttato le capacità di telemetria complete dettagliate nelLe specifiche MCX653106A-HDATsviluppare modelli di prestazione predittivi e strategie automatizzate di riduzione delle congestioni, migliorando ulteriormente l'efficienza operativa.

Riassunto e prospettive: una fondazione per l'infrastruttura di IA iperscala

Questa diffusione su scala produttiva dimostra che laNVIDIA Mellanox MCX653106A-HDATè una componente trasformativa per l'intelligenza artificiale moderna e l'infrastruttura cloud.e hardware offloads completa consente una scalabilità quasi lineare per i carichi di lavoro accelerati da GPUCome un' interfacciaSoluzione per schede di adattamento Ethernet MCX653106A-HDAT, elimina il collo di bottiglia della rete che ha limitato storicamente l'efficienza della formazione distribuita e la fornitura di servizi cloud.

Guardando avanti,il fornitore di servizi cloud sta esplorando un'integrazione estesa con NVIDIA DOCA per implementare ulteriore programmabilità dei percorsi dati per l'ottimizzazione specifica del carico di lavoro in più ambienti tenantInoltre, stanno sfruttando la telemetria in linea dell'adattatore, ampiamente documentata nelFogli di dati MCX653106A-HDATIl progetto è stato realizzato con l'obiettivo di sviluppare sistemi automatizzati di gestione delle prestazioni di nuova generazione.NVIDIA Mellanox MCX653106A-HDATè diventata la base della loro tabella di marcia dell'infrastruttura di IA, fornendo una piattaforma robusta e scalabile per la prossima generazione di formazione di modelli di base e servizi di analisi in tempo reale.