NVIDIA Mellanox MCX623106AN-CDAT Server Adapter Libro bianco tecnico

July 24, 2026

NVIDIA Mellanox MCX623106AN-CDAT Server Adapter Libro bianco tecnico

NVIDIA Mellanox MCX623106AN-CDAT Server Adapter Libro bianco tecnico

1. Analisi del contesto e dei requisiti del progetto

I moderni data center stanno attraversando un cambiamento di paradigma guidato dalla crescita esplosiva dell'intelligenza artificiale, dell'apprendimento automatico su larga scala e dell'analisi in tempo reale.Questi carichi di lavoro richiedono prestazioni di rete senza precedenti non solo larghezza di banda grezzaGli adattatori Ethernet tradizionali, basati su stack TCP/IP basati su software, sono dotati di un'elevata capacità di distribuzione e di un'elevata capacità di distribuzione, ma hanno una latenza deterministica sotto i 5 μs, un movimento di dati efficiente per la CPU e una scalabilità senza soluzione di continuità a migliaia di nodi.sono diventati un collo di bottiglia critico, che consuma fino al 40% dei core CPU a velocità di 200 GbE e introduce variazioni di latenza imprevedibili che degradano le prestazioni delle applicazioni.Per le organizzazioni che costruiscono cluster di intelligenza artificiale su larga scala (500+ GPU) o infrastrutture cloud hyperscale, questa inefficienza si traduce direttamente in tempi di formazione più lunghi, costi più elevati per le infrastrutture e tempi di commercializzazione più lenti.

Questo libro bianco presenta una soluzione tecnica completa incentrata sullaNVIDIA Mellanox MCX623106AN-CDATL'adattatore per server è stato progettato per le imprese che cercano di massimizzare i loro investimenti in 200GbE.MCX623106AN-CDAT scheda di adattatore Ethernetfornisce RDMA accelerato da hardware su Ethernet convergente (RoCE), consentendo un trasporto senza perdite e con latenza ultra-bassa che trasforma l'I/O della rete da un collo di bottiglia di scalabilità in un vantaggio competitivo.La soluzione è specificamente progettata per soddisfare tre obiettivi fondamentali: (1) raggiungere una latenza di applicazione end-to-end inferiore ai 5 μs per le comunicazioni collettive di IA, (2) ridurre i costi generali di elaborazione della rete della CPU a meno del 5% e (3) fornire una scalabilità,base a prova di futuro per 200GbE e oltre.

2. Progettazione complessiva dell'architettura di rete e sistema

L'architettura raccomandata adotta una topologia di leaf-spine ad alte prestazioni con 200GbE come livello di accesso al server e 400GbE/800GbE uplinks alla colonna vertebrale.MCX623106AN-CDAT Adapter ConnectX scheda di rete PCIeL'architettura è costruita attorno a sei principi chiave:

  • Tessuto Ethernet senza perdite:Sfruttare il RoCE v2 con PFC (Priority Flow Control) ed ECN (Explicit Congestion Notification) su tutti gli switch per eliminare i pacchetti caduti e garantire la latenza deterministica per il traffico RDMA.
  • GPUDirect RDMA:Consente la comunicazione diretta tra GPU e GPU attraverso la rete senza coinvolgimento della CPU, riducendo la latenza e liberando le risorse della CPU per le attività di calcolo.
  • Discarica di hardware ovunque:Offloading protocolli di trasporto, sicurezza (IPsec/MACsec) e di archiviazione all'adattatore, liberando i cicli di CPU per la logica applicativa.
  • Riduzione attiva-attivaUtilizzando entrambe le porte QSFP112 in modalità di aggregazione di collegamenti (LACP) per 400 Gb/s di larghezza di banda aggregata e failover automatico con recupero in sotto-secondo.
  • Ingegneria del traffico intelligente:Routing adattivo e consegna di pacchetti fuori ordine per evitare punti di congestione e massimizzare l'utilizzo del tessuto.
  • Telemetria completa:Telemetria della rete in banda (INT) e monitoraggio per flusso per la rilevazione proattiva della congestione e la pianificazione della capacità.

La soluzione è completamenteMCX623106AN-CDAT compatibilePer l'archiviazione, l'architettura supporta NVMe-oF su RoCE con latenza inferiore ai 15 μs,consentire lo stoccaggio condiviso disaggregato per cluster di formazione su larga scala.

3. Il ruolo e le caratteristiche chiave del NVIDIA Mellanox MCX623106AN-CDAT

Come componente fondamentale di questa soluzione, laNVIDIA Mellanox MCX623106AN-CDATsvolge quattro ruoli critici all'interno dell'architettura:

Funzione Dettagli di attuazione Benefici per le imprese
Motore RDMA/RoCE RoCE v2 basato su hardware con ECN/PFC, latenza inferiore a 0,6 μs, supporto GPUDirect Involvimento CPU quasi zero; 8 volte più veloce all-reduce per l'addestramento dell'IA
Doppia porta 200GbE Due porte QSFP112 indipendenti, capacità aggregata di 400 Gb/s Legamento attivo-attivo per larghezza di banda; standby attivo per ridondanza
Interfaccia PCIe 5.0 PCIe 5.0 x16 (fino a 32 GT/s) con motore DMA avanzato Elimina il collo di bottiglia dell'interfaccia host per il traffico 200GbE
Virtualizzazione e sovrapposizione di carico SR-IOV con un massimo di 512 VF per porta; VXLAN/NVGRE/IPsec/MACsec offload Immobili multi-tenancy ad alta densità con sicurezza e prestazioni di linea

Le principali specifiche tecniche tratte dalFogli di dati MCX623106AN-CDATincludere funzionalità complete di discarico (suma di controllo, LSO/LRO, VLAN stripping/insertion, RSS con fino a 128 code), algoritmi avanzati di controllo della congestione,e supporto completo per le librerie di comunicazioni collettive di NVIDIA (NCCL). ilLe specifiche MCX623106AN-CDATsottolineare inoltre il supporto alla compatibilità 100GbE e 50GbE, offrendo flessibilità di implementazione per ambienti a velocità mista.

4. Raccomandazioni per la distribuzione e la scalabilità

Per i cluster di intelligenza artificiale in campo verde, si raccomanda una topologia a due livelli con accesso a 200 GbE e collegamenti ascendenti a 800 GbE.MCX623106AN-CDAT scheda di adattatore Ethernetcon entrambe le porte QSFP112 collegate a switch separati per la ridondanza.PFC sulla priorità 3 (per il traffico collettivo RDMA) e la priorità 4 (per lo stoccaggio)Si raccomanda di dedicare VLAN separate per RDMA, gestione, archiviazione e traffico tenant per semplificare il monitoraggio e la risoluzione dei problemi.

Per gli ambienti di campo rosso con infrastrutture 100GbE esistenti, ilMCX623106AN-CDAT soluzione per schede di adattamento EthernetPoiché l'adattatore è retrocompatibile con l'ottica 100GbE QSFP56, il cablaggio esistente può essere riutilizzato durante l'aggiornamento graduale a 200GbE.L'adattatore supporta anche la commutazione Ethernet standard senza abilitazione RoCE obbligatoria, consentendo ai team di implementare prima l'hardware e attivare le capacità RDMA in fasi man mano che il tessuto matura e i carichi di lavoro giustificano la transizione.

La scalabilità della soluzione oltre i 500 nodi richiede ulteriori considerazioni.Raccomandiamo di implementare una strategia dedicata di gestione della congestione RoCE utilizzando switch NVIDIA Spectrum-4 con telemetria integrata e regolazione dinamica della soglia ECNPer i cluster che superano i 1.000 nodi, considerare la possibilità di implementare un controller centralizzato di gestione del tessuto (ad esempio, NVIDIA NetQ) per mantenere la visibilità end-to-end e la coerenza della configurazione automatizzata.MCX623106AN-CDAT in venditaL'azienda ha inoltre fornito un'ampia gamma di servizi per la gestione dei sistemi di gestione dei dati, compresi i servizi di gestione dei dati e la gestione dei dati personali.

5. Operazioni, monitoraggio, risoluzione dei problemi e ottimizzazione

Il funzionamento efficace del tessuto RoCE richiede una strategia di monitoraggio e risoluzione dei problemi a più livelli:

  • Telemetria a livello di adattatore:IlLe specifiche MCX623106AN-CDATincludono contatori per porta per fotogrammi PFC, pacchetti contrassegnati da ECN, fotogrammi abbandonati, errori di collegamento ed epoche di congestione.mlx5cmd,Eticole, o strumenti firmware NVIDIA per esportare queste metriche nelle dashboard Prometheus/Grafana con gli avvisi appropriati.
  • Telemetria di rete in banda (INT):Sfruttare il supporto INT dell'adattatore per tracciare le latenze per flusso e le profondità di coda attraverso il tessuto, consentendo l'identificazione precisa delle fonti di micro-congestione.
  • Monitoraggio a livello di interruttore:Monitorare l'occupazione del buffer, il numero di frame in pausa, le profondità di coda e i tassi di marcatura ECN sui switch spine e leaf.L'aumento improvviso dei frame di pausa indica una micro-congestione che potrebbe richiedere l'adeguamento della soglia ECN.
  • Metrici a livello di applicazione:Per le applicazioni RDMA, tenere traccia delle latenze di completamento WR (Work Request), degli eventi di sovraccarico CQ (Completion Queue) e dei conteggi di errori QP (Queue Pair) utilizzando le librerie NVIDIA libibverbs e rdma-core.

Scenari comuni di risoluzione dei problemi e azioni raccomandate:

  • Deterioramento delle prestazioni RoCE:Verificare che il PFC sia abilitato su tutte le porte dello switch e che il marchio DSCP corrisponda alla configurazione dello switch.Fogli di dati MCX623106AN-CDATper convalidare le impostazioni di allocazione del buffer rispetto ai valori raccomandati per il profilo del carico di lavoro.
  • Errori di collegamento o CRC:Controllare la qualità del cavo QSFP112 (assicurare la conformità alle specifiche 200G AOC o DAC) e verificare che il firmware dell'adattatore sia aggiornato all'ultima versione.
  • Problemi di prestazione della GPU Direct:Confirmare che GPUDirect sia iniziato correttamente e che la topologia PCIe supporti DMA peer-to-peer senza commutazione intermedia.
  • PFC deadlock o tempesta di pausa:Controllare la presenza di priorità mal configurate e assicurarsi che il PFC sia abilitato solo per le classi di traffico RoCE (non per il traffico di gestione o di archiviazione).

Per l'ottimizzazione, raccomandiamo i seguenti parametri di regolazione basati su una vasta convalida di laboratorio:

  • Interruzione della fusione (moderazione):impostato su 2 ‰ 4 μs per i carichi di lavoro di addestramento dell'IA per ridurre al minimo la latenza mantenendo l'efficienza della CPU.
  • RDMA MTU:Aumentare a 4096 byte per le comunicazioni all-reduce per ridurre i costi generali del protocollo e migliorare il throughput.
  • RSS (Receive Side Scaling):Configurare tra più core CPU per il traffico non RDMA per distribuire l'elaborazione ed evitare la saturazione di un singolo core.
  • Limiti ECN:Impostare una soglia minima del 40% del buffer e una soglia massima del 75% per il traffico di priorità 3, adeguandosi in base ai modelli di congestione osservati e alle caratteristiche del carico di lavoro.

6. Riassunto e valutazione del valore

IlNVIDIA Mellanox MCX623106AN-CDATLa soluzione offre un valore di trasformazione per i moderni data center su scala AI. Sostituendo il TCP/IP basato su software con RDMA/RoCE e GPUDirect accelerati da hardware,le organizzazioni possono ottenere riduzioni della latenza a livello di applicazione di 8 ‰ 10xInfine, la Commissione ha deciso di ridurre di oltre l'85% le spese di rete delle CPU e di aumentare l'utilizzo delle GPU da meno del 70% a oltre il 95%.MCX623106AN-CDAT scheda di adattatore Ethernetfornisce un percorso conveniente per l'adozione di 200GbE con protezione degli investimenti attraverso la retrocompatibilità a 100GbE e le capacità di scarico future per carichi di lavoro emergenti.

Nel valutare il costo totale di proprietà, ilMCX623106AN-CDAT prezzoè compensato da un notevole risparmio operativo: tempo di formazione ridotto (accelerazione del time-to-market), minor numero di server (a causa di una maggiore utilizzazione della GPU),riduzione dei costi di raffreddamento (grazie al consumo di energia < 20 W), e l'eliminazione di tessuti InfiniBand separati.MCX623106AN-CDAT compatibilecon i principali stack software AI e HPC, tra cui le librerie NVIDIA NCCL, PyTorch, TensorFlow e MPI, garantendo un'ampia applicabilità nelle distribuzioni aziendali, cloud e di ricerca.

Per scrittori di distribuzione dettagliati, modelli di configurazione e rapporti di performance di riferimento, consultare il sito ufficialeFogli di dati MCX623106AN-CDATQuesto white paper serve da base ∙ l'architettura è convalidata, i componenti sono pronti per la produzione,e i benefici sono misurabili. ilMCX623106AN-CDAT Adapter ConnectX scheda di rete PCIenon è solo un adattatore, è un fattore strategico per il data center del futuro pronto per l'intelligenza artificiale e a bassa latenza.