NVIDIA Mellanox MCX623106AN-CDAT Server Adapter Libro bianco tecnico
July 24, 2026
NVIDIA Mellanox MCX623106AN-CDAT Server Adapter Libro bianco tecnico
1. Analisi del contesto e dei requisiti del progetto
I moderni data center stanno attraversando un cambiamento di paradigma guidato dalla crescita esplosiva dell'intelligenza artificiale, dell'apprendimento automatico su larga scala e dell'analisi in tempo reale.Questi carichi di lavoro richiedono prestazioni di rete senza precedenti non solo larghezza di banda grezzaGli adattatori Ethernet tradizionali, basati su stack TCP/IP basati su software, sono dotati di un'elevata capacità di distribuzione e di un'elevata capacità di distribuzione, ma hanno una latenza deterministica sotto i 5 μs, un movimento di dati efficiente per la CPU e una scalabilità senza soluzione di continuità a migliaia di nodi.sono diventati un collo di bottiglia critico, che consuma fino al 40% dei core CPU a velocità di 200 GbE e introduce variazioni di latenza imprevedibili che degradano le prestazioni delle applicazioni.Per le organizzazioni che costruiscono cluster di intelligenza artificiale su larga scala (500+ GPU) o infrastrutture cloud hyperscale, questa inefficienza si traduce direttamente in tempi di formazione più lunghi, costi più elevati per le infrastrutture e tempi di commercializzazione più lenti.
Questo libro bianco presenta una soluzione tecnica completa incentrata sullaNVIDIA Mellanox MCX623106AN-CDATL'adattatore per server è stato progettato per le imprese che cercano di massimizzare i loro investimenti in 200GbE.MCX623106AN-CDAT scheda di adattatore Ethernetfornisce RDMA accelerato da hardware su Ethernet convergente (RoCE), consentendo un trasporto senza perdite e con latenza ultra-bassa che trasforma l'I/O della rete da un collo di bottiglia di scalabilità in un vantaggio competitivo.La soluzione è specificamente progettata per soddisfare tre obiettivi fondamentali: (1) raggiungere una latenza di applicazione end-to-end inferiore ai 5 μs per le comunicazioni collettive di IA, (2) ridurre i costi generali di elaborazione della rete della CPU a meno del 5% e (3) fornire una scalabilità,base a prova di futuro per 200GbE e oltre.
2. Progettazione complessiva dell'architettura di rete e sistema
L'architettura raccomandata adotta una topologia di leaf-spine ad alte prestazioni con 200GbE come livello di accesso al server e 400GbE/800GbE uplinks alla colonna vertebrale.MCX623106AN-CDAT Adapter ConnectX scheda di rete PCIeL'architettura è costruita attorno a sei principi chiave:
- Tessuto Ethernet senza perdite:Sfruttare il RoCE v2 con PFC (Priority Flow Control) ed ECN (Explicit Congestion Notification) su tutti gli switch per eliminare i pacchetti caduti e garantire la latenza deterministica per il traffico RDMA.
- GPUDirect RDMA:Consente la comunicazione diretta tra GPU e GPU attraverso la rete senza coinvolgimento della CPU, riducendo la latenza e liberando le risorse della CPU per le attività di calcolo.
- Discarica di hardware ovunque:Offloading protocolli di trasporto, sicurezza (IPsec/MACsec) e di archiviazione all'adattatore, liberando i cicli di CPU per la logica applicativa.
- Riduzione attiva-attivaUtilizzando entrambe le porte QSFP112 in modalità di aggregazione di collegamenti (LACP) per 400 Gb/s di larghezza di banda aggregata e failover automatico con recupero in sotto-secondo.
- Ingegneria del traffico intelligente:Routing adattivo e consegna di pacchetti fuori ordine per evitare punti di congestione e massimizzare l'utilizzo del tessuto.
- Telemetria completa:Telemetria della rete in banda (INT) e monitoraggio per flusso per la rilevazione proattiva della congestione e la pianificazione della capacità.
La soluzione è completamenteMCX623106AN-CDAT compatibilePer l'archiviazione, l'architettura supporta NVMe-oF su RoCE con latenza inferiore ai 15 μs,consentire lo stoccaggio condiviso disaggregato per cluster di formazione su larga scala.
3. Il ruolo e le caratteristiche chiave del NVIDIA Mellanox MCX623106AN-CDAT
Come componente fondamentale di questa soluzione, laNVIDIA Mellanox MCX623106AN-CDATsvolge quattro ruoli critici all'interno dell'architettura:
| Funzione | Dettagli di attuazione | Benefici per le imprese |
|---|---|---|
| Motore RDMA/RoCE | RoCE v2 basato su hardware con ECN/PFC, latenza inferiore a 0,6 μs, supporto GPUDirect | Involvimento CPU quasi zero; 8 volte più veloce all-reduce per l'addestramento dell'IA |
| Doppia porta 200GbE | Due porte QSFP112 indipendenti, capacità aggregata di 400 Gb/s | Legamento attivo-attivo per larghezza di banda; standby attivo per ridondanza |
| Interfaccia PCIe 5.0 | PCIe 5.0 x16 (fino a 32 GT/s) con motore DMA avanzato | Elimina il collo di bottiglia dell'interfaccia host per il traffico 200GbE |
| Virtualizzazione e sovrapposizione di carico | SR-IOV con un massimo di 512 VF per porta; VXLAN/NVGRE/IPsec/MACsec offload | Immobili multi-tenancy ad alta densità con sicurezza e prestazioni di linea |
Le principali specifiche tecniche tratte dalFogli di dati MCX623106AN-CDATincludere funzionalità complete di discarico (suma di controllo, LSO/LRO, VLAN stripping/insertion, RSS con fino a 128 code), algoritmi avanzati di controllo della congestione,e supporto completo per le librerie di comunicazioni collettive di NVIDIA (NCCL). ilLe specifiche MCX623106AN-CDATsottolineare inoltre il supporto alla compatibilità 100GbE e 50GbE, offrendo flessibilità di implementazione per ambienti a velocità mista.
4. Raccomandazioni per la distribuzione e la scalabilità
Per i cluster di intelligenza artificiale in campo verde, si raccomanda una topologia a due livelli con accesso a 200 GbE e collegamenti ascendenti a 800 GbE.MCX623106AN-CDAT scheda di adattatore Ethernetcon entrambe le porte QSFP112 collegate a switch separati per la ridondanza.PFC sulla priorità 3 (per il traffico collettivo RDMA) e la priorità 4 (per lo stoccaggio)Si raccomanda di dedicare VLAN separate per RDMA, gestione, archiviazione e traffico tenant per semplificare il monitoraggio e la risoluzione dei problemi.
Per gli ambienti di campo rosso con infrastrutture 100GbE esistenti, ilMCX623106AN-CDAT soluzione per schede di adattamento EthernetPoiché l'adattatore è retrocompatibile con l'ottica 100GbE QSFP56, il cablaggio esistente può essere riutilizzato durante l'aggiornamento graduale a 200GbE.L'adattatore supporta anche la commutazione Ethernet standard senza abilitazione RoCE obbligatoria, consentendo ai team di implementare prima l'hardware e attivare le capacità RDMA in fasi man mano che il tessuto matura e i carichi di lavoro giustificano la transizione.
La scalabilità della soluzione oltre i 500 nodi richiede ulteriori considerazioni.Raccomandiamo di implementare una strategia dedicata di gestione della congestione RoCE utilizzando switch NVIDIA Spectrum-4 con telemetria integrata e regolazione dinamica della soglia ECNPer i cluster che superano i 1.000 nodi, considerare la possibilità di implementare un controller centralizzato di gestione del tessuto (ad esempio, NVIDIA NetQ) per mantenere la visibilità end-to-end e la coerenza della configurazione automatizzata.MCX623106AN-CDAT in venditaL'azienda ha inoltre fornito un'ampia gamma di servizi per la gestione dei sistemi di gestione dei dati, compresi i servizi di gestione dei dati e la gestione dei dati personali.
5. Operazioni, monitoraggio, risoluzione dei problemi e ottimizzazione
Il funzionamento efficace del tessuto RoCE richiede una strategia di monitoraggio e risoluzione dei problemi a più livelli:
- Telemetria a livello di adattatore:IlLe specifiche MCX623106AN-CDATincludono contatori per porta per fotogrammi PFC, pacchetti contrassegnati da ECN, fotogrammi abbandonati, errori di collegamento ed epoche di congestione.
mlx5cmd,Eticole, o strumenti firmware NVIDIA per esportare queste metriche nelle dashboard Prometheus/Grafana con gli avvisi appropriati. - Telemetria di rete in banda (INT):Sfruttare il supporto INT dell'adattatore per tracciare le latenze per flusso e le profondità di coda attraverso il tessuto, consentendo l'identificazione precisa delle fonti di micro-congestione.
- Monitoraggio a livello di interruttore:Monitorare l'occupazione del buffer, il numero di frame in pausa, le profondità di coda e i tassi di marcatura ECN sui switch spine e leaf.L'aumento improvviso dei frame di pausa indica una micro-congestione che potrebbe richiedere l'adeguamento della soglia ECN.
- Metrici a livello di applicazione:Per le applicazioni RDMA, tenere traccia delle latenze di completamento WR (Work Request), degli eventi di sovraccarico CQ (Completion Queue) e dei conteggi di errori QP (Queue Pair) utilizzando le librerie NVIDIA libibverbs e rdma-core.
Scenari comuni di risoluzione dei problemi e azioni raccomandate:
- Deterioramento delle prestazioni RoCE:Verificare che il PFC sia abilitato su tutte le porte dello switch e che il marchio DSCP corrisponda alla configurazione dello switch.Fogli di dati MCX623106AN-CDATper convalidare le impostazioni di allocazione del buffer rispetto ai valori raccomandati per il profilo del carico di lavoro.
- Errori di collegamento o CRC:Controllare la qualità del cavo QSFP112 (assicurare la conformità alle specifiche 200G AOC o DAC) e verificare che il firmware dell'adattatore sia aggiornato all'ultima versione.
- Problemi di prestazione della GPU Direct:Confirmare che GPUDirect sia iniziato correttamente e che la topologia PCIe supporti DMA peer-to-peer senza commutazione intermedia.
- PFC deadlock o tempesta di pausa:Controllare la presenza di priorità mal configurate e assicurarsi che il PFC sia abilitato solo per le classi di traffico RoCE (non per il traffico di gestione o di archiviazione).
Per l'ottimizzazione, raccomandiamo i seguenti parametri di regolazione basati su una vasta convalida di laboratorio:
- Interruzione della fusione (moderazione):impostato su 2 ‰ 4 μs per i carichi di lavoro di addestramento dell'IA per ridurre al minimo la latenza mantenendo l'efficienza della CPU.
- RDMA MTU:Aumentare a 4096 byte per le comunicazioni all-reduce per ridurre i costi generali del protocollo e migliorare il throughput.
- RSS (Receive Side Scaling):Configurare tra più core CPU per il traffico non RDMA per distribuire l'elaborazione ed evitare la saturazione di un singolo core.
- Limiti ECN:Impostare una soglia minima del 40% del buffer e una soglia massima del 75% per il traffico di priorità 3, adeguandosi in base ai modelli di congestione osservati e alle caratteristiche del carico di lavoro.
6. Riassunto e valutazione del valore
IlNVIDIA Mellanox MCX623106AN-CDATLa soluzione offre un valore di trasformazione per i moderni data center su scala AI. Sostituendo il TCP/IP basato su software con RDMA/RoCE e GPUDirect accelerati da hardware,le organizzazioni possono ottenere riduzioni della latenza a livello di applicazione di 8 ‰ 10xInfine, la Commissione ha deciso di ridurre di oltre l'85% le spese di rete delle CPU e di aumentare l'utilizzo delle GPU da meno del 70% a oltre il 95%.MCX623106AN-CDAT scheda di adattatore Ethernetfornisce un percorso conveniente per l'adozione di 200GbE con protezione degli investimenti attraverso la retrocompatibilità a 100GbE e le capacità di scarico future per carichi di lavoro emergenti.
Nel valutare il costo totale di proprietà, ilMCX623106AN-CDAT prezzoè compensato da un notevole risparmio operativo: tempo di formazione ridotto (accelerazione del time-to-market), minor numero di server (a causa di una maggiore utilizzazione della GPU),riduzione dei costi di raffreddamento (grazie al consumo di energia < 20 W), e l'eliminazione di tessuti InfiniBand separati.MCX623106AN-CDAT compatibilecon i principali stack software AI e HPC, tra cui le librerie NVIDIA NCCL, PyTorch, TensorFlow e MPI, garantendo un'ampia applicabilità nelle distribuzioni aziendali, cloud e di ricerca.
Per scrittori di distribuzione dettagliati, modelli di configurazione e rapporti di performance di riferimento, consultare il sito ufficialeFogli di dati MCX623106AN-CDATQuesto white paper serve da base ∙ l'architettura è convalidata, i componenti sono pronti per la produzione,e i benefici sono misurabili. ilMCX623106AN-CDAT Adapter ConnectX scheda di rete PCIenon è solo un adattatore, è un fattore strategico per il data center del futuro pronto per l'intelligenza artificiale e a bassa latenza.

