NVIDIA Mellanox MCX631102AN-ADAT in azione: RDMA/RoCE Trasporto a bassa latenza e ottimizzazione del throughput del server
July 27, 2026
NVIDIA Mellanox MCX631102AN-ADAT in azione: RDMA/RoCE Trasporto a bassa latenza e ottimizzazione del throughput del server
Sfondo e sfide: la latenza e il collo di bottiglia del throughput nello storage distribuito
Un fornitore di servizi cloud di medie dimensioni che gestisce un cluster di archiviazione Ceph distribuito su 120 server x86 ha iniziato a sperimentare problemi di prestazioni in aumento.basandosi su TCP/IP per la comunicazione internodoI sintomi principali includono un'elevata utilizzazione della CPU superiore al 45% sui nodi di archiviazione a causa dell'elaborazione del protocollo di rete,la latenza media di lettura/scrittura supera i 3 millisecondi durante le ore di punta;, e un divario significativo tra il throughput teorico del disco e le prestazioni reali fornite dalla rete.Il team di ingegneri ha riconosciuto che il raggiungimento di una latenza inferiore al millisecondo e il pieno sfruttamento delle prestazioni NVMe richiedevano un cambiamento fondamentale nell'approccio alla rete, l'adozione di RDMA su Ethernet convergente (RoCE).
Soluzione e implementazione: introduzione della soluzione per schede di adattamento Ethernet MCX631102AN-ADAT
Dopo aver valutato molteplici opzioni di fornitore, il team ha selezionato ilNVIDIA Mellanox MCX631102AN-ADATIl programma di sviluppo di una rete di telecomunicazioniMCX631102AN-ADAT ConnectX-6 Lx a doppia porta 25GbE SFP28l'adattatore è stato scelto per il suo supporto nativo RoCEv2, il controllo della congestione basato su hardware e l'integrazione senza soluzione di continuità con la loro infrastruttura di cablaggio SFP28 esistente.
La strategia di attuazione è stata suddivisa in tre gruppi:
- Fase 1 (Pilota):16 nodi di archiviazione sono stati dotati delMCX631102AN-ADAT scheda di adattatore EthernetGli adattatori sono stati configurati in modalità attiva-attiva a doppia porta, con ciascuna porta collegata a una coppia di switch NVIDIA Spectrum per la ridondanza.
- Fase 2 (ottimizzazione):RoCEv2 è stato abilitato con Priority Flow Control (PFC) e Explicit Congestion Notification (ECN) sintonizzati per prevenire i cadute della rete.Il team ha sfruttato i motori di scarico hardware dell'adattatore per NVMe-oF e calcoli di erasure coding.
- Fase 3 (Rollout completo):Tutti i 120 nodi sono stati migrati alNVIDIA Mellanox MCX631102AN-ADAT, con il Ceph OSD (Object Storage Daemon) networking stack riconfigurato per utilizzare il trasporto RDMA.
Secondo ilFogli di dati MCX631102AN-ADAT, l'interfaccia PCIe 4.0 x8 dell'adattatore fornisce ampia larghezza di banda per gestire il throughput aggregato di 50 Gb/s.Le specifiche MCX631102AN-ADATL'adattatore si è anche dimostrato di essere in grado di soddisfare i loro requisiti di prestazione più severi.MCX631102AN-ADAT compatibilecon la loro distribuzione Linux esistente (RHEL 9.2) e i driver Mellanox OFED, semplificando significativamente il processo di distribuzione.
Risultati e benefici: guadagni misurabili in latenza e throughput
L'impatto della migrazione è stato immediatamente evidente nelle metriche di produzione.
| Metrica | Pre-upgrade (10GbE TCP/IP) | Post-upgrade (MCX631102AN-ADAT con RoCE) | Miglioramento |
|---|---|---|---|
| Telatenza media di lettura | 2.8 ms | 0.4 ms | Riduzione 7x |
| Latenza media di scrittura | 3.2 ms | 0.5 ms | 6.4× riduzione |
| Utilizzazione della CPU del nodo (Stack di rete) | 42% | 11% | 31 pp liberato |
| Trasmissione aggregata dei cluster | 18 Gb/s | 42 Gb/s | 2.3x aumento |
Oltre ai numeri, il team ha osservato significativi miglioramenti operativi.MCX631102AN-ADATha consentito una migrazione in tempo reale senza soluzione di continuità delle VM che eseguono applicazioni sensibili alla latenza, poiché il jitter della rete è sceso a livelli trascurabili.L'offload NVMe-oF basato sull'hardware ha ridotto la latenza di accesso allo storage di un ulteriore 30%, che consente al cluster di gestire carichi di lavoro di lettura/scrittura misti con tempi di risposta coerenti sotto-millisecondi.MCX631102AN-ADAT prezzoIl fornitore ha inoltre osservato che il miglioramento del throughput di 2,3 volte e la possibilità di rinviare gli acquisti di server aggiuntivi di almeno 18 mesi hanno dimostrato di essere giustificati.MCX631102AN-ADAT in venditaLe opzioni offerte attraverso i partner di canale offrono sconti flessibili sul volume per le distribuzioni su larga scala.
Inoltre, le funzionalità integrate dell'adattatore per la telemetria e la gestione fuori banda sono dettagliate nelFogli di dati MCX631102AN-ADAT- ha fornito una visibilità approfondita sullo stato della rete, consentendo una gestione proattiva della congestione e un'analisi più rapida delle cause profonde durante la risoluzione degli incidenti.
Riassunto e prospettive: una base strategica per i futuri carichi di lavoro
Questo impiego nel mondo reale dimostra che laNVIDIA Mellanox MCX631102AN-ADATè molto più di un semplice aggiornamento della larghezza di banda.MCX631102AN-ADAT soluzione per schede di adattamento Ethernetper gli ambienti abilitati a RoCE, elimina efficacemente la rete come collo di bottiglia delle prestazioni, sbloccando il pieno potenziale delle moderne architetture di archiviazione NVMe e CPU.La combinazione di portature doppie di portata 25GbE, completa RDMA offloads, e ampia compatibilità ecosistema posiziona questo adattatore come un investimento strategico per qualsiasi organizzazione che prevede di scalare AI / ML pipelines, database distribuiti,o infrastrutture iperconvergenti.
Guardando al futuro, il team sta esplorando casi di utilizzo estesi, tra cui l'integrazione di NVIDIA DOCA per percorsi di dati programmabili e il provisioning zero-touch.potenziamento della portata, e recuperare le risorse della CPU, ilMCX631102AN-ADATdefinisce un nuovo punto di riferimento per gli adattatori per server 25GbE in ambienti aziendali e cloud.

