Mellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0 InfiniBand Switch Soluzione tecnica
July 15, 2026
Mellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0 Soluzione tecnica switch InfiniBand | Ottimizzazione dell'interconnessione a bassa latenza per cluster RDMA/HPC/AI
1. Contesto del progetto e analisi dei requisiti
I moderni framework di formazione AI e le applicazioni HPC sono sempre più vincolati dalle prestazioni di interconnessione di rete piuttosto che dalla sola densità di calcolo. I lavori di formazione distribuiti, in particolare quelli che utilizzano modelli linguistici di grandi dimensioni, generano modelli di traffico massicci e sincronizzati di riduzione e tutto a tutti che travolgono i tradizionali tessuti Ethernet. I requisiti chiave identificati nelle implementazioni aziendali includono: latenza dello switch inferiore al microsecondo per ridurre al minimo il sovraccarico di comunicazione, throughput non bloccante su larga scala per eliminare gli abbonamenti in eccesso, controllo avanzato della congestione per gestire burst incast e integrazione perfetta con RDMA over Converged Ethernet (RoCE) o ecosistemi InfiniBand nativi. Inoltre, i team operativi richiedono una telemetria approfondita per il rilevamento proattivo dei guasti e una gestione semplificata su centinaia di porti.
2. Progettazione complessiva dell'architettura di rete/sistema
L'architettura proposta è incentrata su una topologia leaf-spine a due livelli, creata appositamente per carichi di lavoro incentrati sulla GPU. Nello strato fogliare, ogni rack ospita ilMellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0come switch ToR (Top-of-Rack) primario, collegando fino a 40 nodi di elaborazione tramite collegamenti NDR da 400 Gb/s. Lo strato della colonna vertebrale è costituito da un secondo livello di920-9B210-00FN-0D0 MQM9790-NS2F NDR da 400 Gb/sswitch, che forniscono connettività full-mesh con sottoscrizione in eccesso 4:1 o completamente non bloccante se implementati con porte spine sufficienti. Questo design supporta fino a 512 nodi GPU in un singolo dominio fabric, con la possibilità di scalare orizzontalmente tramite più sottoreti interconnesse tramite UFM (Unified Fabric Manager) di NVIDIA.
L'architettura sfrutta il motore di elaborazione in rete SHARPv3 (Scalable Hierarchical Aggregation and Reduction Protocol) di NVIDIA, scaricando le operazioni collettive direttamente sull'ASIC dello switch. Ciò riduce il volume dei dati che attraversano i bus di memoria CPU/GPU e riduce la latenza delle operazioni collettive fino al 40% rispetto agli approcci basati su software. IL920-9B210-00FN-0D0 Interruttore InfiniBand OPNsupporta inoltre il routing adattivo, che seleziona dinamicamente il percorso meno congestionato per ciascun pacchetto, garantendo un utilizzo ottimale della larghezza di banda anche in caso di carichi di traffico asimmetrici.
3. Ruolo e caratteristiche principali del 920-9B210-00FN-0D0 nella soluzione
ILNVIDIA Mellanox 920-9B210-00FN-0D0funge da elemento fondamentale per l'intero tessuto di interconnessione. I suoi ruoli principali includono:
- Aggregazione ad alta densità:Con un massimo di 64 porte non bloccanti da 400 Gb/s in un fattore di forma 2U, lo switch offre una capacità di commutazione aggregata di 25,6 Tb/s. Questa densità riduce il numero di switch necessari per rack, semplificando il cablaggio e riducendo il consumo energetico per porta.
- Commutazione a latenza ultrabassa:Lo switch mantiene una latenza inferiore a 600 ns per pacchetti di qualsiasi dimensione, fondamentale per le applicazioni sensibili alla latenza di coda come l'inferenza online e l'HPC finanziario.
- Elaborazione in rete:L'integrazione SHARPv3 consente l'accelerazione hardware delle operazioni collettive, riducendo il numero di attraversamenti attraverso la struttura e migliorando i tempi complessivi di completamento dei lavori fino al 30%.
- Telemetria avanzata e controllo della congestione:Lo switch fornisce visibilità per flusso, contrassegnando i flussi congestionati per le regolazioni lato host e consentendo un avviso tempestivo di hotspot in arrivo.
Secondo ilScheda tecnica 920-9B210-00FN-0D0, lo switch supporta ricetrasmettitori QSFP-DD sia in rame che ottici, rendendoloCompatibile con 920-9B210-00FN-0D0con l'infrastruttura di cablaggio esistente nella maggior parte dei data center. Il flusso d'aria fronte-retro e gli alimentatori ridondanti garantiscono un'elevata disponibilità negli ambienti aziendali.
4. Raccomandazioni per la distribuzione e la scalabilità (topologia tipica)
Per un'implementazione greenfield di 128 nodi GPU, consigliamo un'architettura a due livelli con 4 switch foglia e 2 switch spine, ciascuna spina si collega a ogni foglia tramite uplink 4x400 Gb/s, con un conseguente rapporto di sottoscrizione in eccesso di 2:1, accettabile per la maggior parte dei carichi di lavoro di formazione. Per le applicazioni sensibili alla latenza o con larghezza di banda elevata, è possibile ottenere un design 1:1 non bloccante aumentando il numero di spine a 4, ottenendo una capacità aggregata di uplink pari alle porte di downlink.
Per scalare oltre i 512 nodi è necessario partizionare il Fabric in più sottoreti, ciascuna gestita da UFM come un'isola Fabric distinta. La comunicazione tra sottoreti può essere instradata attraverso i gateway Quantum-2 di NVIDIA o tramite routing basato su host, sebbene l'approccio consigliato per i carichi di lavoro sensibili alle prestazioni sia quello di mantenere la struttura all'interno di un'unica sottorete, ove possibile. ILSpecifiche 920-9B210-00FN-0D0supportano queste topologie su larga scala, con controllo di flusso integrato e controllo di flusso basato sulla priorità (PFC) per impedire la perdita di pacchetti durante gli eventi di reindirizzamento del percorso.
Quando si pianifica il cablaggio fisico, prendere in considerazione l'utilizzo di cavi breakout da MPO a QSFP-DD per le connessioni spine-foglia per ridurre la densità dei cavi o cavi ottici attivi (AOC) per distanze superiori a 3 metri. IL920-9B210-00FN-0D0 in venditain genere include un kit di accessori completo, ma consigliamo di convalidare la compatibilità del ricetrasmettitore di terze parti tramite la matrice di interoperabilità del fornitore per evitare problemi di formazione del collegamento.
5. Operazioni, monitoraggio e diagnosi dei guasti
L’eccellenza operativa è una pietra angolare del920-9B210-00FN-0D0 Soluzione OPN switch InfiniBand. Lo switch si integra perfettamente con la piattaforma UFM di NVIDIA, che fornisce:
- Monitoraggio dello stato del tessuto in tempo reale:Dashboard per stato del collegamento, temperatura, consumo energetico e contatori di errori per porta (errori CRC, simboli ed allineamento).
- Analisi predittiva dei guasti:I modelli di machine learning su UFM identificano in modo proattivo le ottiche difettose o i collegamenti deteriorati prima che causino errori di lavoro.
- Risoluzione dei problemi automatizzata:Il sistema consiglia azioni correttive, come reindirizzare il traffico o isolare collegamenti difettosi, riducendo significativamente il tempo medio di risoluzione (MTTR).
Per la diagnostica avanzata, lo switch supporta sFlow e il mirroring delle porte, consentendo l'ispezione approfondita dei pacchetti per il debug a livello di protocollo. I team possono anche accedere ai dettagliSpecifiche 920-9B210-00FN-0D0per le soglie del buffer e le impostazioni consigliate, in particolare per l'ottimizzazione del traffico RoCEv2 se utilizzato in ambienti misti InfiniBand/Ethernet. L'ottimizzazione delle prestazioni dovrebbe concentrarsi sulle soglie di routing adattivo e sugli intervalli di aggregazione SHARPv3, che possono essere regolati in base alla fase del carico di lavoro, ad esempio addestramento rispetto a inferenza.
La manutenzione ordinaria include gli aggiornamenti del firmware, che vengono eseguiti con interruzioni minime utilizzando la funzionalità di aggiornamento progressivo di UFM, e la pulizia periodica dei connettori ottici per mantenere l'integrità del segnale. I moduli di alimentazione e ventola ridondanti dello switch consentono la sostituzione a caldo durante il funzionamento.
6. Riepilogo e valutazione del valore
ILMellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0offre una soluzione completa per le organizzazioni che cercano di sfruttare appieno le prestazioni dei propri investimenti in AI e HPC. Combinando velocità NDR da 400 Gb/s, elaborazione in rete e gestione intelligente della congestione all'interno di un'unica piattaforma scalabile, affronta le sfide di interconnessione più urgenti affrontate dai data center di oggi. L'architettura descritta fornisce un percorso comprovato da cluster pilota da 128 nodi a strutture di supercalcolo da oltre 2.000 nodi, con strumenti operativi che semplificano la gestione e riducono il costo totale di proprietà.
Nel valutare il920-9B210-00FN-0D0 prezzo, considera il valore a lungo termine: i tempi ridotti di completamento dei processi si traducono direttamente in costi del cloud inferiori o in tempi di insight più rapidi per i carichi di lavoro on-premise. IL920-9B210-00FN-0D0 Soluzione OPN switch InfiniBandè supportato dalla rete di supporto globale di NVIDIA e dall'ampio ecosistema di partner, garantendo che le organizzazioni possano implementare, scalare e ottimizzare con sicurezza la propria infrastruttura per gli anni a venire.
Per la pianificazione dettagliata, fare riferimento al funzionarioScheda tecnica 920-9B210-00FN-0D0ESpecifiche 920-9B210-00FN-0D0documento, che include disegni meccanici, profili termici e parametri di riferimento delle prestazioni.

