Mellanox (NVIDIA Mellanox) 980-9I45T-00H020 White Paper Tecnico | Connettività ad alta affidabilità e ottimizzazione delle operazioni

September 1, 2026

Mellanox (NVIDIA Mellanox) 980-9I45T-00H020 White Paper Tecnico | Connettività ad alta affidabilità e ottimizzazione delle operazioni

Mellanox (NVIDIA Mellanox) 980-9I45T-00H020 Libro bianco tecnico

Questo libro bianco si concentra sulMellanox (NVIDIA Mellanox) 980-9I45T-00H020Il progetto di programmazione è stato realizzato con l'obiettivo di sviluppare un sistema integrato per la gestione dei dati e dei sistemi di gestione dei dati.980-9I45T-00H020è una soluzione di interconnessione ad alte prestazioni progettata per gestire i carichi di lavoro più esigenti nei cluster di IA, negli ambienti HPC e nelle infrastrutture mission-critical.

1. Sfondamento e requisiti aziendali

I moderni data center si stanno spostando da architetture centrate sulla CPU a progetti guidati da GPU e DPU.latenzaAllo stesso tempo, le reti aziendali si trovano ad affrontare sfide nell'interconnessione multi-site, nell'accesso multi-cloud e nella conformità normativa.rendere inadeguate le architetture di rete tradizionali a tre livelli per una scalabilità aziendale elastica.

L'introduzione dellaMellanox (NVIDIA Mellanox) 980-9I45T-00H020affronta i seguenti punti critici di dolore:

  • Guasti di bottiglia delle prestazioni: le reti 25G/40G esistenti non possono soddisfare i requisiti di traffico nord-sud dei cluster GPU di classe 800G;
  • Complessità operativa: le apparecchiature di più fornitori comportano un monitoraggio in silos e un tempo medio di riparazione prolungato (MTTR);
  • Lacunas di affidabilità: i guasti dei collegamenti e gli eventi di congestione causano un significativo degrado delle prestazioni delle applicazioni e violazioni degli SLA.

Le principali metriche di successo per questa soluzione includono latenza sotto-microsegundo, perdita di pacchetti zero sotto congestione e rilevamento e correzione automatizzati dei guasti.

2. Progettazione complessiva dell'architettura di rete

L'architettura proposta adotta untessuti di foglie di spina dorsaleIn questo caso, il sistema è dotato di una topologia a due livelli di Clos, che consente una bassa latenza deterministica e una grande capacità di scalabilità.980-9I45T-00H020 prodotto di reteIl sistema di connessione è basato su un sistema di connessione a GPU e a nodi di archiviazione tramite porte OSFP 800G/400G.

I principali principi architettonici includono:

  • Tessuti RDMA a perdita zero: sfruttare il controllo del flusso RoCEv2 e PFC/ECN per garantire il trasporto senza perdite per NVMe-oF e GPUDirect Storage;
  • Routing adattivo: selezione dinamica del percorso basata sulla telemetria in tempo reale, evitando collegamenti congestionati senza intervento manuale;
  • Isolamento multi-tenant: Il supporto di sovrapposizioni VXLAN e GENEVE basato su hardware consente una segmentazione sicura per carichi di lavoro misti AI, HPC e di uso generale.

L'architettura è progettata per supportare fino a 2.048 nodi GPU per capsula di tessuto, con il980-9I45T-00H020 data center rete ad alta velocitàdispositivo che funge da nodo di bordo primario per la connettività di calcolo/memoria.

3. Il ruolo di Mellanox (NVIDIA Mellanox) 980-9I45T-00H020 nella soluzione

IlMellanox (NVIDIA Mellanox) 980-9I45T-00H020è un adattatore/switch di rete multifunzione che collega il bus host (PCIe 6.0) e il tessuto (InfiniBand o Ethernet).

  • Trasmissione a velocità di cavo 800G: supporta XDR InfiniBand e 800GbE, fornendo spazio sufficiente per le future generazioni di GPU (ad esempio, B100, X100);
  • Offload di elaborazione in rete (SHARPv3): Riduce il tempo di comunicazione collettiva MPI fino al 30% eseguendo operazioni di aggregazione direttamente nel tessuto di rete;
  • Telemetria hardware: la rilevazione integrata della congestione (ad esempio, marcatura ECN, limitazione della portata) fornisce una visibilità granulare della dinamica della coda senza sovraccarico della CPU;
  • Sicurezza avanzata: Hardware root di fiducia, avvio sicuro e crittografia IPSec/MACsec in linea proteggono i dati in transito dagli attacchi a livello fisico.

Come un980-9I45T-00H020 soluzione di prodotto di rete, si integra perfettamente con gli switch Mellanox esistenti e con lo stack software NVIDIA DOCA, riducendo il rischio di integrazione e accelerando i tempi di produzione.

4. Raccomandazioni per la distribuzione e la scalabilità

Gli scenari di distribuzione tipici includono:

  • Piccole dimensioni (fino a 64 GPU): Disponibilità a due scaffali con 1x980-9I45T-00H020per server, utilizzando cavi DAC OSFP-OSFP di collegamento diretto per la comunicazione intra-rack a bassa latenza;
  • Grandi (256+ GPU): Architettura multi-pod con980-9I45T-00H020dispositivi che aggregano gli switch a foglia tramite collegamenti ascendenti 800G agli switch a spina dorsale, consentendo una larghezza di banda di bisezione completa;
  • tessuto di stoccaggio AI + ibridoIl980-9I45T-00H020può essere configurato con la divisione delle porte (2x 400G o 8x 100G) per servire simultaneamente reti di calcolo e di archiviazione, riducendo il capex.

Illustrazione della topologia (semplificata):

Componente Quantità Interconnessione
Servitori GPU (8 GPU ciascuno) 32 1x 980-9I45T-00H020 per server
Leaf Switches (32-port 800G) 8 Collegamento ascendente alla colonna vertebrale tramite 800G
Spine Switches (64-port 800G) 4 di larghezza inferiore o uguale a 30 cm

Per l'espansione futura, l'architettura supporta la scalabilità pay-as-you-grow aggiungendo blocchi di foglie aggiuntivi senza ridisegnare lo strato spinale.

5. Ops Monitoraggio, risoluzione dei problemi e ottimizzazione

Il980-9I45T-00H020si integra con la stack di telemetria di NVIDIA per fornire visibilità in tempo reale su:

  • Rilevazione di micro-raffiche: segnalazione a livello hardware dell'occupazione del buffer per flusso, consentendo adeguamenti preventivi di QoS;
  • Monitoraggio della qualità dei collegamenti: contatori FEC (Forward Error Correction) e avvisi del rapporto segnale/rumore per il degrado del collegamento ottico;
  • Simulazione della rete: utilizzando i dati telemetrici incorporati per ricostruire i modelli di traffico in un ambiente digitale gemello per l'analisi "e se".

Le migliori pratiche operative raccomandate:

  • Impostareprofili automatizzati di riferimentoper la latenza e il rendimento sotto carico normale, e attivare gli avvisi quando le deviazioni superano il 10%;
  • Controlli periodiciversioni del firmwaregarantire la compatibilità con le ultime versioni di NVIDIA DOCA e driver;
  • Utilizzare il980-9I45T-00H020 specifiche- e980-9I45T-00H020 scheda datiper calibrare le soglie di buffer per specifici mix di traffico (ad esempio, modelli di riduzione totale rispetto a modelli di riduzione totale);
  • Al momento della scala, convalidare980-9I45T-00H020 compatibilel'ottica e i cavi utilizzando la matrice ufficiale di compatibilità per evitare problemi di integrità del segnale.

6. Riassunto e valutazione del valore

IlMellanox (NVIDIA Mellanox) 980-9I45T-00H020offre un percorso comprovato per la costruzione di reti di data center altamente affidabili ed operativamente efficienti.La telemetria granulare consente alle organizzazioni di raggiungere:

  • Riduzione del 30-40% del tempo di completamento della formazione sull'IAattraverso una comunicazione collettiva ottimizzata;
  • Impatto zero dell'utente durante i guasti del collegamentograzie al routing adattivo e al failover sub-second;
  • 50% in meno di spese generali operativetramite monitoraggio unificato e flussi di lavoro di bonifica automatizzati.

Con il980-9I45T-00H020 prodotto di reteCome base, le aziende possono implementare con sicurezza carichi di lavoro di IA di nuova generazione mantenendo il pieno controllo sull'affidabilità, la sicurezza e il costo totale di proprietà.980-9I45T-00H020 prezzo- e980-9I45T-00H020 in venditaPer qualsiasi richiesta, contattate il vostro partner autorizzato NVIDIA Mellanox.