Pure Storage Reference Architecture per NVIDIA Enterprise AI Factory accelera l’intelligenza su vasta scala

Avere una base flessibile e potente per il panorama dell’AI di oggi e di domani è cruciale. Una nuova piattaforma di fabbrica AI convalidata di NVIDIA e Pure Storage è stata progettata appositamente per l’AI di livello enterprise moderno.

NVIDIA Enterprise AI Factory

Sintesi

The Pure Storage with NVIDIA Enterprise AI Factory reference architecture is a jointly engineered solution that combines NVIDIA’s cutting-edge AI computation and orchestration capabilities with high-performance flash storage from Pure Storage.

image_pdfimage_print

Pure Storage AI Factory con NVIDIA è una piattaforma di infrastruttura AI convalidata progettata per accelerare i progetti di AI aziendale. Man mano che i modelli di AI e i sistemi di ragionamento diventano sempre più complessi, questa soluzione ha lo scopo di accelerare le informazioni approfondite semplificando al contempo le operazioni.

Progettato appositamente per l’AI di livello enterprise moderno

L’IT tradizionale fatica a soddisfare le esigenze dei moderni workload di AI, garantendo continuamente la produttività dei team di calcolo e AI. D’altro canto, lo storage AI a performance elevate deve integrare funzionalità aziendali come uptime, agilità e resilienza garantiti. La soluzione Pure Storage per la progettazione convalidata da NVIDIA Enterprise AI Factory risolve questi problemi con un’architettura semplice da utilizzare, integrata, a performance elevate e resiliente. Supporta workload avanzati come l’AI generativa e la computer vision combinando le più recenti piattaforme software e di calcolo accelerato di NVIDIA con lo storage Pure Storage® FlashBlade//S™, offrendo le performance e la scalabilità necessarie per l’addestramento e l’inferenza di modelli su larga scala. Pure Storage FlashBlade//S è un sistema di storage NVIDIA-Certified™ scalabile per supportare fino a 1.024 GPU NVIDIA e più petabyte di dati, con una rete ad alta velocità che integra strettamente elaborazione e storage. 

  • Aggiornamenti non disruptive: FlashBlade consente aggiornamenti data-in-place, consentendo l’espansione o i refresh senza downtime, a differenza dello storage tradizionale che spesso richiede interruzioni pianificate.
  • Facilità d’uso: Una piattaforma unificata semplifica la pipeline dei dati AI dall’acquisizione all’inferenza, progettata per consentire agli sviluppatori IT e AI aziendali di operare con il minimo fastidio.
  • Performance costanti: L’architettura offre performance affidabili su qualsiasi scala, consentendo alle organizzazioni di far crescere i deployment senza downtime o perdita di performance.
  • Agilità e a prova di futuro: Il design aperto e modulare supporta l’evoluzione delle tecnologie di AI ed evita il lock-in dei vendor, massimizzando la flessibilità e l’interoperabilità.
  • Efficienza: L’alta densità e il minor consumo energetico di FlashBlade riducono l’ingombro del data center e i costi operativi, mentre lo stack unificato semplifica la manutenzione.

Configurazioni convalidate 

Insieme, Pure Storage, NVIDIA e altri partner di sistema stanno costruendo prodotti, software e servizi per accelerare il passaggio dell’IT aziendale a una fabbrica di AI. In seguito alla progettazione convalidata da NVIDIA Enterprise AI Factory, Pure è leader nella creazione di una nuova classe di infrastruttura on-premise, con server NVIDIA-Certified RTX™ PRO e HGX Blackwell, rete Ethernet NVIDIA Spectrum™-X, DPU NVIDIA BlueField® e software NVIDIA AI Enterprise abbinati ai sistemi di storage NVIDIA-Certified di Pure. 

Le soluzioni di progettazione convalidate da NVIDIA Enterprise AI Factory si basano su configurazioni hardware consigliate da NVIDIA Enterprise Reference Architectures (Enterprise RA), personalizzate per deployment di livello enterprise da 4 a 32 nodi con 16-256 GPU. Ogni RA aziendale segue un modello di progettazione prescrittivo, chiamato Reference Configuration, costruito su un server NVIDIA-Certified per garantire performance ottimali in un cluster. Queste configurazioni di riferimento standardizzano la descrizione dei nodi di elaborazione in base alle specifiche di CPU, GPU, rete e larghezza di banda. La nomenclatura C-G-N-B semplifica la selezione del sistema indicando chiaramente la potenza di calcolo, le capacità di rete e le performance della larghezza di banda. Ogni cifra (ad es. 2-8-5-200) si riferisce al numero di socket CPU, al numero di GPU, al numero di schede di rete (NIC, SuperNIC o DPU) e alla larghezza di banda East-West media per GPU (GbE), rispettivamente.

Per semplificare l’adozione, Pure Storage ha allineato i propri sistemi con le configurazioni di riferimento utilizzate nella progettazione convalidata da NVIDIA Enterprise AI Factory, consentendo un deployment e una scalabilità semplici di sistemi bilanciati che evitano colli di bottiglia e performance non ottimali. Di seguito sono riportate le configurazioni di riferimento ripetibili progettate e testate da Pure. 

Questi rappresentano elementi costitutivi convalidati che i clienti e gli OEM partner possono utilizzare per implementare la soluzione su diverse scale. Ecco cosa significano:

  • 2-4-3-200 (ottimizzato PCIe): Un nodo di calcolo con 2 CPU, 4 GPU, 3 NIC/DPU ad alta velocità e una larghezza di banda di rete di 200 Gbps per GPU.It potrebbe corrispondere a un server certificato NVIDIA con quattro GPU PCIe (NVIDIA L40S o GPU NVIDIA RTX PRO 6000 Blackwell Server Edition o NVIDIA H100 NVL per modelli di grandi dimensioni) e tre interfacce Ethernet da 200Gb (spesso sfruttando le DPU NVIDIA BlueField-3 per gli offload). Il blocco di costruzione 2-4-3-200 offre un punto di ingresso bilanciato per le fabbriche di AI, sufficiente per attività come l’addestramento di piccoli modelli e la messa a punto o la fornitura di modelli di medie dimensioni in produzione. Le aziende possono iniziare con un cluster di questi server 4-GPU sapendo che l’architettura sarà scalabile in modo prevedibile.
  • 2-8-5-200 (ottimizzato PCIe): Un nodo più grande basato su PCIe con 2 CPU, 8 GPU, 5 NIC/DPU e larghezza di banda di rete di 200 Gbps per GPU. Con otto GPU in un singolo nodo, questa configurazione offre più calcolo AI per server, adatto per lavori di addestramento più pesanti o farm di inferenza consolidati. Questa configurazione si allinea al server NVIDIA RTX PRO annunciato di recente, con un massimo di otto GPU RTX PRO 6000 Blackwell Server Edition. Lo schema di progettazione “2-8-5” garantisce un numero ancora maggiore di larghezza di banda di rete e adattatori per gestire l’aumento del numero di GPU, mantenendo una pipeline completa di 200 Gb/s per ciascuna GPU. I casi d’uso includono l’addestramento di modelli di medie e grandi dimensioni (come i modelli NLP moderati o i modelli di visione) e l’inferenza ad alta velocità di trasmissione per molti utenti simultanei. Questa configurazione può essere fornita tramite server come i sistemi HGX A100/H100 PCIe certificati NVIDIA o progetti OEM personalizzati che soddisfano le specifiche. Fornisce un’eccellente opzione di scale-up, pur utilizzando il fabric Ethernet standard.
  • 2-8-9-400 (ottimizzazione HGX): Una configurazione di fascia alta con 2 CPU, 8 GPU (in un fattore di forma NVIDIA HGX), 9 adattatori di rete e 400 Gbps di rete per GPU. Ciò corrisponde a una piattaforma NVIDIA HGX (ad es. HGX H100 o HGX H200 imminente) in cui 8 GPU SXM sono collegate tramite NVIDIA NVLink con larghezza di banda GPU-GPU ultra elevata (nell’ordine interno di 900 GB/s). Le interfacce di rete “9” (come le DPU BlueField-3 o le NIC NVIDIA ConnectX-7) offrono un’enorme velocità di trasmissione aggregata, 8 volte superiore a 400Gb per le GPU, oltre ad extra per lo storage o la comunicazione inter-cluster, fornendo in modo efficace 400Gb/s a ciascuna GPU per i workload più intensivi di I/O. Questo modello 2-8-9-400 è destinato agli scenari più esigenti: training su modelli di grandi dimensioni (modelli multimiliardari), inferenza pesante su input contestuali di grandi dimensioni o qualsiasi workload di AI in cui la velocità di trasmissione massima e la bassa latenza sono fondamentali. Data la sua potenza, si adatta naturalmente a casi d’uso come l’AI generativa avanzata, la simulazione complessa o il servizio di inferenza su larga scala.

Queste configurazioni di riferimento possono essere scalate a livello di cluster. Ad esempio, una fabbrica di AI potrebbe iniziare con (4) 2-8-5-200 nodi e in seguito espandere fino a 32 nodi per cluster: lo storage FlashBlade e la rete Ethernet NVIDIA Spectrum-X saranno scalati di conseguenza (la guida viene fornita per quanti chassis e uplink FlashBlade sono necessari man mano che uno cresce, garantendo la scalabilità lineare). Questo offre alle aziende un percorso di crescita chiaro e modulare: Inizia con un elemento costitutivo comprovato e aggiungine altri man mano che la domanda di AI cresce.

Per garantire un’ampia accessibilità, NVIDIA e Pure Storage stanno convalidando soluzioni con i principali OEM di server per portare sul mercato questi elementi costitutivi AI AI Factory. I server Dell Technologies, HPE e Supermicro saranno testati con le piattaforme NVIDIA Blackwell combinate con Pure Storage FlashBlade come soluzioni AI Factory complete. Ciò accelererà la progettazione e il deployment di NVIDIA AI Factory con il vendor scelto dal cliente e fornirà la certezza che le soluzioni siano completamente convalidate secondo le specifiche di NVIDIA-Pure Storage.

La AI Factory non è un’unica appliance black-box, ma piuttosto un’architettura di riferimento aperto su cui più vendor possono basarsi. Le aziende possono adottare la soluzione tramite il vendor hardware che preferiscono o addirittura integrare i componenti seguendo la progettazione di riferimento. Questa apertura contrasta con alcuni approcci concorrenti che legano i clienti all’ecosistema di un vendor. In tutti i casi, il cliente trae vantaggio dalla progettazione convalidata congiuntamente e dal lavoro di integrazione rigoroso svolto dai team di progettazione.

Stack software unificato: NVIDIA Base Command Manager, Run:AI e Portworx di Pure Storage

Una caratteristica distintiva di NVIDIA-Pure Storage AI Factory è il suo stack software unificato per l’orchestrazione dei dati e dell’elaborazione. Qui giocano un ruolo tre componenti software chiave: NVIDIA Base Command Manager, Portworx® di Pure Storage e NVIDIA Run:AI. Insieme formano un livello coeso che semplifica l’esecuzione dell’AI su vasta scala:

  • NVIDIA Base Command Manager è una soluzione di gestione dei cluster che offre un deployment rapido e automatizza il provisioning e l’amministrazione per cluster di qualsiasi dimensione. In AI Factory, Base Command Manager fornisce funzionalità di provisioning, monitoraggio e gestione in un unico strumento che copre l’intero ciclo di vita del cluster. Integrando Base Command Manager, AI Factory garantisce che le organizzazioni ottimizzino l’uso delle risorse cluster. Il software include dashboard per la visualizzazione dell’utilizzo dei cluster e dei dati sanitari per ottimizzare le performance o rilevare i problemi (in questo modo vengono creati “strumenti di ottimizzazione dell’infrastruttura“). In breve, NVIDIA Base Command Manager collega l’hardware in un unico supercomputer AI dal punto di vista dell’utente, eliminando la complessità del cluster sottostante.
  • Portworx di Pure Storage è una data platform nativa per Kubernetes che eccelle nella gestione dello storage persistente per le applicazioni containerizzate. All’interno della AI AI Factory, Portworx può essere sfruttato per orchestrare i dati su FlashBlade per i workload di AI containerizzati. Man mano che lo sviluppo dell’AI utilizza sempre più pipeline basate su container e Kubernetes, Portworx garantisce che i dati siano disponibili per i containers ovunque vengano eseguiti, con funzionalità come il provisioning dinamico dei volumi, le snapshot di storage e la replica tra cluster. Ciò è particolarmente importante negli scenari di hybrid cloud, ad esempio, se alcuni microservizi di AI vengono eseguiti nel cloud mentre la formazione principale avviene on-premise, Portworx può aiutare a spostare o sincronizzare i dati in modo trasparente tra gli ambienti. Fornisce in modo efficace un livello cloud-ready oltre allo storage rapido FlashBlade. L’integrazione di Portworx significa che gli sviluppatori non devono gestire manualmente la logistica dei dati, ma possono richiedere volumi di dati tramite Kubernetes e avere la certezza che la piattaforma fornirà i dati con le performance necessarie. In combinazione con la velocità raw di FlashBlade, questo garantisce che le attività di AI containerizzate (come i servizi di inferenza dei modelli o le pipeline di preparazione dei dati) abbiano accesso ai dati a bassa latenza e alta velocità di trasmissione on demand.
  • NVIDIA Run:AI è una piattaforma di orchestrazione dei workload AI specializzata che massimizza l’utilizzo della GPU e semplifica la pianificazione dei processi nella AI AI Factory. Run:AI estende Kubernetes con funzionalità di pianificazione intelligenti e basate su policy che allocano dinamicamente le frazioni GPU, i processi in coda e applicano quote che consentono una condivisione efficiente dell’infrastruttura GPU tra più utenti e team. Ad esempio, se un esperimento utilizza solo una parte della memoria di una GPU, Run:AI può pianificare workload aggiuntivi sulla stessa GPU, aumentando l’utilizzo in modi che i pianificatori tradizionali non possono utilizzare. Il risultato è una riduzione del tempo di inattività e una maggiore velocità di trasmissione dei workload all’interno di AI Factory. Insieme, Run:AI e Portworx creano essenzialmente un unico piano di gestione unificata dei dati e delle risorse su GPU e storage, fornendo un accesso ai dati con latenza inferiore e un migliore utilizzo delle risorse per i processi di AI. Questa unificazione è un fattore rivoluzionario per la produttività: I dati e le risorse di elaborazione vengono orchestrati in tandem, automaticamente.

Sfruttando Base Command Manager, NVIDIA Run:AI e Portworx, la soluzione NVIDIA-Pure Storage AI Factory offre un approccio full-stack. Non si tratta solo di hardware raw, ma di hardware e software intelligente. Ciò significa che le aziende dispongono di una piattaforma chiavi in mano che non solo offre performance di livello mondiale, ma anche l’automazione e l’integrazione intelligenti necessarie per utilizzare tali performance in modo efficace. Gli sviluppatori possono avviare esperimenti di AI senza doversi preoccupare del montaggio dei file system o di trovare dove risiedono i dati: la piattaforma li gestisce. Gli operatori IT possono garantire governance ed efficienza con policy di controllo granulari. Lo stack unificato trasforma efficacemente la complessa matrice di GPU, rete e storage in un’esperienza coerente per gli utenti finali all’interno dell’azienda.

Aumento della produttività degli sviluppatori e dell’efficienza della pipeline di AI

Uno degli aspetti più interessanti di NVIDIA-Pure Storage AI Factory è come può accelerare il lavoro degli sviluppatori di AI e dei data scientist. Eliminando i colli di bottiglia e la complessità dell’infrastruttura, consente ai team di concentrarsi sulla creazione di modelli e soluzioni invece di utilizzare l’hardware e l’impianto idraulico dei dati. 

Ecco come AI AI Factory migliora la produttività nell’intera pipeline AI:

  • Accesso semplificato ai dati: In molte aziende, i dati sono suddivisi in silos in diversi sistemi di storage e ottenere i dati giusti da inserire negli esperimenti di AI è un processo lento e manuale. Con lo storage FlashBlade unificato di AI Factory, tutte le fasi dei dati AI, dall’acquisizione raw alle funzionalità raffinate, risiedono in un unico repository ad alta velocità. Ciò significa che i cluster di formazione e i server di inferenza possono accedere direttamente ai dataset, senza noiose operazioni di copia o trasferimento. Inoltre, la capacità di FlashBlade di gestire sia i workload di file che quelli di oggetti significa compatibilità con un’ampia gamma di framework e formati di dati AI. Gli sviluppatori possono utilizzare protocolli standard (come NFS o S3) per leggere/scrivere i dati alla velocità della GPU. L’integrazione della rete RoCE garantisce inoltre che le GPU possano estrarre i dati dallo storage con una latenza minima e costi generali della CPU. In pratica, ciò si traduce in tempi di caricamento dei dati più brevi e in una maggiore velocità di iterazione. Un lavoro di addestramento che potrebbe essersi bloccato in attesa di I/O ora procede senza ostacoli, mantenendo le costose risorse GPU completamente utilizzate.
  • Ottimizzazione dell’infrastruttura minima: La messa a punto dell’infrastruttura per l’AI può richiedere innumerevoli ore di lavoro IT. La soluzione Pure Storage con NVIDIA Enterprise AI Factory riduce notevolmente questo onere. Questa architettura di riferimento è pre-convalidata e bilanciata per i workload di AI, il che significa che le performance out-of-the-box sono già ottimizzate. Il software NVIDIA Base Command (incluso nello stack) fornisce gli strumenti necessari per ottimizzare l’utilizzo della GPU e gestire la pianificazione, in modo che gli amministratori non debbano scrivere le proprie soluzioni per la gestione di cluster multiutente. Nel complesso, le scelte di progettazione della piattaforma, come l’utilizzo di Ethernet e RDMA standard, rispetto alle interconnessioni proprietarie nascoste, implicano anche la facilità di connessione agli ambienti esistenti. I team IT dedicano meno tempo alle operazioni di tinkering e antincendio, mentre gli sviluppatori di AI dedicano meno tempo all’attesa. Di conseguenza, le organizzazioni possono ottenere cicli di iterazione più rapidi, più esperimenti, modifiche dei modelli e test nello stesso lasso di tempo, accelerando il percorso dall’idea all’Insight.
  • Integrazione della pipeline end-to-end: La NVIDIA AI Factory con Pure Storage non si limita all’addestramento, ma offre un approccio olistico che copre la preparazione, l’addestramento, la convalida e il deployment dei dati. Ad esempio, considera un tipico workflow di AI aziendale: Gli ingegneri dei dati acquisiscono e curano dataset di grandi dimensioni, i data scientist addestrano modelli su cluster GPU e gli ingegneri ML implementano tali modelli per l’inferenza in produzione. In genere, ogni fase può avvenire su sistemi separati, che richiedono lo spostamento dei dati e la gestione separata degli ambienti. In questa soluzione, l’intera pipeline può essere unificata. Un singolo FlashBlade può ospitare i dati raw, i dati pre-elaborati intermedi, i checkpoint dei modelli e i file dei modelli finali, oltre agli incorporamenti RAG e al contesto della cache KV per l’inferenza. La stessa infrastruttura GPU può essere partizionata (con una pianificazione appropriata) per gestire sia i processi di addestramento che i servizi di inferenza. Questa coesione significa che non appena un modello viene addestrato, può essere testato e servito agli utenti sulla stessa piattaforma, riducendo drasticamente i tempi di deployment. Inoltre, l’ambiente coerente riduce gli errori durante la transizione dei modelli dallo sviluppo alla produzione. Tutto questo porta a un processo di sviluppo agile dell’AI in cui le idee progrediscono rapidamente verso i deployment di produzione, senza il tradizionale attrito tra team e sistemi in silos.

In definitiva, grazie alla semplicità delle performance, la AI Factory consente alle aziende di ottenere ciò che prima era molto difficile: una piattaforma di AI incredibilmente veloce ed efficiente dal punto di vista operativo. Questa combinazione offre vantaggi tangibili per il business: informazioni approfondite più rapide dai dati, possibilità di iterare i modelli di AI più frequentemente e un team di sviluppo più produttivo che non è ostacolato dai problemi dell’infrastruttura.

FlashBlade: Uno storage backbone ottimizzato per i workload AI

Al centro di NVIDIA Enterprise AI Factory con Pure Storage c’è FlashBlade//S, una piattaforma di storage scale-out all-flash progettata specificamente per gli analytics moderni e i workload di AI. In questa soluzione, FlashBlade funge da data platform a performance elevate alla base dell’addestramento AI (che richiede la lettura efficiente di enormi dataset) e dell’inferenza AI (che trae vantaggio dall’accesso rapido e a bassa latenza ai dati di riferimento e ai file dei modelli). L’architettura di FlashBlade è particolarmente adatta a queste sfide. Fornisce performance e scalabilità multidimensionali, accesso ai dati parallelo e a bassa latenza, operazioni non disruptive e resilienti e la possibilità di unificare file e object storage, consentendo a data scientist e ingegneri di lavorare con i dati in qualsiasi formato e senza ricorrere a silos di storage diverso.

Pure Storage FlashBlade fornisce a una NVIDIA Enterprise AI Factory una base di dati ad alte performance e ad alta efficienza, con capacità multi-petabyte, decine di terabyte al secondo di velocità di trasmissione e bassa latenza costante su vasta scala. Altrettanto importante, offre queste performance con le funzionalità aziendali (snapshot, crittografia, replica) e la facilità d’uso che l’IT aziendale si aspetta, a differenza dei file system HPC di nicchia. 

Conclusione: Accelera l’innovazione dell’AI in tutta sicurezza

Il lancio di NVIDIA Enterprise AI Factory con Pure Storage segna un traguardo significativo nell’evoluzione dell’infrastruttura AI. Combina il meglio di due mondi: Le funzionalità di calcolo e orchestrazione AI all’avanguardia di NVIDIA e l’innovativa tecnologia di flash storage di Pure Storage. Per i leader dell’AI di livello enterprise, questo significa che possono finalmente implementare una piattaforma di AI che offre performance a livello di supercomputer e affidabilità/efficienza di livello enterprise in un unico pacchetto. La capacità della piattaforma di gestire i workload di AI dinamici e multimodali con facilità, semplificando al contempo le operazioni e la scalabilità, aumenta l’agilità organizzativa in un dominio in cui la velocità è importante.

Sfruttando questa soluzione progettata congiuntamente, le aziende possono trasformare i propri data center in veri e propri “fabbriche di AI”, strutture che acquisiscono continuamente dati, addestrano modelli di AI e producono insight o servizi intelligenti che guidano il business. L’architettura di riferimento Pure Storage con NVIDIA Enterprise AI Factory aiuta le organizzazioni a eliminare gli ostacoli storici che hanno rallentato queste iniziative: La gestione dei dati non sarà più un ostacolo alla velocità di trasmissione, l’aggiunta di capacità non richiederà più downtime e gli sviluppatori non saranno più ostacolati da stranezze dell’infrastruttura. Invece, dispongono di una piattaforma semplificata e ad alto numero di ottani per sperimentare e fornire rapidamente risultati di AI.

Man mano che il panorama dell’AI continua a evolversi (con modelli sempre più grandi e applicazioni emergenti nell’AI generativa, negli analytics in tempo reale e oltre), è fondamentale disporre di una base flessibile e potente. La AI Factory fornisce queste basi: performance scalabili, adattabilità per il futuro ed eleganza operativa integrata. Per qualsiasi organizzazione che intenda essere leader nell’era dell’AI, NVIDIA AI Factory con Pure Storage offre un percorso interessante: Accelera i tuoi progetti di AI oggi stesso, con la certezza che la tua infrastruttura soddisferà le esigenze di domani. Questa è un’infrastruttura AI reinventata per offrire agilità, performance e successo.

Maggiori informazioni:

*Per oltre 1.024 ambienti GPU, esplora FlashBlade//EXA™.