, ,

Perché il futuro del calcolo a performance elevate dipenderà dal data storage

La potenza computazionale sta crescendo in modo esponenziale, ma l’infrastruttura di storage tradizionale non riesce a tenere il passo. Scopri cosa può fare e come può contribuire ad accelerare l’innovazione e la scoperta scientifica.

High-performance Computing

Sintesi

Traditional storage has become a bottleneck, limiting the full potential of HPC environments. The future of HPC and scientific breakthroughs hinges on having a platform that is specifically engineered for these data-intensive workloads.

image_pdfimage_print

Il calcolo a performance elevate (HPC) si colloca all’intersezione tra la scoperta scientifica e l’innovazione tecnologica, che si tratti di simulare modelli climatici, analizzare dati genomici o addestrare enormi modelli di AI. Le esigenze computazionali dei workload stanno crescendo in modo esponenziale, facendo sì che gli approcci di storage tradizionali diventino colli di bottiglia cruciali, limitando il pieno potenziale degli ambienti HPC.

È per questo che i deployment HPC di maggior successo avranno un aspetto cruciale in comune: una piattaforma di storage scalabile in grado di alimentare questi potenti sistemi. 

La sfida dei dati: Perché lo storage tradizionale non riesce a tenere il passo

Gli ambienti di calcolo a performance elevate generano ed elaborano enormi volumi di dati a velocità senza precedenti. L’evoluzione della tecnologia GPU e gli acceleratori specializzati hanno creato funzionalità di elaborazione che possono elaborare i dati più velocemente di quanto i sistemi di storage tradizionali possano fornire. Questo squilibrio crea un problema fondamentale: anche i sistemi di calcolo più potenti possono funzionare solo con la stessa velocità con cui possono accedere ai dati.

Le soluzioni di storage tradizionali, originariamente progettate per workload prevedibili, spesso hanno diversi aspetti critici dei requisiti HPC moderni:

  • Simultaneità enorme: I workload HPC spesso coinvolgono migliaia di processi paralleli che richiedono l’accesso simultaneo ai dati.
  • Performance Metadata: Oltre alla velocità di trasmissione raw, la capacità di gestire miliardi di operazioni di metadati diventa fondamentale.
  • Scalabilità: Man mano che i set di dati aumentano fino a scalare petabyte ed exabyte, i sistemi di storage devono scalare sia la capacità che le performance in modo lineare.
  • Efficienza energetica: La densità computazionale dei moderni cluster HPC richiede soluzioni di storage che riducano al minimo i requisiti di consumo energetico e raffreddamento.

Secondo i recenti risultati di Intersect360 Research, questi colli di bottiglia rappresentano alcuni dei problemi più pressanti che il settore HPC-AI si trova ad affrontare oggi. Le aziende trovano sempre più inattive le costose risorse GPU, in attesa dell’elaborazione dei dati.

L’approccio di Pure Storage allo storage HPC

In Pure Storage abbiamo reinventato l’architettura storage da zero per affrontare queste sfide HPC fondamentali. Invece di adattare i progetti legacy, abbiamo creato una piattaforma progettata specificamente per i moderni workload data-intensive.

Il nostro approccio si basa su tre principi fondamentali:

  1. Architettura parallela: Come l’HPC stesso, lo storage deve funzionare in modo altamente parallelo per ottenere la massima velocità di trasmissione.
  2. Progettazione nativa per Flash: La tecnologia DirectFlash® ci consente di gestire la NAND flash in modo nativo invece di imitare il comportamento del disco rigido, migliorando drasticamente le performance, l’affidabilità e l’efficienza.
  3. Gestione semplificata: Gli ambienti HPC sono abbastanza complessi senza aggiungere costi generali di gestione dello storage.

Questa filosofia è culminata nella nostra ultima innovazione progettata specificamente per i workload HPC e AI più esigenti.

Presentazione di FlashBlade//EXA: Ridefinire le performance su vasta scala

Siamo orgogliosi di presentare FlashBlade//EXA™, la piattaforma di data storage più potente del settore, progettata per alimentare le fabbriche di AI e gli ambienti HPC, offrendo una velocità di trasmissione estrema su una scala senza precedenti. Questa soluzione rivoluzionaria risolve le sfide fondamentali che finora hanno limitato lo storage HPC.

FlashBlade//EXA rappresenta un cambiamento di paradigma nell’architettura storage con diverse funzionalità rivoluzionarie:

  • Performance senza precedenti: La piattaforma offre velocità di lettura e performance di scrittura superiori a 10TB/s, fino al 50% della lettura alla disponibilità generale quest’estate.
  • Architettura disaggregata: La scalabilità indipendente dei piani di dati e metadati elimina i colli di bottiglia tradizionali.
  • metadati distribuiti su vasta scala: Il nostro comprovato core di metadati può supportare miliardi di operazioni e oltre 20 volte i file system in un unico namespace rispetto alle alternative.
  • Integrazione standard del settore: L’utilizzo di protocolli comuni e hardware standard per il data plane garantisce una perfetta integrazione negli ambienti esistenti.

Come spiega Rob Lee, Chief Technology Officer di Pure Storage: “FlashBlade//EXA offre un’architettura parallela che consente la scalabilità indipendente di dati e metadati per fornire ai clienti performance, scalabilità e adattabilità impareggiabili per alcuni degli ambienti di dati più grandi e più esigenti al mondo. Lo storage sta accelerando il ritmo dell’evoluzione dell’HPC e dell’AI su larga scala.”

Impatto sul mondo reale: Partnership tra Pure Storage e CERN

Il vero test di qualsiasi tecnologia è la sua applicazione nel mondo reale. Ecco perché siamo particolarmente entusiasti della nostra recente partnership con CERN Openlab, l’European Laboratory for Particle Physics, per accelerare lo sviluppo di soluzioni ICT all’avanguardia per il grande collante Hadron.

CERN genera enormi volumi di dati attraverso i suoi esperimenti fisici ad alta energia, dati che devono essere registrati, archiviati e analizzati in modo efficace per migliorare la nostra comprensione dell’universo. Le soluzioni di storage tradizionali sono diventate colli di bottiglia significativi per le loro esigenze di calcolo a performance elevate.

Grazie a questo contratto pluriennale, Pure Storage e CERN openlab:

  • Scopri in che modo la tecnologia DirectFlash può supportare le esigenze della ricerca scientifica futura
  • Ottimizza l’infrastruttura flash su scala exabyte per i workload di calcolo in rete e HPC
  • Identifica le opportunità per massimizzare le performance sia nel software che nell’hardware, migliorando al contempo l’efficienza energetica

“Insieme all’openlab CERN, stiamo spingendo oltre i limiti del possibile negli ambienti HPC e Grid Computing che supportano workflow scientifici all’avanguardia”, ha affermato Lee. “Con l’integrazione della nostra tecnologia all’avanguardia nel sistema di storage distribuito su larga scala di CERN, CERN Openlab è pronta ad affrontare volumi di dati senza precedenti con velocità e affidabilità senza precedenti, fornendo al tempo stesso ai ricercatori la possibilità di affrontare le sfide straordinarie poste dall’era dei grandi collider Hadron ad alta luminosità (HL-LHC).”

Luca Mascetti, Storage CTO di CERN openlab, aggiunge: “Prevediamo che questa partnership ci consentirà di ottenere alcuni risultati chiave mentre guardiamo al futuro dell’archiviazione dei dati degli esperimenti scientifici. Innanzitutto, prevediamo di integrare questa tecnologia nel nostro sistema di storage distribuito su larga scala e di fornire i dati in modo più efficace, fornendo un modo per scalare le performance di storage oltre ciò che è possibile oggi. In secondo luogo, speriamo di sbloccare la prossima generazione di innovazioni fisiche ad alta energia al CERN e di dimostrare alla comunità scientifica più ampia il potenziale per migliorare le capacità di storage, accelerando in ultima analisi il ritmo della scoperta e dell’innovazione presso gli istituti di ricerca a livello globale.”

Il quadro generale: Affrontare le sfide HPC a livello di settore

Oltre alle performance raw, nel 2025 il nostro approccio affronta diverse sfide critiche che il settore HPC deve affrontare:

Il panorama HPC globale continua ad affrontare notevoli sfide della supply chain, con tempi di consegna per i server e i componenti GPU di fascia alta che vanno da 6 a 12 mesi. Supportando server standard per il data plane, FlashBlade//EXA offre una maggiore flessibilità nella pianificazione e nel deployment dell’infrastruttura.

Man mano che i deployment HPC aumentano, i requisiti di consumo e raffreddamento diventano sempre più problematici. L’incredibile densità di performance di 3,4 TB/sec per rack di FlashBlade//EXA consente di ottimizzare i costi di alimentazione e raffreddamento in continua crescita associati agli ambienti GPU che richiedono un consumo energetico elevato.

La carenza di personale qualificato nelle scienze computazionali e nella gestione dei sistemi HPC-AI rappresenta una sfida significativa per il settore. La nostra attenzione alla gestione semplificata riduce i costi operativi generali, consentendo alle organizzazioni di implementare e gestire lo storage a performance elevate senza competenze specializzate.

Accelerare l’innovazione in tutti i settori

L’impatto della tecnologia di storage avanzata va oltre gli ambienti HPC tradizionali. Abbiamo ottenuto risultati notevoli in diversi settori. 

Nella ricerca genomica, l’Università di Helsinki ha sfruttato FlashBlade® per accelerare in modo significativo il proprio lavoro sul Birch Genome Project. “Per noi è stato importante fare le cose in parallelo e il passaggio a FlashBlade ci ha consentito di accelerare notevolmente il processo”, ha affermato il professor Jarkko Salojarvi, project lead Assistant. Con FlashBlade che consente di eseguire fino a quattro lavori in parallelo, il team ha superato il traguardo di metà progetto in soli 18 mesi, completando più di 550 assemblaggi genomici rispetto a meno di 100 nello stesso periodo di tempo con l’elaborazione sequenziale.

Nell’AI su larga scala, le organizzazioni si sono affidate a FlashBlade per scalare i propri workload di AI in modo efficiente. Man mano che i modelli di AI crescono in dimensioni e complessità, l’infrastruttura di storage diventa sempre più critica per risultati di successo.

Il percorso da seguire: Storage come catalizzatore per la scoperta

Come abbiamo detto in precedenza, anche i sistemi di calcolo più potenti possono funzionare con la stessa velocità con cui possono accedere ai dati. Affinché l’HPC sia all’altezza del suo nome, la tecnologia di storage avrà un ruolo sempre più vitale. La visione tradizionale dello storage come repository passivo sta lasciando il posto a una nuova comprensione: lo storage come acceleratore attivo dei workload computazionali.

Eliminando i colli di bottiglia dell’accesso ai dati, soluzioni come FlashBlade//EXA non solo supportano i workload HPC, ma trasformano radicalmente ciò che è possibile. I ricercatori possono lavorare con dataset più grandi, eseguire simulazioni più complesse e iterare più rapidamente, accelerando il ritmo di scoperta.

La visione di Pure Storage per lo storage HPC combina performance senza precedenti con una semplicità radicale. Crediamo che, eliminando i colli di bottiglia e la complessità dello storage, possiamo contribuire a liberare la nuova generazione di innovazioni scientifiche e tecnologiche.

In un mondo in cui la potenza computazionale continua a crescere in modo esponenziale, avere un’infrastruttura di storage in grado di tenere il passo non è solo un vantaggio, ma una necessità. Il futuro dell’HPC dipende da questo.

Pure AI