, ,

Por qué el futuro de la computación de alto rendimiento dependerá del almacenamiento de datos

La potencia computacional está creciendo exponencialmente, pero la infraestructura de almacenamiento tradicional no puede seguir el ritmo. Descubra qué puede ayudar a acelerar la innovación y el descubrimiento científico y cómo puede hacerlo.

High-performance Computing

Resumen

Traditional storage has become a bottleneck, limiting the full potential of HPC environments. The future of HPC and scientific breakthroughs hinges on having a platform that is specifically engineered for these data-intensive workloads.

image_pdfimage_print

La computación de alto rendimiento (HPC) se encuentra en la intersección de los descubrimientos científicos y la innovación tecnológica, ya sea simulando modelos climáticos, analizando datos genómicos o entrenando modelos masivos de IA. Las demandas computacionales de sus cargas de trabajo están creciendo exponencialmente, lo que hace que los enfoques de almacenamiento tradicionales se conviertan en cuellos de botella críticos, lo que limita todo el potencial de los entornos HPC.

Por ello, las implementaciones de HPC más exitosas tendrán una cosa crítica en común: una plataforma de almacenamiento masivamente escalable capaz de alimentar estos potentes sistemas. 

El reto de los datos: Por qué el almacenamiento tradicional no puede seguir el ritmo

Los entornos informáticos de alto rendimiento generan y procesan enormes volúmenes de datos a unas velocidades sin precedentes. La evolución de la GPU tecnología GPU y los aceleradores especializados ha creado unas capacidades computacionales que pueden procesar los datos más rápidamente de lo que los sistemas de almacenamiento convencionales pueden proporcionar. Este desequilibrio crea un problema fundamental: incluso los sistemas informáticos más potentes solo pueden funcionar tan rápido como pueden acceder a sus datos.

Las soluciones de almacenamiento tradicionales, originalmente diseñadas para cargas de trabajo previsibles, a menudo tienen problemas con varios aspectos críticos de los requisitos modernos de la HPC:

  • Concurrencia masiva: Las cargas de trabajo HPC suelen implicar miles de procesos paralelos que requieren acceso simultáneo a los datos.
  • Rendimiento Metadata: Más allá del rendimiento bruto, la capacidad de manejar miles de millones de operaciones de Metadata se vuelve crítica.
  • Escalabilidad: A medida que los conjuntos de datos crecen a escala de petabytes y exabytes, los sistemas de almacenamiento deben escalar linealmente tanto la capacidad como el rendimiento.
  • Eficiencia energética: La densidad computacional de los clústeres HPC modernos exige soluciones de almacenamiento que minimicen el consumo energético y los requisitos de refrigeración.

Según los resultados recientes de Intersect360 Research, estos cuellos de botella representan algunos de los problemas más acuciantes a los que se enfrenta actualmente el sector de la HPC-IA. Las organizaciones encuentran cada vez más que sus caros recursos de GPU están inactivos y esperan a que los datos se procesen.

El enfoque de Pure Storage para el almacenamiento HPC

En Pure Storage, hemos reinventado la arquitectura de almacenamiento desde cero para abordar estos retos fundamentales de la HPC. En lugar de adaptar los diseños tradicionales, hemos creado una plataforma diseñada específicamente para las cargas de trabajo modernas que consumen muchos datos.

Nuestro enfoque se centra en tres principios fundamentales:

  1. Arquitectura masivamente paralela: Al igual que la propia HPC, el almacenamiento debe funcionar de manera muy paralela para lograr el máximo rendimiento.
  2. Diseño nativo del flash: La tecnología DirectFlash® nos permite administrar la NAND flash de manera nativa en lugar de imitar el comportamiento del disco duro, mejorando drásticamente el rendimiento, la fiabilidad y la eficiencia.
  3. Gestión simplificada: Los entornos de HPC son lo suficientemente complejos sin añadir gastos generales de gestión del almacenamiento.

Esta filosofía ha culminado con nuestra última innovación diseñada específicamente para las cargas de trabajo de HPC e IA más exigentes.

Presentamos FlashBlade//EXA: Redefinir el rendimiento a escala

Estamos orgullosos de presentar FlashBlade//EXA™, la plataforma de almacenamiento de datos más potente del sector, creada para impulsar las fábricas de IA y los entornos de HPC, al proporcionar un rendimiento extremo a una escala sin precedentes. Esta solución innovadora aborda los retos fundamentales que han limitado el almacenamiento de la HPC hasta ahora.

FlashBlade//EXA representa un cambio de paradigma en la arquitectura de almacenamiento con varias capacidades revolucionarias:

  • Rendimiento sin precedentes: La plataforma proporciona una velocidad de lectura y un rendimiento de escritura de más de 10TB/s, hasta un 50% de lectura con una disponibilidad general este verano.
  • Arquitectura desagregada: El escalamiento independiente de los planos de datos y Metadata elimina los cuellos de botella tradicionales.
  • Metadata distribuidos masivamente: Nuestro núcleo de Metadata probado puede soportar miles de millones de operaciones y más de 20 veces los sistemas de archivos en un solo espacio de nombres comparado con las alternativas.
  • Integración estándar del sector: El uso de protocolos comunes y hardware estándar para el plano de datos garantiza una integración perfecta en los entornos existentes.

Rob Lee, Director Tecnológico de Pure Storage, explica: «FlashBlade//EXA proporciona una arquitectura masivamente paralela que permite escalar de manera independiente los datos y los Metadata para proporcionar a los clientes un rendimiento, una escalabilidad y una adaptabilidad sin igual para algunos de los entornos de datos más grandes y exigentes del mundo. Ahora, el almacenamiento está acelerando el ritmo de evolución de la HPC y la IA a gran escala».

Impacto en el mundo real: Asociación entre Pure Storage y CERN

La verdadera prueba de cualquier tecnología es su aplicación del mundo real. Por ello, estamos especialmente entusiasmados con nuestra colaboración recientemente anunciada con CERN Openlab, el Laboratorio Europeo de Física de Partículas, para acelerar el desarrollo de soluciones TIC de vanguardia para el Collider de Hadron Grande.

El CERN genera volúmenes enormes de datos a través de sus experimentos físicos de alta energía, datos que deben registrarse, almacenarse y analizarse de manera efectiva para avanzar en nuestra comprensión del universo. Las soluciones de almacenamiento tradicionales se han convertido en cuellos de botella importantes para sus necesidades informáticas de alto rendimiento.

Mediante este acuerdo plurianual, Pure Storage y CERN openlab:

  • Descubra cómo la tecnología DirectFlash puede satisfacer las necesidades de las futuras investigaciones científicas
  • Optimice la infraestructura flash a escala de exabytes para las cargas de trabajo de computación de red y HPC
  • Identificar oportunidades para maximizar el rendimiento tanto del software como del hardware, mejorando al mismo tiempo la eficiencia energética.

«Junto con el Openlab de CERN, estamos ampliando los límites de lo que es posible en los entornos de HPC y de computación en red que admiten flujos de trabajo científicos de vanguardia», explica Lee. «Con la integración de nuestra tecnología de vanguardia en el sistema de almacenamiento distribuido a gran escala de CERN, el Openlab de CERN está preparado para hacer frente a los volúmenes de datos sin precedentes con una velocidad y una fiabilidad sin precedentes, al tiempo que permite que los investigadores se enfrenten a los retos extraordinarios planteados por la era de los colisionadores de hadrones grandes de alta luminosidad (HL-LHC).»

Luca Mascetti, Director Tecnológico de Almacenamiento de CERN Openlab, añade: «Esperamos que esta colaboración proporcione algunos logros clave a medida que miramos hacia el futuro del almacenamiento de los datos de los experimentos científicos. En primer lugar, esperamos integrar esta tecnología en nuestro sistema de almacenamiento distribuido a gran escala y proporcionar los datos de un modo más eficaz, proporcionando una manera de escalar el rendimiento del almacenamiento más allá de lo que es posible actualmente. En segundo lugar, esperamos desbloquear la próxima generación de avances físicos de gran energía en el CERN y demostrar a la comunidad científica en general el potencial para mejorar las capacidades de almacenamiento, acelerando en última instancia el ritmo de descubrimiento e innovación en las instituciones de investigación de todo el mundo”.

El panorama más amplio: Abordar los retos de la HPC en todo el sector

Además del rendimiento bruto, nuestro enfoque aborda varios retos críticos a los que se enfrenta el sector de la HPC en 2025:

El panorama global de la HPC sigue enfrentándose a importantes retos en la cadena de suministro, con plazos de entrega para los servidores y componentes GPU de gama alta que van de 6 a 12 meses. Al admitir servidores estándar para el plano de datos, FlashBlade//EXA ofrece una mayor flexibilidad en la planificación y el despliegue de la infraestructura.

A medida que las implementaciones de HPC crecen, los requisitos de consumo energético y enfriamiento se vuelven cada vez más problemáticos. La impresionante densidad de rendimiento de 3,4 TB/seg por rack de FlashBlade//EXA ayuda a optimizar los costes de energía y refrigeración cada vez mayores asociados con los entornos de GPU que consumen mucha energía.

La escasez de personal cualificado en las ciencias computacionales y la gestión del sistema HPC-IA representa un reto importante para el sector. Nuestro enfoque en una gestión simplificada reduce los gastos generales operativos, lo que permite que las organizaciones desplieguen y gestionen el almacenamiento de alto rendimiento sin conocimientos especializados.

Acelerar la innovación en todos los sectores

El impacto de la tecnología de almacenamiento avanzada va más allá de los entornos HPC tradicionales. Hemos visto unos resultados extraordinarios en diversos sectores. 

En el estudio genómico, la Universidad de Helsinki aprovechó FlashBlade® para acelerar significativamente su trabajo en el Proyecto Genómico de Birch. «Para nosotros era importante hacer las cosas en paralelo y pasarnos a FlashBlade nos ha permitido acelerar significativamente el proceso», explica el profesor adjunto del proyecto, Jarkko Salojarvi. Con FlashBlade, que les permite ejecutar hasta cuatro trabajos en paralelo, el equipo superó la mitad del proyecto en solo 18 meses, completando más de 550 conjuntos de genomas en comparación con menos de 100 en el mismo periodo de tiempo con el procesamiento secuencial.

En la IA a gran escala, las organizaciones han confiado en FlashBlade para escalar sus cargas de trabajo de IA de manera eficiente. A medida que los modelos de IA crecen en tamaño y complejidad, la infraestructura de almacenamiento se vuelve cada vez más crítica para unos resultados satisfactorios.

El camino a seguir: El almacenamiento como catalizador del descubrimiento

Como hemos dicho anteriormente, incluso los sistemas informáticos más potentes solo pueden funcionar tan rápido como pueden acceder a sus datos. Para que la HPC haga honor a su nombre, la tecnología de almacenamiento desempeñará un papel cada vez más vital. La visión tradicional del almacenamiento como repositorio pasivo está dando paso a una nueva comprensión: el almacenamiento como acelerador activo de las cargas de trabajo computacionales.

Al eliminar los cuellos de botella en el acceso a los datos, las soluciones como FlashBlade//EXA no solo soportan las cargas de trabajo de HPC, sino que transforman fundamentalmente lo que es posible. Los investigadores pueden trabajar con conjuntos de datos más grandes, ejecutar simulaciones más complejas e iterar más rápidamente, lo que en última instancia acelera el ritmo de descubrimiento.

La visión de Pure Storage para el almacenamiento HPC combina un rendimiento sin precedentes con una simplicidad radical. Creemos que al eliminar los cuellos de botella y las complejidades del almacenamiento, podemos ayudar a desbloquear la próxima generación de avances científicos y tecnológicos.

En un mundo en el que la potencia computacional sigue creciendo exponencialmente, tener una infraestructura de almacenamiento que pueda seguir el ritmo no es solo una ventaja, sino que es una necesidad. El futuro de la HPC depende de ello.

Pure AI