Aceleración de la información empresarial: La plataforma de datos de IA de Pure Storage y NVIDIA impulsa el razonamiento de precisión a escala

El retraso de la información significa que se pierden oportunidades. Con una plataforma de datos de IA de NVIDIA impulsada por Pure Storage, las organizaciones pueden convertir grandes volúmenes de datos en inteligencia en tiempo real.

Pure Storage and NVIDIA AI Data Platform 4

Resumen

In today’s fast-paced business world, milliseconds matter. The NVIDIA AI Data Platform, integrated with FlashBlade//EXA and Portworx, enables organizations to not just accelerate inference but also unlock precision reasoning at scale. 

image_pdfimage_print

En una época en la que los milisegundos pueden determinar el liderazgo del mercado, las empresas se enfrentan a un reto crítico: transformar enormes repositorios de datos en inteligencia procesable con una velocidad y precisión sin precedentes. Las empresas, los hiperescaladores y las neonubes, como los clientes de Meta y Coreweave, han tenido un éxito rotundo con FlashBlade//S™ y la plataforma de Pure Storage para muchas de sus necesidades de cargas de trabajo de IA. Con múltiples validaciones de almacenamiento certificadas por NVIDIA, los clientes pueden estar seguros de que su implementación de la infraestructura de IA será rápida y fluida. 

Para los clientes a gran escala con requisitos de inferencia de IA sofisticados, el diseño de referencia de la plataforma de datos de IA de NVIDIA implementado con FlashBlade//EXA™ y Portworx® de Pure Storage® redefine el modo en que las organizaciones pueden convertir volúmenes enormes de datos en inteligencia en tiempo real. Esta pila completa no solo acelera la inferencia, sino que libera el razonamiento de precisión a escala, lo que permite que las empresas a gran escala descodifiquen conjuntos de datos complejos con precisión quirúrgica, manteniendo al mismo tiempo una seguridad de nivel de producción. 

El imperativo de la inteligencia: Por qué es importante la velocidad y la precisión

Las empresas modernas operan en entornos en los que el retraso de la información equivale a la pérdida de oportunidades. Una implementación de Pure Storage de la plataforma de datos de IA de NVIDIA aborda esto combinando la computación acelerada con la orquestación inteligente de los datos, creando un bucle de comentarios entre el conocimiento empresarial y el razonamiento de la IA. En esencia, esta infraestructura permite:

  • Análisis en tiempo real de datos multimodales (texto, imágenes, vídeo) con una latencia de menos de segundos.
  • Razonamiento consciente del contexto en conjuntos de datos distribuidos
  • Información de confianza y gobernanza de los datos mediante controles de seguridad granulares

Al aprovechar la computación acelerada a través de NVIDIA Blackwell, las redes NVIDIA, el software de generación aumentada de recuperación (RAG), incluidos los microservicios NVIDIA NeMo Retriever y el Plano de NVIDIA IA-Q, y la arquitectura optimizada para metadatos de Pure Storage, las organizaciones reducen el tiempo de obtención de información de días a segundos, manteniendo una precisión de inferencia muy alta en los entornos de producción.

Plataforma de Datos de Pure Storage
Figura 1. La implementación de Pure Storage de la plataforma de datos de IA de NVIDIA.

FlashBlade//EXA: El motor de velocidad de datos

FlashBlade//EXA de Pure Storage acaba con los cuellos de botella del almacenamiento tradicional, con un rendimiento de más de 10 TB/s en un solo espacio de nombres —suficiente para procesar toda la colección de la Biblioteca del Congreso en menos de tres minutos—. 

La ventaja clave del diseño desagregado de FlashBlade//EXA es la capacidad de escalar los metadatos y el rendimiento de los datos de manera independiente. Esto significa que las organizaciones pueden adaptar con precisión su arquitectura de almacenamiento a las demandas específicas de sus cargas de trabajo de inferencia sin sobreaprovisionar ninguno de los componentes.

Para las cargas de trabajo de inferencia que requieren un acceso rápido a miles o millones de archivos más pequeños, la capa de metadatos puede escalarse adecuadamente. Del mismo modo, para las cargas de trabajo que se ocupan de conjuntos de datos masivos formados por archivos enormes, la capa de datos puede ampliarse sin sobrecargar innecesariamente los metadatos. Esta flexibilidad permite una escalabilidad prácticamente infinita.

La segregación de los metadatos y el procesamiento de datos proporciona un acceso a los datos sin bloqueos que se vuelve cada vez más valioso en escenarios informáticos de alto rendimiento en los que las operaciones de metadatos pueden igualar o incluso superar las operaciones de I/O de datos reales. Esta arquitectura garantiza que las GPU se alimentan de manera constante con los datos a las velocidades más altas posibles, eliminando el costoso tiempo de inactividad.

Con su arquitectura desagregada y masivamente paralela, FlashBlade//EXA resuelve el problema de escalar las cargas de trabajo de IA, eliminando el tiempo de inactividad de la GPU, para que las empresas puedan acelerar el entrenamiento y la inferencia de la IA. Esta entrega de datos eficiente es crucial para las cargas de trabajo de inferencia, en las que un rendimiento constante y predecible suele ser más importante que las velocidades máximas, lo que es posible gracias al uso compartido eficiente de la caché KV para las cargas de trabajo ráfagas y mixtas. 

Portworx y FlashBlade//EXA Synergy para la aceleración de la inferencia

La sinergia entre Portworx y FlashBlade//EXA acelera la inferencia de IA a escala, al combinar la gestión de datos nativa de Kubernetes de Portworx y el almacenamiento en caché de modelos inteligente con la arquitectura de almacenamiento ultrarrápida y masivamente paralela de FlashBlade//EXA. Portworx garantiza una alta disponibilidad, un acceso de baja latencia y un escalamiento perfecto de los datos de modelo en las cargas de trabajo de inferencia distribuidas, mientras que FlashBlade//EXA elimina los cuellos de botella del almacenamiento y los metadatos con un rendimiento excepcional y un escalamiento desagregado. Juntos, maximizan el uso de la GPU, minimizan la latencia de la inferencia y proporcionan una base sólida y flexible para desplegar y administrar los pipelines de inferencia de IA en los entornos de producción.

La arquitectura KV Cache de NVIDIA reinventa los pipelines de inferencia mediante tres innovaciones:

  1. Almacenamiento en caché de prefijos casi GPU
    • Almacena patrones de consulta comunes (por ejemplo, comprobaciones de cumplimiento normativo) directamente en NVMe adyacente a la GPU.
  2. Programación consciente de la carga
    • Asigna dinámicamente los recursos de prellenado/descodificación en función de la complejidad de las consultas.
    • Mantiene un uso del 95% de la GPU incluso durante los picos de tráfico
  3. Agrupación heterogénea de GPU
    • Permite que los clústeres mixtos de variantes de GPU compartan la memoria caché KV.

Esta solución de Pure Storage complementa lo anterior con las siguientes características para proporcionar una velocidad de extremo a extremo en el rendimiento de tokens por segundo para los despliegues de inferencia de IA a gran escala.

  1. Uso compartido de caché KV: Garantiza un uso compartido eficiente de la caché KV entre la piara que se multiplica exponencialmente.
  2. Alta concurrencia de E/S: La arquitectura altamente concurrente de FlashBlade® no solo es ultrarrápida, sino que también destaca en este patrón de E/S exponencialmente concurrente.
  3. Reducción de datos: La compresión automática de la caché KV permite unas E/S más rápidas y unos tiempos de prellenado más cortos.

La seguridad como facilitador: RBAC para una información de confianza en RAG y la IA agente

La implementación de un marco de control de acceso basado en roles (RBAC) dentro de una canalización de generación aumentada de recuperación (RAG) o de agente es fundamental para una gestión de datos segura y eficiente. Esto implica establecer una capa de permisos unificada para definir los roles de usuario y sus derechos de acceso en varias fases: la ingesta, la recuperación, el procesamiento y el almacenamiento de los datos. Además, los componentes deben permitir una comprensión eficiente de las consultas para adaptar el acceso a los datos en función de los roles y las intenciones de los usuarios, garantizando el cumplimiento de los permisos establecidos. Los procesos de aumento y generación de la IA deben integrar los datos específicos del contexto en los modelos generativos, manteniendo al mismo tiempo la seguridad y los protocolos de acceso. Los mecanismos efectivos de auditoría y supervisión son cruciales para realizar un seguimiento de los patrones de acceso y garantizar el cumplimiento de las reglas RBAC, lo que impulsa la seguridad general. Las mejores prácticas de seguridad, como el uso de un modelo de confianza cero y la autenticación basada en JWT, hacen hincapié en los controles de acceso transitorios y seguros, minimizando al mismo tiempo los impactos en el rendimiento de la canalización.

Portworx implementa un modelo de seguridad de confianza cero que acelera en lugar de impedir el acceso a los datos:

  • Cifrado granular StorageClass: Cifra la PII confidencial durante el vuelo y en reposo, manteniendo los datos de entrenamiento accesibles.
  • Control de acceso basado en JWT: Otorga acceso temporal y sensible al contexto a los pipelines RAG.
  • Registro que cumple las normas de auditoría: Realiza un seguimiento del linaje de datos desde la ingestión bruta hasta la salida de la inferencia.

NVIDIA IA-Q: La capa de inteligencia de razonamiento

El Plan de NVIDIA IA-Q transforma los datos estáticos en conocimientos dinámicos a través de tres componentes principales:

  1. Motores de extracción multimodales: Convierte los esquemas en PDF, los manuales de servicio y las transcripciones de llamadas en gráficos de conocimientos estructurados.
  2. Microservicios del recuperador NeMo: Proporciona una precisión de recuerdo extremadamente alta en búsquedas de vectores a miles de millones de escala
  3. NVIDIA del kit de herramientas de NVIDIA Agent Intelligence: Elaboración de perfiles y optimización para sistemas agentes complejos

Cuando se combina con la velocidad de datos de FlashBlade//EXA, esta pila permite lo que llamamos “razonamiento de precisión”, la capacidad de obtener información preparada para la sala de juntas a partir de datos brutos en muy pocos ciclos de consulta.

Impulse el razonamiento de precisión a escala: La nueva ventaja competitiva

Las empresas que adoptan este stack informan de unos resultados transformadores.

Una implementación de Pure Storage de la plataforma de datos de IA de NVIDIA proporciona lo último en densidad de razonamiento —la capacidad de extraer información más procesable por terabyte procesado—. Al combinar la computación acelerada de NVIDIA Blackwell con la accesibilidad a los datos de Pure Storage, las organizaciones logran lo que antes era impensable: convertir todo su patrimonio de datos en un activo de razonamiento estratégico.

Conclusión: La inteligencia a la velocidad de la empresa

La colaboración entre Pure Storage y NVIDIA representa algo más que una infraestructura de IA de escala extrema —nuestro largo historial de colaboración garantiza que los clientes de todos los tamaños y la madurez de la IA puedan ser compatibles, tanto si acaban de empezar con FlashBlade//S o AIRI® como si se escalan al máximo nivel de requisitos de IA y HPC

A medida que la IA pasa de un proyecto experimental a un motor de ingresos central, esta plataforma proporciona la base de la inteligencia continua —la capacidad de razonar, decidir y actuar sobre flujos de datos en vivo con precisión de la máquina—. El futuro pertenece a las empresas que no solo almacenan datos, sino que los entienden a la velocidad de pensamiento.

Más información:

FlashBlade//EXA para IA y HPC a gran escala

Soluciones de IA de Pure Storage

Pure AI