Synthèse
In today’s fast-paced business world, milliseconds matter. The NVIDIA AI Data Platform, integrated with FlashBlade//EXA and Portworx, enables organizations to not just accelerate inference but also unlock precision reasoning at scale.
À une époque où la milliseconde peut déterminer le leadership du marché, les entreprises sont confrontées à un défi critique : transformer de vastes référentiels de données en informations exploitables avec une rapidité et une précision sans précédent. Les entreprises, les hyperscalers et les néo-clouds tels que les clients Meta et Coreweave ont connu un succès retentissant avec FlashBlade//S™ et la plateforme Pure Storage pour la plupart de leurs charges de travail d’AI. Grâce à plusieurs validations de stockage certifiées NVIDIA, les clients peuvent être sûrs que leur infrastructure AI sera déployée rapidement et en toute fluidité.
Pour les clients de grande envergure qui ont des exigences d’inférence sophistiquées en matière dAI, la conception de référence de la plateforme de données AI NVIDIA mise en œuvre avec Pure Storage® FlashBlade//EXA™ et Portworx® redéfinit la manière dont les organisations peuvent transformer d’énormes volumes de données en intelligence en temps réel. Cette pile complète ne se contente pas d’accélérer l’inférence : elle libère un raisonnement de précision à grande échelle, ce qui permet aux grandes entreprises de décoder des ensembles de données complexes avec une précision chirurgicale tout en préservant une sécurité de niveau production.
L’impératif de l’intelligence : Pourquoi la rapidité et la précision sont importantes
Les entreprises modernes opèrent dans des environnements où les informations retardées sont synonymes d’opportunités manquées. Une implémentation Pure Storage de la plateforme de données AI de NVIDIA permet de résoudre ce problème en combinant le calcul accéléré à l’orchestration intelligente des données, créant ainsi une boucle de rétroaction entre les connaissances de l’entreprise et le raisonnement de l’AI. Au cœur de cette infrastructure, elle permet :
- Analyse en temps réel des données multimodales (texte, images, vidéo) avec une latence inférieure à la seconde
- Raisonnement adapté au contexte pour l’ensemble des ensembles de données distribués
- Des informations fiables et une gouvernance des données grâce à des contrôles de sécurité granulaires
En exploitant le calcul accéléré via NVIDIA Blackwell, la mise en réseau NVIDIA, les logiciels de génération augmentée par récupération (RAG), notamment les microservices NVIDIA NeMo Retriever et le plan NVIDIA AI-Q, ainsi que l’architecture optimisée pour les métadonnées de Pure Storage, les organisations réduisent le délai d’obtention d’informations de quelques jours à quelques secondes tout en maintenant une très haute précision d’inférence dans les environnements de production.

Figure 1 : Mise en œuvre de la plateforme de données AI NVIDIA par Pure Storage.
FlashBlade//EXA : Le moteur de vitesse des données
Pure Storage FlashBlade//EXA élimine les goulets d’étranglement du stockage traditionnel avec un débit de plus de 10 To/s dans un seul espace de nom, ce qui suffit à traiter l’ensemble de la bibliothèque du Congrès en moins de trois minutes.
Comment la désagrégation des nœuds de données et de Metadata permet une inférence massive à grande échelle
Le principal avantage de la conception désagrégée de FlashBlade//EXA réside dans la capacité à faire évoluer les métadonnées et les performances des données indépendamment. Cela signifie que les organisations peuvent adapter précisément leur architecture de stockage aux exigences spécifiques de leurs charges de travail d’inférence sans surprovisionner l’un ou l’autre composant.
Pour les charges de travail d’inférence qui nécessitent un accès rapide à des milliers, voire des millions de fichiers plus petits, la couche de métadonnées peut être mise à l’échelle de manière appropriée. De même, pour les charges de travail qui traitent des ensembles de données massifs composés de fichiers volumineux, la couche de données peut être étendue sans surcharge de métadonnées inutile. Cette flexibilité permet une « évolutivité pratiquement infinie ».
La séparation des métadonnées et du traitement des données permet un accès aux données sans blocage, qui devient de plus en plus utile dans les scénarios de calcul haute performance où les opérations de métadonnées peuvent égaler, voire dépasser les opérations dI/O réelles des données. Grâce à cette architecture, les processeurs graphiques sont alimentés en permanence avec les données aux débits les plus élevés possible, ce qui élimine les temps d’inactivité coûteux.
Grâce à son architecture désagrégée et massivement parallèle, FlashBlade//EXA résout le problème de la montée en charge des charges de travail d’AI, éliminant ainsi le temps d’inactivité des GPU, afin que les entreprises puissent accélérer l’entraînement et l’inférence de l’AI. Cette livraison efficace des données est essentielle pour les charges de travail d’inférence, où des performances constantes et prévisibles sont souvent plus importantes que les pics de vitesse, ce qui est rendu possible par un partage efficace du cache KV pour les charges de travail en rafale et mixtes.
La synergie Portworx et FlashBlade//EXA pour l’accélération des inférences
La synergie entre Portworx et FlashBlade//EXA accélère l’inférence AI à grande échelle en combinant la gestion des données native de Portworx Kubernetes et la mise en cache intelligente des modèles avec l’architecture de stockage ultrarapide et massivement parallèle de FlashBlade//EXA. Portworx garantit une haute disponibilité, un accès à faible latence et une évolutivité transparente des données de modèle sur les charges de travail d’inférence distribuées, tandis que FlashBlade//EXA élimine les goulets d’étranglement liés au stockage et aux métadonnées grâce à un débit exceptionnel et à une évolutivité désagrégée. Ensemble, ils optimisent l’utilisation des GPU graphiques, minimisent la latence d’inférence et fournissent une base robuste et flexible pour déployer et gérer les pipelines d’inférence AI dans les environnements de production.
La révolution du cache KV désagrégé : Précision à grande échelle
L’architecture KV Cache de NVIDIA réinvente les pipelines d’inférence à travers trois innovations :
- Mise en cache du préfixe proche GPU
- Stocke les schémas de requête courants (vérifications de conformité réglementaire, par exemple) directement dans NVMe adjacent au GPU
- Planification prenant en charge les charges
- Alloue dynamiquement les ressources de préremplissage/décodement en fonction de la complexité des requêtes
- Maintient une utilisation GPU de 95 % même pendant les pics de trafic
- Regroupement hétérogène de GPU graphiques
- Permet aux clusters de variantes de GPU mixtes de partager la mémoire cache KV
Cette solution Pure Storage complète ce qui précède avec les fonctionnalités suivantes pour accélérer de bout en bout les performances de jetons par seconde pour les déploiements d’inférence AI à grande échelle.
- Partage du cache KV : Assure un partage efficace du cache KV entre les troupeaux qui se multiplient de manière exponentielle.
- Concurrence E/S élevée : L’architecture hautement simultanée de FlashBlade® est non seulement ultra-rapide, mais excelle également dans ce modèle d’E/S extrêmement simultané.
- Réduction de données : La compression automatique du cache KV permet d’accélérer les E/S et de réduire les temps de préremplissage.
La sécurité comme catalyseur : RBAC pour des informations fiables sur le RAG et l’AI agentique
La mise en œuvre d’un cadre de contrôle d’accès basé sur les rôles (RBAC) au sein d’une génération augmentée par récupération (RAG) ou d’un pipeline agentique est essentielle pour un traitement des données sécurisé et efficace. Il s’agit d’établir une couche d’autorisation unifiée pour définir les rôles des utilisateurs et leurs droits d’accès à différentes étapes : ingestion, récupération, traitement et stockage des données. De plus, les composants doivent permettre une compréhension efficace des requêtes afin d’adapter l’accès aux données en fonction des rôles et des intentions des utilisateurs, garantissant ainsi la conformité avec les autorisations définies. Les processus d’augmentation et de génération de l’AI doivent intégrer des données spécifiques au contexte dans des modèles génératifs tout en maintenant les protocoles de sécurité et d’accès. Des mécanismes d’audit et de surveillance efficaces sont essentiels pour suivre les schémas d’accès et garantir le respect des règles RBAC, renforçant ainsi la sécurité globale. Les bonnes pratiques de sécurité, telles que l’utilisation d’un modèle Zero Trust et l’authentification basée sur JWT, mettent l’accent sur des contrôles d’accès transitoires et sécurisés tout en minimisant les impacts sur les performances du pipeline.
Portworx met en œuvre un modèle de sécurité Zero Trust qui accélère plutôt que d’empêcher l’accès aux données :
- Chiffrement granulaire StorageClass : Chiffre les IPI sensibles en vol et au repos tout en maintenant les données d’entraînement accessibles
- Contrôle d’accès basé sur JWT : Accorde un accès temporaire et adapté au contexte aux pipelines RAG
- Journalisation conforme aux audits : Suit la lignée de données de l’ingestion brute à la sortie d’inférence
NVIDIA AI-Q : La couche d’intelligence raisonnée
Le plan NVIDIA AI-Q transforme les données statiques en connaissances dynamiques grâce à trois composants principaux :
- Moteurs d’extraction multimodale : Convertit les schémas PDF, les manuels d’entretien et les transcriptions d’appels en graphiques de connaissances structurés
- microservices NeMo Retriever : Offre une précision de rappel extrêmement élevée pour les recherches vectorielles à l’échelle du milliard
- Orchestration de la boîte à outils NVIDIA Agent Intelligence : Profilage et optimisation pour les systèmes agents complexes
Associée à la vitesse des données de FlashBlade//EXA, cette pile permet ce que nous appelons le « raisonnement de précision », c’est-à-dire la possibilité d’extraire des informations stratégiques des données brutes en très peu de cycles de requêtes.
Raisonnement Power Precision à grande échelle : Le nouvel avantage concurrentiel
Les entreprises qui adoptent cette pile présentent des résultats révolutionnaires.
Une implémentation Pure Storage de la plateforme de données AI de NVIDIA offre le meilleur du raisonnement en termes de densité, c’est-à-dire la possibilité d’extraire des informations plus exploitables par téraoctet traité. En combinant le calcul accéléré par NVIDIA Blackwell à l’accessibilité des données de Pure Storage, les entreprises atteignent des objectifs jusque-là impensables : transformer l’ensemble de leur parc de données en un atout de raisonnement stratégique.
Conclusion : L’intelligence à la vitesse de l’entreprise
La collaboration Pure Storage-NVIDIA ne se limite pas à une infrastructure d’AI à très grande échelle. Notre longue expérience de collaboration permet de prendre en charge des clients de toutes tailles et de tous niveaux de maturité en matière d’AI, qu’ils commencent tout juste avec FlashBlade//S ou AIRI®, ou qu’ils s’adaptent au plus haut niveau d’exigences en matière d’AI et de HPC.
Alors que l’AI passe d’un projet expérimental à un moteur de revenus essentiel, cette plateforme fournit les bases d’une intelligence continue : la capacité de raisonner, de décider et d’agir sur des flux de données en direct avec la précision de la machine. L’avenir appartient aux entreprises qui ne se contentent pas de stocker des données, mais qui les comprennent à la vitesse de la pensée.
En savoir plus :
FlashBlade//EXA pour l’AI et le HPC à grande échelle

FlashBlade//EXA
Experience the World’s Most Powerful Data Storage Platform for AI
Power AI’s Next Frontier
Learn more about the most powerful data storage platform ever, built for AI.






