加速企業洞見:Pure Storage 和 NVIDIA AI 資料平台可實現大規模的精準推理

深度資訊延遲意味著錯失良機。有了 Pure Storage 驅動的 NVIDIA AI 資料平台,企業組織就能將大量資料轉化為即時情報。

Pure Storage and NVIDIA AI Data Platform 4

總結

In today’s fast-paced business world, milliseconds matter. The NVIDIA AI Data Platform, integrated with FlashBlade//EXA and Portworx, enables organizations to not just accelerate inference but also unlock precision reasoning at scale. 

image_pdfimage_print

在幾毫秒的時代中,企業可以決定市場領導地位,面臨著一項重大挑戰:以前所未有的速度和準確性,將龐大的資料儲存庫轉變為可操作的情報。Meta 和 Coreweave 等企業、超大規模廠商和新雲的客戶,都發現 FlashBlade//S幕和 Pure Storage 平台能成功達成許多 AI 工作負載需求。有了多項經 NVIDIA 認證的儲存裝置驗證,客戶可以放心,AI基礎架構的部署將快速順暢。 

對於具備精密 AI 推論需求的大規模客戶,NVIDIA AI 資料平台參考設計採用 Pure Storage® FlashBlade//EXAPortworx®,重新定義了組織如何將大量資料轉化為即時情報。這種全面的堆疊不僅能加速推論,還能大規模解開精密推理,讓大型企業以手術準確度解碼複雜的資料集,同時維持生產級的安全性。 

情報必備:為什麼速度和精準度很重要

現代企業在延遲深度資訊等於錯失機會的環境中營運。Pure Storage 實作 NVIDIA AI 資料平台,將加速運算與智慧資料調度相結合,在企業知識與 AI 推理之間建立回饋循環。此基礎架構的核心在於:

  • 多模式資料(文字、影像、影片)的即時分析,延遲低於秒
  • 跨分散式資料集了解背景的推理
  • 透過精細的資安控管,獲得值得信賴的深度資訊與資料治理

透過 NVIDIA Blackwell 的加速運算、NVIDIA 網路擷取擴增世代 (RAG) 軟體,包括 NVIDIA NeMo Retriever 微服務、AI-Q NVIDIA Blueprint,以及 Pure Storage 的中繼資料最佳化架構,組織能將深度資訊取得時間從數天縮短至數秒,同時在生產環境中維持極高的推論準確度。

Pure Storage 資料平台
圖 1. Pure Storage 實作 NVIDIA AI 資料平台。

FlashBlade//EXA: 資料速度引擎

Pure Storage FlashBlade//EXA 在單一命名空間中突破了傳統的儲存瓶頸,可提供超過 10 TB/s 的傳輸量,足以在三分鐘內完成整個大會資料庫的收集作業。 

FlashBlade//EXA 分解式設計的關鍵優勢在於能夠獨立擴展中繼資料和資料效能。這表示組織可以精確地將Oracle架構與推論工作負載的特定需求配對,而不會過度配置任何元件。

對於需要快速存取數以千計或數百萬個小型檔案的推論工作負載,中繼資料層可以進行適當擴展。同樣地,對於處理龐大資料集的工作負載,包含大型檔案,資料層可以擴充,而不需要額外的中繼資料額外負荷。這種靈活性可以實現“幾乎無限的擴展性”。

中繼資料和資料處理的隔離提供了非區塊式資料存取,在高效能運算情境中變得越來越有價值,而中繼資料作業可以等於或甚至超越實際的資料 I/O 作業。此架構可確保 GPU 持續以最高速率提供資料,從而減少昂貴的閒置時間。

FlashBlade//EXA 的分解式大規模平行基礎架構,能解決擴充 AI 工作負載的問題,並消除閒置的 GPU 時間,讓企業能加速 AI 訓練與推論。這種高效率的資料傳遞對於推論工作負載而言至關重要,因為一致、可預測的效能通常比峰值速度更重要,因為 KV 快取共享對突發和混合工作負載有效。 

Portworx 與 FlashBlade//EXA Synergy 共同加速推論

Portworx 與 FlashBlade//EXA 的協同作用,結合了 Portworx Kubernetes 原生資料管理與智慧模型快取,以及 FlashBlade//EXA 超高速、大規模平行Oracle架構,加速大規模的 AI 推論。Portworx 可確保跨分散式推論工作負載進行高可用性、低延遲存取,並順暢擴展模型資料,同時 FlashBlade//EXA 可消除儲存和中繼資料的瓶頸,同時提供優異的傳輸量和分散式擴展。他們共同將 GPU 使用率最大化,將推論延遲降至最低,並為在生產環境中部署和管理 AI 推論流程提供強大、彈性的基礎。

NVIDIA 的 KV 快取架構透過三項創新重新構思推論流程:

  1. 接近 GPU 的首碼快取
    • 直接在 GPU 鄰近的 NVMe 中儲存常見的查詢模式(例如,監管合規性檢查)
  2. 可感知負載的排程
    • 根據查詢複雜度動態分配預填/解碼資源
    • 即使在流量飆升期間,也能維持 95% 的 GPU 使用率
  3. 異質性 GPU 混樣
    • 讓混合式 GPU 變體叢集共享 KV 快取記憶體

這款 Pure Storage 解決方案搭配以下功能,為大規模 AI 推論部署提供每秒令牌效能的端到端加速。

  1. KV 快取共享: 確保 KV 快取共享的效率與牛群呈指數增長。
  2. 高 IO 並行性: FlashBlade® 高度並行的基礎架構不僅速度超快,而且在此指數並行的 IO 模式中也表現優異。
  3. 資料減量: KV 快取的自動壓縮意味著更快的 IO 和更短的預填充時間。

安全推動者:在 RAG 和代理式 AI 領域中,RBAC 提供值得信賴的深度資訊

在擷取擴增的世代 (RAG) 或代理管道中實作角色型存取控制 (RBAC) 框架,對於安全高效的資料處理至關重要。這涉及到建立統一的權限層,以定義使用者角色及其跨不同階段的存取權限:資料擷取、擷取、處理和儲存。此外,這些元件必須支援有效的查詢理解,以根據使用者角色和意圖量身訂做資料存取,確保符合設定的權限。AI AI 增強和生成流程必須將內容特定資料整合到生成模型中,同時維持安全性和存取協定。有效的稽核和監控機制對於追蹤存取模式並確保遵守 RBAC 規則至關重要,可提高整體安全性。資安最佳實務原則,例如採用零信任模式與 JWT 式驗證,強調暫時性且安全的存取控制,同時將對管道的效能影響降至最低。

Portworx 實施了一種零信任安全模式,它能加速而不是阻止資料存取:

  • StorageClass 精細加密:在飛行中和休息時加密敏感的 PII,同時保持訓練資料的可存取性
  • 以 JWT 為基礎的存取控制:讓 RAG 管道能暫時存取內容感知
  • 稽核合規記錄: 追蹤從原始攝取到推論輸出的資料譜系

NVIDIA AI-Q:合理的情報層

AI-Q NVIDIA 藍圖透過三個核心元件,將靜態資料轉化為動態知識:

  1. 多模式擷取引擎:將 PDF 原理圖、服務手冊和通話記錄轉換為結構化知識圖表
  2. NeMo Retriever 微服務:在十億規模的向量搜尋上提供極高的回收準確度
  3. NVIDIA Agent Intelligence 工具組調度:複雜代理系統的分析和優化

結合 FlashBlade//EXA 的資料速度後,此堆疊讓我們能夠從原始資料中取得資料機房就緒的深度資訊,只需幾個查詢週期即可完成。

大規模推動精準推理:全新競爭優勢

採用此堆疊的企業報告了轉型的結果。

Pure Storage 實作 NVIDIA AI 資料平台,可提供終極推理密度,每處理一個 TB,就能擷取更多可操作的深度資訊。透過將 NVIDIA Blackwell 加速運算與 Pure Storage 的資料存取能力相結合,企業組織可以達成以前無法想像的目標:將整個資料資產轉化為策略性推理資產。

結論:業務速度的智慧

Pure Storage-NVIDIA 協作不僅僅代表極端規模的 AI 基礎架構,我們長久的合作歷程可確保支援各種規模的客戶和 AI 成熟度,無論是剛開始使用 FlashBlade//SAIRI®,還是擴充至最高等級的 AIHPC 需求。 

隨著 AI 從實驗專案轉型為核心營收驅動者,此平台為持續的情報提供了基礎,即能夠以機器精準度推理、決定並處理即時資料串流。未來不僅屬於儲存資料的企業,更要以思考的速度理解

了解更多:

FlashBlade//EXA 適用於超大規模 AI 和 HPC

Pure Storage AI 解決方案

Pure AI