Pure Storage 參考架構適用於 NVIDIA 企業級 AI 工廠,可大規模加速智慧

為當今和未來的 AI 環境建立彈性和強大的基礎至關重要。NVIDIA 和 Pure Storage 的全新驗證 AI 工廠平台專為現代企業 AI 打造。

NVIDIA Enterprise AI Factory

總結

The Pure Storage with NVIDIA Enterprise AI Factory reference architecture is a jointly engineered solution that combines NVIDIA’s cutting-edge AI computation and orchestration capabilities with high-performance flash storage from Pure Storage.

image_pdfimage_print

Pure Storage AI Factory with NVIDIA 是經過驗證的 AI 基礎架構平台,專為加速企業級 AI 專案而設計。隨著 AI 模型和推理系統越來越複雜,此解決方案旨在加快深度資訊,同時簡化操作。

專為現代化企業級 AI 打造

傳統 IT 部門難以滿足現代 AI 工作負載的需求,持續確保運算和 AI 團隊的工作效率。另一方面,高效能 AI 儲存需要整合企業功能,如保證正常運行時間、靈活性和彈性。經過驗證的 NVIDIA 企業級 AI 工廠 Pure Storage 解決方案,採用易於操作、整合、高效能和彈性的基礎架構解決了這些問題。結合 NVIDIA 最新的加速運算與軟體平台,以及 Pure Storage® FlashBlade//Ssha 儲存系統,可支援生成 AI 與電腦視覺等進階工作負載,提供大規模模型訓練與推論所需的效能與擴充性。Pure Storage FlashBlade//S 是 NVIDIA 認證的 > 儲存系統,可擴充以支援多達 1,024 個 NVIDIA GPU 和多個 PB 的資料,高速網路緊密整合運算和儲存。 

  • 升級不中斷: FlashBlade 可進行原地資料升級,擴充或更新時不需停機,與通常需要規劃停機的傳統儲存裝置不同。
  • 易於使用: 整合式平台簡化了 AI 資料流程,從擷取到推論,專為企業 IT 和 AI 開發人員設計,只需最少的麻煩即可運作。
  • 穩定一致的效能: 該架構能提供任何規模的可靠效能,讓組織能夠擴充部署,而不會造成停機時間或效能損失。
  • 靈活性與未來性:開放式的模組化設計支援不斷演進的 AI 技術,並避免廠商鎖定,最大化彈性與互通性。
  • 高效率:FlashBlade 的高密度與更低的功耗能降低資料中心的佔地面積與營運成本,同時整合堆疊能簡化維護作業。

經驗證的配置 

Pure Storage、NVIDIA 和其他系統合作夥伴共同打造產品、軟體和服務,以加速企業 IT 轉移至 AI 工廠。在經過 NVIDIA 企業級 AI 工廠驗證的設計之後,Pure 正負責打造全新等級的就地部署,包括 NVIDIA 認證的 RTXCOR PRO 和 HGX Blackwell 伺服器、NVIDIA Spectrum Solar-X 乙太網路NVIDIA BlueField® DPU,以及 NVIDIA AI Enterprise 軟體,並搭配 Pure 的 NVIDIA 認證儲存系統。 

NVIDIA 企業 AI 工廠驗證的設計解決方案是以 NVIDIA 企業參考架構 (Enterprise RA) 的建議硬體配置為基礎,專為企業級部署量身訂做,範圍從 4 到 32 個節點,以及 16 到 256 個 GPU。每個 Enterprise RA 都遵循稱為參考配置的規範設計模式,以 NVIDIA 認證伺服器為基礎打造,以確保叢集的最佳效能。這些參考配置可依據 CPU、GPU、網路和頻寬規格標準化運算節點的說明。C-G-N-B 命名法能清楚指出運算能力、網路功能和頻寬效能,簡化系統選擇。每個數字 (例如 2-8-5-200) 分別是指 CPU 插槽數量、GPU 數量、網路介面卡數量 (NIC、SuperNIC 或 DPU),以及每個 GPU 的平均東西頻寬 (GbE)。

為簡化採用,Pure Storage 已將其系統與經過 NVIDIA Enterprise AI Factory 驗證設計的參考配置進行整合,因此可輕鬆部署並擴充平衡系統,以避免瓶頸和效能不理想。以下是 Pure 設計和測試的可重複參考配置。 

這些都代表經過驗證的建置組塊,客戶和合作夥伴 OEM 可以用來以不同的規模部署解決方案。這代表什麼意思:

  • 2-4-3-200(PCIe 優化):每個 GPU.It 上具有 2 個 CPU、4 個 GPU、3 個高速 NIC/DPU 和 200 Gbps 網路頻寬的運算節點,可能與 NVIDIA NVIDIA 認證的伺服器對應,該伺服器具有四個 PCIe GPU(NVIDIA L40S 或 NVIDIA RTX PRO 6000 Blackwell 伺服器版本 GPU,或適用於大型型號的 NVIDIA H100 NVL)和三個 200Gb 乙太網路介面(通常使用 NVIDIA BlueField-3 DPU 進行卸載)。2-4-3-200 的建置組塊為 AI 工廠提供平衡的入門點,足以進行小型模型訓練,以及微調或提供生產中的中型模型。企業可以從這 4-GPU 伺服器的叢集開始,因為基礎架構將能預測地擴展。
  • 2-8-5-200(PCIe 優化):更大的 PCIe 節點,每個 GPU 具備 2 個 CPU、8 個 GPU、5 個 NIC/DPU 和 200 Gbps 網路頻寬。這種配置在單一節點中有八個 GPU,每個伺服器都包含更多 AI 運算,適合較繁重的訓練工作或整合式推論陣列。此設定與最近發佈的 NVIDIA RTX PRO 伺服器一致,搭載多達八個 RTX PRO 6000 Blackwell 伺服器版本 GPU。「2-8-5」設計模式可確保更多的網路頻寬和介面卡數量,以處理增加的 GPU 數量,並維持每個 GPU 的完整 200 Gb/s 管道。使用案例包括中大型模型訓練(例如中度 NLP 模型或視覺模型),以及許多並行使用者的高傳輸量推論。此設定可能透過 NVIDIA 認證的 HGX A100/H100 PCIe 系統或符合規格的自訂 OEM 設計等伺服器進行。它提供了絕佳的擴充選項,同時仍使用標準乙太網路架構。
  • 2-8-9-400(HGX 最佳化):具備 2 個 CPU、8 個 GPU (採用 NVIDIA HGX 規格)、9 個網路介面卡和每個 GPU 400 Gbps 網路的高端配置。這相當於 NVIDIA HGX 平台(例如 HGX H100 或即將推出的 HGX H200),其中 8 個 SXM GPU 透過 NVIDIA NVLink 以超高 GPU 至 GPU 頻寬(內部順序為 900 GB/s)連接。「9」網路介面 (例如 BlueField-3 DPU 或 NVIDIA ConnectX-7 NIC) 可提供龐大的彙總傳輸量—8x 400Gb 的 GPU,外加額外的儲存空間或叢集間通訊,可有效為每個 GPU 提供每秒 400Gb 的 I/O 密集型工作負載。這種 2-8-9-400 的模式針對需求最嚴苛的情境:大型模型訓練(數十億參數模型)、大型內容輸入大量推論,或任何 AI 工作負載,其中最大傳輸量和低延遲是最重要的。憑藉其強大功能,它自然適合進階生成 AI、複雜模擬或大規模推論服務等使用案例。

這些參考配置可以擴展到整個叢集。舉例來說,AI 工廠可能從一 (4) 個 2-8-5-200 節點開始,之後每個叢集最多擴展 32 個節點,FlashBlade 儲存和 NVIDIA Spectrum-X 乙太網路將相應擴展(針對隨著 FlashBlade 機箱和上行連結的增長,提供指南,確保線性的可擴充性)。這為企業提供了清晰、模組化的成長途徑:從經過實證的建置組塊開始,隨著 AI 需求成長,增加更多。

為了確保廣泛的可存取性,NVIDIA 和 Pure Storage 正與主要伺服器 OEM 驗證解決方案,將這些 AI 工廠的建置組塊推向市場。Dell Technologies、HPE 和 Supermicro 伺服器將採用 NVIDIA Blackwell 平台,結合 Pure Storage FlashBlade 作為完整的 AI Factory 解決方案進行測試。如此一來,客戶就能選擇供應商加速 NVIDIA AI Factory 的設計與部署,並放心讓解決方案完全符合 NVIDIA-Pure Storage 規格。

AI 工廠並非單一的黑箱設備,而是多個廠商可以建立的開放式參考架構。企業可透過偏好的硬體供應商採用解決方案,甚至依照參考設計自行整合元件。這種開放性與一些將客戶與單一供應商生態系統連結的競爭方法形成對比。在所有情況下,客戶都能受益於經共同驗證的設計,以及工程團隊完成的緊密整合工作。

整合式軟體堆疊:Pure Storage 的 Run:AI 和 Portworx NVIDIA Base Command Manager

NVIDIA-Pure Storage AI Factory 的傑出功能是整合式軟體堆疊,可進行資料和運算調度。以下三個關鍵軟體元件扮演了重要角色:NVIDIA Base Command Manager、Pure Storage 的 Portworx®,以及 NVIDIA Run:AI。兩者共同形成凝聚力層,簡化大規模執行 AI 的過程:

  • NVIDIA Base Command Manager 是一種叢集管理解決方案,提供快速部署,並自動為任何規模的叢集配置和管理。在 AI 工廠中,Base Command Manager 在單一工具中提供配置、監控和管理功能,涵蓋叢集的整個生命週期。AI AI 工廠整合了 Base Command Manager,可確保組織優化其叢集資源的使用。軟體包含儀表板,可顯示叢集使用率和健康資料,以協助調整效能或發現問題 (因此建立基礎架構最佳化工具)。簡而言之,NVIDIA Base Command Manager 從使用者的角度將硬體連結為單一 AI 超級電腦,消除了底層叢集的複雜性。
  • Pure Storage 的 Portworx 是 Kubernetes 原生資料平台,擅長管理容器化應用程式的持久性儲存。在 AI 工廠中,Portworx 可以用來調度 FlashBlade 上容器化 AI 工作負載的資料。隨著 AI 的開發越來越多地使用容器和 Kubernetes 管線,Portworx 確保無論容器在何處運行,都能使用資料,並具備動態磁碟配置、儲存快照和跨叢集複寫等功能。這在hybrid cloud的情境中尤其重要,例如,如果有些 AI 微服務在就地部署時在雲端運行,Portworx 可以幫助在環境 之間無縫移動或同步資料。它在 FlashBlade 快速儲存系統之上,能有效提供雲端就緒層。Portworx 整合意味著開發人員不必手動處理資料後勤作業;他們可以透過 Kubernetes 請求資料量,並相信平台能提供所需的效能。結合 FlashBlade 的原始速度,可確保容器化 AI 任務(如模型推論服務或資料準備管道)獲得低延遲、高傳輸量的資料 隨取隨用存取。
  • NVIDIA Run:AI 是一款專門的 AI 工作負載調度平台,可最大化 GPU 使用率,並簡化 AI 工廠的工作排程。Run:AI 運用以政策為導向的智慧排程功能來擴展 Kubernetes,動態分配 GPU 部分、佇列工作,並強制執行配額,從而在多個使用者和團隊間有效共享 GPU 基礎架構。舉例來說,如果一項實驗僅使用 GPU GPU 記憶體的一部分,Run:AI 可以在同一個 GPU 上安排額外的工作負載,以傳統排程器無法做到的方式增加使用率。結果是AI 工廠內的閒置時間更少,工作負載量也更高。Run:AI 與 Portworx 共同在 GPU 與儲存設備之間建立單一的整合式資料與資源管理平面,為 AI 工作提供更低的延遲資料存取與更佳的資源利用率。這樣的整合改變了生產力:資料和運算資源會自動協調。

NVIDIA-Pure Storage AI Factory 解決方案運用 Base Command Manager、NVIDIA Run:AI 和 Portworx,提供完整堆疊的方法。這不只是原始硬體,更是硬體加上智慧軟體。這表示企業不僅擁有世界級的效能,而且還擁有有效運用該效能所需的智慧自動化與整合能力。開發人員可以啟動 AI 實驗,而不必擔心安裝檔案系統,或找出資料所在位置,而該平台會處理資料。IT 操作員可透過精密的控制政策來確保治理與效率。整合式堆疊能有效地將 GPU、網路和儲存裝置的複雜矩陣轉化為公司內部終端使用者的凝聚力體驗。

提升開發人員生產力和 AI 管道效率

NVIDIA-Pure Storage AI Factory 最令人振奮的領域之一,就是它如何加速 AI 開發人員和資料科學家的工作。透過消除基礎架構的瓶頸和複雜性,讓團隊能夠專注於建立模型和解決方案,而不必擔心硬體和資料管道的問題。 

以下是 AI 工廠如何改善 AI AI 管線的生產力:

  • 簡化資料存取:在許多企業中,資料在不同的儲存系統中都被孤立,而將正確的資料導入 AI 實驗是一個緩慢的手動流程。AI AI 工廠的整合式 FlashBlade 儲存,可將 AI 資料的所有階段,從原始擷取到精緻功能,都整合在一個高速儲存庫中。這意味著訓練叢集和推論伺服器可以直接存取資料集,無需繁瑣的複製或傳輸步驟。此外,FlashBlade 能夠同時服務檔案和物件式工作負載,意味著與各種 AI 框架和資料格式相容。開發人員可以使用標準協定 (如 NFS 或 S3) 以 GPU 的速度讀取/寫入資料。RoCE 網路的整合進一步確保 GPU 能夠以最低延遲和 CPU 額外負荷,從儲存裝置中提取資料。實際上,這可以縮短資料載入時間,並加快迭代速度。一項訓練工作可能停滯等待 I/O,現在沒有阻礙,讓昂貴的 GPU 資源得以充分利用。
  • 最低基礎架構調校:調整 AI 基礎架構會花費數小時的 IT 工作。Pure Storage 採用 NVIDIA 企業級 AI 工廠解決方案,可大幅減輕此負擔。此參考架構已針對 AI 工作負載進行預先驗證和平衡,這意味著立即可用的效能已經最佳化。NVIDIA Base Command 軟體 (包含於堆疊中) 提供最佳化 GPU 使用率和處理排程的工具,因此管理員不必自行編寫管理多使用者叢集的解決方案。總體而言,平台的設計選擇,例如使用標準乙太網路和 RDMA,相較於隱藏的專屬互連,也代表它能輕鬆插入現有環境。IT 團隊花更少時間進行篡改和消防,而 AI 開發人員花更少時間等待。因此,組織可以 更快地完成迭代週期,在相同時間內進行更多實驗、模型調整和測試,從而加速從想法到Insight的過程。
  • 端到端管道整合:採用 Pure Storage 的 NVIDIA AI 工廠不只是訓練而已,而是涵蓋資料準備、訓練、驗證和部署的整體方法。舉例來說,請考量典型的企業 AI 工作流程:資料工程師會擷取並整理大型資料集、資料科學家在 GPU 叢集上訓練模型,而ML工程師則部署這些模型以進行生產推論。傳統上,每個階段都可能發生在不同的系統上,需要移動資料並分開管理環境。在這個解決方案中,整個管道都可以整合。單一 FlashBlade 即可託管原始資料、中級預處理資料、模型檢查點和最終模型檔案,以及 RAG 嵌入和 KV 快取內容以進行推論。相同的 GPU 基礎架構可進行分割 (並適當排程),以處理訓練工作和推論服務。這種凝聚力意味著一旦模型經過訓練,就可以在同一個平台上測試並提供給使用者,大幅縮短部署時間。此外,一致的環境能減少從開發到生產模式的轉換錯誤。所有這些技術都帶來了靈活的 AI 開發流程,讓創意迅速進入生產部署,而不需孤島團隊和系統之間的傳統摩擦。

最終,AI 工廠以簡易的方式提供效能,讓企業得以達成以前非常困難的目標:AI平台,既快速又有營運效率。這種組合能帶來切實的商業效益,從資料中獲得更快速的深度資訊、更頻繁地迭代 AI 模型的能力,以及更有生產力的開發團隊,而且不會因為基礎架構問題而感到困擾。

FlashBlade:專為 AI 工作負載最佳化的儲存系統骨幹

Pure Storage 是 NVIDIA 企業級 AI 工廠的核心,FlashBlade//S 是全快閃、橫向擴充的儲存平台,專為現代化分析和 AI 工作負載而設計。在這個解決方案中,FlashBlade 可作為高效能資料平台,支援 AI 訓練(需要有效讀取大量資料集)和 AI 推論(受益於快速、低延遲存取參考資料和模型檔案)。FlashBlade 的基礎架構特別適合這些挑戰。它提供多維效能和可擴充性;低延遲、平行資料存取;不中斷和彈性的操作;以及統一檔案和物件式資料儲存的能力,使資料科學家和工程師能夠以其工具預期的任何格式處理資料,而無需使用不同的儲存孤島。

Pure Storage FlashBlade 為 NVIDIA 企業級 AI 工廠提供高效能、高效率的資料基礎,提供多 PB 容量、每秒數十 TB 的輸送量,以及大規模的穩定低延遲。同樣重要的是,它提供了企業級功能(快照、加密、複寫)和企業級 IT 期望的簡易性,與利基 HPC 檔案系統不同。 

結論:安心加速 AI 創新

採用 Pure Storage 的 NVIDIA 企業級 AI 工廠,是 AI 基礎架構發展的重要里程碑。它結合了兩個世界的最佳:Pure Storage 提供的 NVIDIA 尖端 AI 運算與調度功能,以及創新的快閃儲存技術。對於企業級 AI 領導者而言,這意味著他們終於可以部署 AI 平台,在單一套件中提供超級電腦級效能和企業級可靠性/效率。該平台能夠輕鬆處理動態、多模式的 AI 工作負載,同時簡化操作和擴展,從而提高速度至關重要的領域中的組織靈活性。

透過這種聯合設計的解決方案,企業可以將資料中心轉變為真正的AI工廠,這些設施能夠持續擷取資料、訓練AI模型,並產生深度資訊或智慧服務,推動業務發展。Pure Storage 採用 NVIDIA 企業級 AI 工廠參考架構,可協助企業組織消除阻礙這些計畫的歷史障礙:資料處理不再是輸送量的障礙,不再需要停機時間來增加容量,且不再是基礎架構奇怪的開發人員。相反地,他們擁有一個簡化、高辛烷的平台,以快速實驗並交付 AI 成果。

隨著 AI 環境的不斷發展(隨著不斷擴大的模型和生成 AI、即時分析等的新興應用程式),擁有彈性和強大的基礎是關鍵。AI 工廠提供了基礎:大規模的效能、未來適應性,以及內建的營運優雅。對於任何希望在 AI 時代領先群倫的組織而言,NVIDIA AI 工廠與 Pure Storage 提供令人信服的前進途徑:立即加速您的 AI 專案,相信您的基礎架構將能滿足未來的需求。這是為靈活性、效能和成功而重新構思的 AI 基礎架構。

了解更多:

*若為超過 1,024 個 GPU 環境,請探索 FlashBlade//EXAza。