AI網路與GPU Fabric資源中心

面向人工智慧基礎設施的架構、乙太網路結構、RoCE 和開放式網絡

什麼是人工智慧網路?

AI網路是指支援大規模人工智慧和機器學習工作負載所需的高效能網路基礎架構。與傳統企業應用不同,AI工作負載對網路的要求極高,因為它們依賴海量資料在運算、儲存和加速器資源之間持續流動。.

現代人工智慧訓練環境會產生顯著影響。 東西向交通分散式訓練採用的是資料中心內部的伺服器間通信,而非傳統應用中常見的南北向流量。在分散式訓練過程中,數千個GPU頻繁交換模型參數、梯度和中間資料以保持同步,從而實現高效傳輸。 GPU叢集網路 對大規模性能至關重要。.

隨著人工智慧集群從數十個加速器擴展到數千個加速器,網路效能變得至關重要。高容量交換機由…提供支援 商用矽AI開關, , 包括 400G 和 800G 乙太網路平台, 有助於減少瓶頸,維持大規模 AI 工作負載的吞吐量。.

這個過程高度依賴快速的GPU同步和集體通訊操作,例如all-reduce。即使是少量的延遲、擁塞或丟包也會導致昂貴的GPU閒置,從而減慢模型訓練速度並降低基礎設施效率。.

為了滿足這些需求,現代人工智慧網路依賴低延遲、高頻寬的架構,旨在最大限度地利用 GPU 並有效地在叢集中傳輸資料。支持資源,例如: 人工智慧/機器學習白皮書, Edgecore Open Fabric以及 博通 Tomahawk 6 提供關於大規模人工智慧織物設計的更深層技術背景。.

為什麼人工智慧工作負載會破壞傳統資料中心網路?

人工智慧工作負載對網路基礎架構的要求與傳統企業應用截然不同。隨著人工智慧叢集規模的擴大,傳統架構往往會成為瓶頸,限制效能並延長訓練時間。.

主要挑戰來自密集的GPU集體通訊模式,例如: 全部減少, 其中,在每次訓練迭代期間,都需要在多個GPU之間交換大量資料。這些操作需要極快且可預測的通信,以保持分散式工作負載的同步。.

AI工作負載也會產生短暫但強度很高的流量突發,稱為 微爆流, 這會使傳統的乙太網路架構不堪重負,導致網路擁塞、丟包和重傳。即使是短暫的中斷也會使GPU管線停滯,並顯著降低叢集效率。.

為了應對這些挑戰,現代 人工智慧資料中心網絡 越來越依賴諸如以下技術 RDMA(遠端直接記憶體存取), 無損以太網, 以及可擴展的 leaf 脊椎架構。這些技術有助於減少瓶頸,同時提高 AI 訓練和推理的吞吐量。.

許多組織也在採用 面向人工智慧的開放式網絡 透過 分散式人工智慧基礎設施, 將硬體和軟體層分離,以提高可擴展性、靈活性和成本效益,同時減少供應商鎖定。.

核心概念

探索塑造現代人工智慧網路的六大核心概念——從 GPU 叢集通訊和乙太網路人工智慧架構到開放、解耦的基礎設施。.

乙太網路與InfiniBand

關於此的辯論 乙太網路與 InfiniBand 在人工智慧網路領域的比較 隨著企業規模化擴展大型人工智慧集群,這項技術的重要性日益凸顯。這兩種技術都能滿足現代人工智慧叢集所需的低延遲和高吞吐量。 GPU叢集網路, 但它們在成本、靈活性和生態系統開放性方面有所不同。 InfiniBand 長期以來一直是超低延遲高效能運算 (HPC) 環境的首選,而無損乙太網路、RoCE 和擁塞管理技術的進步正在迅速提升現代網路的效能。 乙太網路人工智慧架構. 對於建構可擴展組織的機構而言 人工智慧資料中心網絡 對於基礎設施而言,決策往往取決於如何在效能、成本效益、操作簡單性和長期彈性之間取得平衡。.

特徵 乙太網路 + RoCE InfiniBand
成本 降低 更高
供應商鎖定 低的 高的
生態系統 廣闊 專門
人工智慧效能 高的 非常高

為了更深入了解技術細節 RoCE、PFC 和 ECN總擁有成本, 探索我們的技術資源。.

面向人工智慧的開放網絡

隨著人工智慧基礎設施的擴展,許多組織正在重新思考依賴緊密整合的硬體和軟體的專有網路模型。. 面向人工智慧的開放式網絡 透過將網路作業系統與底層硬體分離,提供了更靈活、更經濟高效的方法。.

這種方法的核心是 網路分解, 這使得營運商能夠獨立選擇最佳的硬體和軟體。這實現了更強大的可擴展性。 GPU叢集網路 同時減少對單一供應商生態系統的依賴。.

白盒人工智慧網絡 是該模型的關鍵推動因素。它基於標準化硬體構建,並由…驅動。 商用矽AI開關, 白盒平台能夠提供超大規模的效能,而無需支付專有系統的高昂成本。.

例如作業系統 SONiC 透過自動化、遙測和現代 API 實現高度可擴展、可編程的網路。精心設計的 SONiC AI布料 有助於簡化操作,同時支援大規模人工智慧工作負載。.

結果較低 總擁有成本(TCO) 透過降低硬體溢價、提高營運效率和最大限度地減少供應商鎖定,貫穿網路生命週期。.

傳統人工智慧網路與開放式人工智慧網絡
傳統人工智慧網路 開放式人工智慧網絡
專有堆疊 分解堆疊
已關閉的NOS SONiC
供應商鎖定 多供應商彈性
總擁有成本更高 降低 TCO

Edgecore 的獨特之處在於,它融合了高效能開放硬體、業界領先的晶片以及廣泛的生態系統相容性,從而提供可擴展、高效且面向未來的 AI 網路基礎設施。了解更多 現實世界的人工智慧部署 親眼見證開源人工智慧布料的生產應用。.

準備好建造可擴展的人工智慧基礎設施了嗎?

了解開放式網路解決方案如何支援現代 AI 架構、高效能 GPU 叢集和下一代資料中心架構。.

資源庫

常見問題解答

AI網路是指用於連接GPU、伺服器、儲存設備和交換器等人工智慧工作負載所需設備的專用網路基礎設施。與傳統的企業網絡不同,, 人工智慧資料中心網絡 必須支援極高的頻寬、極低的延遲以及分散式運算資源之間的大規模東西向流量。.

現代的 GPU叢集網路 旨在有效地在大型 GPU 叢集之間移動訓練資料、模型參數和推理工作負載。這通常是透過以下方式實現的: 乙太網路人工智慧架構, 高速交換和可擴展的 leaf 脊椎架構。許多組織正在採用 白盒人工智慧網絡面向人工智慧的開放式網絡 降低成本、避免供應商鎖定、更有效率地擴展基礎設施。.

GPU叢集需要低延遲網絡,因為分散式AI工作負載在訓練和推理過程中需要在GPU之間不斷交換資料。即使是微小的通訊延遲也會減慢同步速度,降低叢集的整體效率。.

大規模 GPU叢集網路, 諸如全歸約、梯度同步和集體通訊等操作會產生大量的東西向流量。低延遲確保 GPU 將更多時間用於計算,減少等待資料的時間。高效能 人工智慧資料中心網絡 透過使用高速技術來最大限度地減少瓶頸 乙太網路人工智慧架構, RDMA 和最佳化的擁塞管理。.

資本報酬率 (RDMA over Converged Ethernet)是一種網路技術,它支援透過乙太網路進行遠端直接記憶體訪問,使伺服器和 GPU 能夠在不經過 CPU 的情況下直接在記憶體之間傳輸資料。.

RoCE在現代金融中被廣泛應用。 GPU叢集網路 因為它能降低延遲、減少 CPU 開銷並提高 AI 工作負載的吞吐量。 人工智慧資料中心網絡 在各種環境下,RoCE 都能發揮作用。 乙太網路人工智慧架構 在保持乙太網路的靈活性和成本優勢的同時,提供與專用互連相當的效能。 RoCE 對於可擴展性而言尤其重要。 分散式人工智慧基礎設施 在需要快速GPU間通訊的場合。.

無損乙太網路對於人工智慧來說非常重要,因為丟包會顯著降低分散式訓練和推理過程中 GPU 的通訊效能。.

大量 GPU叢集網路 在網路環境中,丟包會觸發重傳,增加延遲並降低叢集效率。優先級流控制 (PFC) 和明確擁塞通知 (ECN) 等技術有助於實現無損或近乎無損的傳輸。 乙太網路人工智慧架構 透過最大限度地減少擁塞和丟包。這使得 人工智慧資料中心網絡 可靠地支援 RoCE 流量、高吞吐量工作負載和大規模分散式 AI 操作。.

乙太網路和 InfiniBand 都不是人工智慧的絕對首選——這取決於效能要求、預算和營運目標。.

InfiniBand歷來為專用高效能運算和人工智慧工作負載提供極低的延遲和高吞吐量。然而,現代 乙太網路人工智慧架構 現在,使用 RoCE、PFC 和 ECN 可以為許多 AI 部署實現可比較的效能,同時提供更低的成本、更廣泛的生態系統支援和更大的靈活性。.

對於許多企業和雲端服務供應商而言,乙太網路越來越受到青睞,因為它能夠實現 白盒人工智慧網絡, 面向人工智慧的開放式網絡以及 分散式人工智慧基礎設施. 。 和 商用矽AI開關 借助 SONiC 等開源軟體,組織可以建立可擴展的系統。 人工智慧資料中心網絡 無需受限於專有網路協定堆疊。.

是的——現代乙太網路非常適合人工智慧工作負載,並且已成為人工智慧基礎架構中成長最快的架構之一。.

400G 和 800G 交換、RoCE、擁塞控制和無損網路技術的進步,已將乙太網路轉變為強大的基礎架構。 GPU叢集網路. 今天的 乙太網路人工智慧架構 能夠支援大規模訓練和推理,同時提供可擴展性、靈活性和強大的成本效益。.

乙太網路對採用乙太網路的組織來說尤其具有吸引力。 白盒人工智慧網絡, 其中,開放的硬體和軟體提高了互通性,降低了整體擁有成本。.

SONiC(雲端開放網路軟體)是一款開源網路作業系統,用於管理現代資料中心、雲端環境和人工智慧基礎架構中的交換器。.

在人工智慧部署中, SONiC AI布料 實現可擴展、可程式化和廠商中立 人工智慧資料中心網絡. 運作在由以下方式供電的開放式交換器上 商用矽AI開關, SONiC 允許組織部署 面向人工智慧的開放式網絡 同時受惠於自動化、遙測和現代編排技術。.

許多企業使用 SONiC 來建構 分散式人工智慧基礎設施, 將硬體和軟體層分離,以獲得靈活性、提高可觀測性並避免供應商鎖定。.

葉脊架構是一種現代資料中心網路設計,其中每個 leaf 交換機都連接到每個脊交換機,從而在所有裝置之間建立可預測的低延遲連接。.

這種架構被廣泛用於 GPU叢集網路 因為它能提供穩定的頻寬、橫向擴展能力,並減少網路瓶頸。隨著 AI 叢集的成長,leaf 脊椎式架構有助於維持 GPU、儲存和運算節點之間高效的東西向流量。.

葉脊拓樸結構是可擴展性的基礎。 乙太網路人工智慧架構 以及高性能 人工智慧資料中心網絡, 尤其是與高速 400G 或 800G 交換和智慧擁塞管理相結合時。.