什麼是人工智慧網路?
AI網路是指支援大規模人工智慧和機器學習工作負載所需的高效能網路基礎架構。與傳統企業應用不同,AI工作負載對網路的要求極高,因為它們依賴海量資料在運算、儲存和加速器資源之間持續流動。.
現代人工智慧訓練環境會產生顯著影響。 東西向交通分散式訓練採用的是資料中心內部的伺服器間通信,而非傳統應用中常見的南北向流量。在分散式訓練過程中,數千個GPU頻繁交換模型參數、梯度和中間資料以保持同步,從而實現高效傳輸。 GPU叢集網路 對大規模性能至關重要。.
隨著人工智慧集群從數十個加速器擴展到數千個加速器,網路效能變得至關重要。高容量交換機由…提供支援 商用矽AI開關, , 包括 400G 和 800G 乙太網路平台, 有助於減少瓶頸,維持大規模 AI 工作負載的吞吐量。.

這個過程高度依賴快速的GPU同步和集體通訊操作,例如all-reduce。即使是少量的延遲、擁塞或丟包也會導致昂貴的GPU閒置,從而減慢模型訓練速度並降低基礎設施效率。.
為了滿足這些需求,現代人工智慧網路依賴低延遲、高頻寬的架構,旨在最大限度地利用 GPU 並有效地在叢集中傳輸資料。支持資源,例如: 人工智慧/機器學習白皮書, Edgecore Open Fabric以及 博通 Tomahawk 6 提供關於大規模人工智慧織物設計的更深層技術背景。.
為什麼人工智慧工作負載會破壞傳統資料中心網路?
人工智慧工作負載對網路基礎架構的要求與傳統企業應用截然不同。隨著人工智慧叢集規模的擴大,傳統架構往往會成為瓶頸,限制效能並延長訓練時間。.
主要挑戰來自密集的GPU集體通訊模式,例如: 全部減少, 其中,在每次訓練迭代期間,都需要在多個GPU之間交換大量資料。這些操作需要極快且可預測的通信,以保持分散式工作負載的同步。.
AI工作負載也會產生短暫但強度很高的流量突發,稱為 微爆流, 這會使傳統的乙太網路架構不堪重負,導致網路擁塞、丟包和重傳。即使是短暫的中斷也會使GPU管線停滯,並顯著降低叢集效率。.
為了應對這些挑戰,現代 人工智慧資料中心網絡 越來越依賴諸如以下技術 RDMA(遠端直接記憶體存取), 無損以太網, 以及可擴展的 leaf 脊椎架構。這些技術有助於減少瓶頸,同時提高 AI 訓練和推理的吞吐量。.
許多組織也在採用 面向人工智慧的開放式網絡 透過 分散式人工智慧基礎設施, 將硬體和軟體層分離,以提高可擴展性、靈活性和成本效益,同時減少供應商鎖定。.
核心概念
探索塑造現代人工智慧網路的六大核心概念——從 GPU 叢集通訊和乙太網路人工智慧架構到開放、解耦的基礎設施。.
乙太網路與InfiniBand
關於此的辯論 乙太網路與 InfiniBand 在人工智慧網路領域的比較 隨著企業規模化擴展大型人工智慧集群,這項技術的重要性日益凸顯。這兩種技術都能滿足現代人工智慧叢集所需的低延遲和高吞吐量。 GPU叢集網路, 但它們在成本、靈活性和生態系統開放性方面有所不同。 InfiniBand 長期以來一直是超低延遲高效能運算 (HPC) 環境的首選,而無損乙太網路、RoCE 和擁塞管理技術的進步正在迅速提升現代網路的效能。 乙太網路人工智慧架構. 對於建構可擴展組織的機構而言 人工智慧資料中心網絡 對於基礎設施而言,決策往往取決於如何在效能、成本效益、操作簡單性和長期彈性之間取得平衡。.
| 特徵 | 乙太網路 + RoCE | InfiniBand |
|---|---|---|
| 成本 | 降低 | 更高 |
| 供應商鎖定 | 低的 | 高的 |
| 生態系統 | 廣闊 | 專門 |
| 人工智慧效能 | 高的 | 非常高 |
為了更深入了解技術細節 RoCE、PFC 和 ECN 及 總擁有成本, 探索我們的技術資源。.
面向人工智慧的開放網絡
隨著人工智慧基礎設施的擴展,許多組織正在重新思考依賴緊密整合的硬體和軟體的專有網路模型。. 面向人工智慧的開放式網絡 透過將網路作業系統與底層硬體分離,提供了更靈活、更經濟高效的方法。.
這種方法的核心是 網路分解, 這使得營運商能夠獨立選擇最佳的硬體和軟體。這實現了更強大的可擴展性。 GPU叢集網路 同時減少對單一供應商生態系統的依賴。.
白盒人工智慧網絡 是該模型的關鍵推動因素。它基於標準化硬體構建,並由…驅動。 商用矽AI開關, 白盒平台能夠提供超大規模的效能,而無需支付專有系統的高昂成本。.
例如作業系統 SONiC 透過自動化、遙測和現代 API 實現高度可擴展、可編程的網路。精心設計的 SONiC AI布料 有助於簡化操作,同時支援大規模人工智慧工作負載。.
結果較低 總擁有成本(TCO) 透過降低硬體溢價、提高營運效率和最大限度地減少供應商鎖定,貫穿網路生命週期。.
傳統人工智慧網路與開放式人工智慧網絡
| 傳統人工智慧網路 | 開放式人工智慧網絡 |
|---|---|
| 專有堆疊 | 分解堆疊 |
| 已關閉的NOS | SONiC |
| 供應商鎖定 | 多供應商彈性 |
| 總擁有成本更高 | 降低 TCO |
Edgecore 的獨特之處在於,它融合了高效能開放硬體、業界領先的晶片以及廣泛的生態系統相容性,從而提供可擴展、高效且面向未來的 AI 網路基礎設施。了解更多 現實世界的人工智慧部署 親眼見證開源人工智慧布料的生產應用。.
資源庫
為什麼 SONiC 非常適合 AI 資料中心? | 探討 SONiC 如何實現可擴展、開放和靈活的網路架構,以優化高效能 AI 和雲端資料中心環境。.
從基礎元件到完整方案:一站式企業 AI 開放基礎架構解決方案 | 詳細介紹了模組化、開放式網路元件如何組合在一起,為企業 AI 部署提供完整的交鑰匙基礎架構。.
以規模驅動 AI:PFC 與 ECN 在大型 GPU 部署中不可或缺的資料中心橋接技術 | 解釋了 PFC 和 ECN 技術如何實現無損乙太網路效能,這對於大規模 GPU 叢集和 AI 訓練工作負載至關重要。.
Broadcom Tomahawk 6:為最新一代人工智慧和超大規模網路提供支持 | 介紹了博通的 Tomahawk 6 交換架構如何支援下一代 400G/800G AI 和超大規模資料中心網路。.
立即部署的五個殺手級 AI 應用理由! | 重點介紹推動可擴展、高效能資料中心網路需求的關鍵實際人工智慧應用驅動因素。.
人工智慧/機器學習白皮書 支援人工智慧和機器學習工作負載的網路基礎設施最佳實踐。.
Edgecore Open Fabric 白皮書 | 深入探討可擴展的人工智慧網路架構和部署注意事項。.
總擁有成本 (TCO) | 分析現代人工智慧環境的基礎設施效率、可擴展性和成本優化。.
建構人工智慧優化的資料中心架構:解耦與高效能網路的融合 | 了解分散式基礎架構和開放式網路如何實現可擴展、高效能的 AI 架構,從而針對現代 GPU 工作負載進行最佳化。.
利用博通的 Edgecore 開放式網路交換器和企業級 SONiC 為企業解決方案提供強大支持 | 了解 Edgecore 和 Enterprise SONiC 如何結合開放的硬體和軟體來建立可擴展的、可用於生產的 AI 網路。.
建構人工智慧的完美架構:DriveNets 調度乙太網 | 探索調度乙太網路如何改善大規模 AI 叢集的擁塞管理、延遲和吞吐量。.
可程式解耦網路運行環境 | 了解可程式化、解耦式網路如何為現代人工智慧基礎設施帶來更高的自動化、靈活性和控制力。.
一套 NOS,駕馭 600 種網路,徹底擺脫廠商綁定 | 了解統一網路作業系統如何簡化操作,同時減少大規模部署中的供應商鎖定。.
Broadcom SONiC X Edgecore 資料中心交換器 | 展示了 Edgecore 和 Broadcom SONiC 如何為現代資料中心架構提供可擴展的高效能交換。.
透過鈺登科技的SONiC社群發行版解鎖創新 | 展示了 Edgecore 的社群版 SONiC 發行版如何為現代資料中心環境實現靈活、開放和可擴展的網路部署。.
IPNexia攜手Edgecore Networks和Deca Consulting為資料中心提供支持 | 了解 IPNexia 如何使用 Edgecore 開放式網路解決方案建立高效能、可擴展的資料中心網路。.
Edgecore Networks:率先採用 Submer、Stellium 資料中心和 Circle B 進行浸入式冷卻 | 探索浸沒式冷卻和開放式網路如何幫助大規模支援高密度、高能源效率的 AI 基礎設施。.
LINX 選擇 Edgecore 網路和 IP Infusion 進行 LON2 LAN 刷新 | 了解 LINX 如何利用解耦網路實現網路基礎架構現代化,從而提高可擴展性和營運靈活性。.
Edgecore在NCTU部署基於OpenFlow的全球SDN | 重點介紹了軟體定義網路如何實現集中控制和更大規模的網路可程式性。.






