AIネットワーキング&GPUファブリックリソースセンター

AIインフラストラクチャのためのアーキテクチャ、イーサネットファブリック、RoCE、およびオープンネットワーキング

AIネットワーキングとは何ですか?

AIネットワーキングとは、大規模な人工知能(AI)および機械学習ワークロードをサポートするために必要な高性能ネットワークインフラストラクチャを指します。従来のエンタープライズアプリケーションとは異なり、AIワークロードは、コンピューティング、ストレージ、アクセラレータリソース間で膨大な量のデータが継続的にやり取りされるため、ネットワーク負荷が非常に高くなります。.

最新のAIトレーニング環境は、 東西方向の交通従来のアプリケーションに典型的な南北方向のトラフィックではなく、データセンター内のサーバー間通信。分散トレーニング中、数千個のGPUがモデルパラメータ、勾配、中間データを頻繁に交換して同期を維持し、効率的な GPUクラスタネットワーク 大規模なパフォーマンスを実現する上で不可欠。.

AI クラスターが数十から数千のアクセラレータに拡大するにつれて、ネットワークのパフォーマンスが重要になります。 商用シリコンAIスイッチ, 、 含む 400Gおよび800Gイーサネットプラットフォーム, 大規模なAIワークロードにおけるボトルネックを軽減し、スループットを維持するのに役立ちます。.

このプロセスは、高速なGPU同期と、オールリデュースなどの集団通信操作に大きく依存しています。わずかな遅延、輻輳、パケット損失でも、高価なGPUがアイドル状態になり、モデルのトレーニング速度が低下し、インフラストラクチャの効率が低下する可能性があります。.

これらの要求をサポートするために、最新のAIネットワークは、GPU利用率を最大化し、クラスタ全体でデータを効率的に転送するように設計された低遅延、高帯域幅のファブリックに依存しています。 AI/ML ホワイトペーパー, Edgecore Open Fabric、 そして ブロードコム Tomahawk 6 大規模AIファブリック設計に関する、より詳細な技術的背景を提供する。.

AIワークロードが従来のデータセンターネットワークを崩壊させる理由

AIワークロードは、従来のエンタープライズアプリケーションとは根本的に異なるネットワークインフラストラクチャへの要求を課します。AIクラスタの規模が拡大するにつれて、従来のアーキテクチャはボトルネックとなり、パフォーマンスを制限し、トレーニング時間を長期化させることがよくあります。.

大きな課題は、次のような集中的なGPU集団通信パターンから生じます。 すべて削減, トレーニングの各イテレーションにおいて、大量のデータを多数のGPU間でやり取りする必要がある。これらの処理では、分散ワークロードを同期させるために、極めて高速で予測可能な通信が不可欠である。.

AIワークロードは、短時間だが激しいトラフィックバーストも発生させます。 マイクロバースト, これは従来のイーサネットファブリックに過負荷をかけ、輻輳、パケット損失、再送信を引き起こす可能性があります。たとえ短時間の中断であっても、GPUパイプラインを停止させ、クラスタの効率を著しく低下させる可能性があります。.

これらの課題に対処するために、現代では AIデータセンターネットワーク 次のような技術への依存度が高まっている RDMA(リモートダイレクトメモリアクセス), ロスレスイーサネット, 、そして拡張性の高いleafスパインアーキテクチャ。これらの技術は、AIのトレーニングと推論におけるボトルネックを軽減し、スループットを向上させるのに役立ちます。.

多くの組織も採用している AIのためのオープンネットワーク を通して 分散型AIインフラストラクチャ, ハードウェア層とソフトウェア層を分離することで、拡張性、柔軟性、コスト効率を向上させ、ベンダーロックインを軽減する。.

基本概念

GPUクラスタ通信やイーサネットAIファブリックから、オープンで分散型のインフラストラクチャまで、現代のAIネットワークを形作る6つのコアコンセプトを探究します。.

イーサネット vs InfiniBand

議論の焦点は AIネットワークにおけるイーサネットとInfiniBandの比較 組織が大規模なAIクラスターを拡張するにつれて、その重要性はますます高まっています。両方のテクノロジーは、現代のAIに必要な低遅延と高スループットをサポートできます。 GPUクラスタネットワーク, しかし、コスト、柔軟性、エコシステムのオープン性において違いがあります。InfiniBandは長らく超低遅延HPC環境で好まれてきましたが、ロスレスイーサネット、RoCE、輻輳管理の進歩により、最新のHPCのパフォーマンスは急速に向上しています。 イーサネットAIファブリック. 拡張可能なシステムを構築する組織向け AIデータセンターネットワーク インフラストラクチャに関しては、多くの場合、性能とコスト効率、運用上の簡便性、長期的な柔軟性とのバランスを取ることが決定的な要素となる。.

特徴 イーサネット + RoCE インフィニバンド
料金 より低い より高い
ベンダーロックイン 低い 高い
生態系 広範 専門
AIのパフォーマンス 高い 非常に高い

より深い技術的洞察については RoCE、PFC、およびECN そして 総所有コスト, 弊社の技術リソースをご覧ください。.

AIのためのオープンネットワーキング

AIインフラの規模が拡大するにつれ、多くの組織は、緊密に統合されたハードウェアとソフトウェアに依存する独自のネットワークモデルを見直している。. AIのためのオープンネットワーク ネットワークオペレーティングシステムを基盤となるハードウェアから分離することで、より柔軟でコスト効率の高いアプローチを提供します。.

このアプローチの中核にあるのは ネットワークの分解, これにより、オペレーターは最適なハードウェアとソフトウェアを個別に選択できるようになります。これにより、よりスケーラブルな GPUクラスタネットワーク 同時に、単一ベンダーのエコシステムへの依存度を低減する。.

ホワイトボックスAIネットワーキング は、このモデルを実現する重要な要素です。標準化されたハードウェアをベースに構築され、 商用シリコンAIスイッチ, ホワイトボックスプラットフォームは、独自システムの高額なコストをかけずに、ハイパースケールクラスのパフォーマンスを実現します。.

オペレーティングシステムなど SONiC 自動化、テレメトリ、最新の API を通じて、高度にスケーラブルでプログラマブルなネットワークを実現します。適切に設計された SONiC AIファブリック 大規模なAIワークロードをサポートしながら、運用を簡素化するのに役立ちます。.

結果は低い 総所有コスト(TCO) ハードウェアの割増コストの削減、運用効率の向上、ベンダーロックインの最小化を通じて、ネットワークライフサイクル全体にわたってメリットを提供します。.

従来型ネットワークとオープンAIネットワークの比較
従来型のAIネットワーク オープンAIネットワーキング
独自のスタック 分解されたスタック
閉鎖済み NOS SONiC
ベンダーロックイン マルチベンダー対応の柔軟性
総所有コスト(TCO)が上昇 TCOの削減

Edgecoreの強みはここにあります。高性能なオープンハードウェア、業界をリードするシリコン、そして幅広いエコシステムとの互換性を組み合わせることで、拡張性、効率性、そして将来性を備えたAIネットワークインフラストラクチャを実現します。詳細はこちらをご覧ください。 現実世界におけるAIの導入事例 オープンAIファブリックが実運用されている様子を見る。.

拡張性の高いAIインフラストラクチャを構築する準備はできていますか?

オープンなネットワークソリューションが、最新のAIファブリック、高性能GPUクラスター、そして次世代データセンターアーキテクチャをどのようにサポートできるかをご覧ください。.

リソースライブラリ

よくある質問

AIネットワーキングとは、人工知能ワークロードを支えるGPU、サーバー、ストレージ、スイッチを接続するために使用される特殊なネットワークインフラストラクチャを指します。従来のエンタープライズネットワークとは異なり、, AIデータセンターネットワーク 分散コンピューティングリソース間における、極めて高い帯域幅、超低遅延、および膨大な東西トラフィックをサポートする必要があります。.

モダンな GPUクラスタネットワーク は、トレーニングデータ、モデルパラメータ、推論ワークロードを大規模なGPUクラスタ間で効率的に移動させるように設計されています。これは通常、を使用して実現されます。 イーサネットAIファブリック, 高速スイッチング、スケーラブルなleafスパインアーキテクチャを採用している組織は数多くあります。 ホワイトボックスAIネットワーキング そして AIのためのオープンネットワーク コスト削減、ベンダーロックインの回避、インフラストラクチャの効率的な拡張を実現するため。.

GPUクラスタでは、分散型AIワークロードがトレーニングや推論中にGPU間で絶えずデータを交換するため、低遅延のネットワーク接続が不可欠です。通信にわずかな遅延が生じるだけでも、同期が遅くなり、クラスタ全体の効率が低下する可能性があります。.

大規模に GPUクラスタネットワーク, オールリデュース、勾配同期、集合通信などの操作は、東西方向のトラフィックを大量に生成します。低レイテンシにより、GPUは計算に費やす時間を増やし、データの待ち時間を減らすことができます。高性能 AIデータセンターネットワーク 高速化によりボトルネックを最小限に抑える イーサネットAIファブリック, RDMA、最適化された輻輳管理。.

RoCE (RDMA over Converged Ethernet)は、イーサネット上でリモートダイレクトメモリアクセスを可能にするネットワーク技術であり、サーバーとGPUがCPUを介さずにメモリ間でデータを直接転送することを可能にします。.

RoCEは現代において広く利用されている GPUクラスタネットワーク レイテンシを低減し、CPUオーバーヘッドを下げ、AIワークロードのスループットを向上させるため。 AIデータセンターネットワーク 環境、RoCE が役立ちます イーサネットAIファブリック RoCEは、イーサネットの柔軟性とコスト面での利点を維持しながら、専用インターコネクトに匹敵するパフォーマンスを実現します。特にスケーラブルなネットワークにおいて重要です。 分散型AIインフラストラクチャ 高速なGPU間通信が不可欠な場面。.

ロスレスイーサネットはAIにとって重要である。なぜなら、パケット損失は分散トレーニングや推論中にGPUの通信性能を著しく低下させる可能性があるからだ。.

大きく GPUクラスタネットワーク 環境によっては、パケット損失によって再送信が発生し、レイテンシが増加し、クラスタの効率が低下します。優先フロー制御(PFC)や明示的輻輳通知(ECN)などの技術は、ロスレスまたはほぼロスレスの環境を実現するのに役立ちます。 イーサネットAIファブリック 混雑とパケット損失を最小限に抑えることで、 AIデータセンターネットワーク RoCEトラフィック、高スループットワークロード、および大規模分散AI運用を確実にサポートするため。.

イーサネットもインフィニバンドも、AIにとって必ずしも優れているとは言えず、性能要件、予算、運用目標によって異なります。.

InfiniBandはこれまで、特殊なHPCおよびAIワークロード向けに極めて低いレイテンシと高いスループットを実現してきました。しかし、現代の イーサネットAIファブリック RoCE、PFC、ECNを活用することで、多くのAI導入において同等のパフォーマンスを実現できるだけでなく、コスト削減、より幅広いエコシステムサポート、そしてより高い柔軟性を提供できるようになりました。.

多くの企業やクラウドプロバイダーにとって、イーサネットはますます好まれるようになっている。なぜなら、イーサネットは ホワイトボックスAIネットワーキング, AIのためのオープンネットワーク、 そして 分散型AIインフラストラクチャ. 。 と 商用シリコンAIスイッチ SONiCなどのオープンソフトウェアを使用することで、組織は拡張可能なシステムを構築できます。 AIデータセンターネットワーク 独自のネットワークスタックに縛られることなく。.

はい、最新のイーサネットはAIワークロードに非常に適しており、AIインフラストラクチャにおいて最も急速に成長しているアーキテクチャの1つとなっています。.

400Gおよび800Gスイッチング、RoCE、輻輳制御、ロスレスネットワークの進歩により、イーサネットは強力な基盤へと変貌を遂げました。 GPUクラスタネットワーク. 今日の イーサネットAIファブリック 大規模なトレーニングと推論をサポートしつつ、拡張性、柔軟性、そして高いコスト効率を実現します。.

イーサネットは、特に以下の組織にとって魅力的です。 ホワイトボックスAIネットワーキング, オープンなハードウェアとソフトウェアは、相互運用性を向上させ、総所有コストを削減します。.

SONiC(Software for Open Networking in the Cloud)は、最新のデータセンター、クラウド環境、およびAIインフラストラクチャにおけるスイッチの管理に使用されるオープンソースのネットワークオペレーティングシステムです。.

AIの導入において、 SONiC AIファブリック 拡張性、プログラマブル性、ベンダーニュートラル性を実現します AIデータセンターネットワーク. オープンスイッチで動作し、 商用シリコンAIスイッチ, SONiC により組織は展開できます AIのためのオープンネットワーク 自動化、テレメトリ、最新のオーケストレーションの恩恵を受けながら。.

多くの企業がSONiCを使用して構築しています 分散型AIインフラストラクチャ, ハードウェア層とソフトウェア層を分離することで、柔軟性を高め、可視性を向上させ、ベンダーロックインを回避する。.

リーフスパインアーキテクチャは、最新のデータセンターネットワーク設計であり、すべてのleafスイッチがすべてのスパインスイッチに接続することで、すべてのデバイス間で予測可能で低遅延の接続を実現します。.

このアーキテクチャは広く使用されています GPUクラスタネットワーク leafスパイン設計は、安定した帯域幅、水平方向の拡張性、およびネットワークのボトルネックの軽減を実現するためです。AIクラスターが拡大するにつれて、GPU、ストレージ、および計算ノード間の効率的な東西トラフィックフローの維持に役立ちます。.

葉と棘のトポロジーはスケーラブルな基盤となる イーサネットAIファブリック 高性能 AIデータセンターネットワーク, 特に、高速な400Gまたは800Gスイッチングとインテリジェントな輻輳管理と組み合わせた場合に効果的です。.