AIネットワーキングとは何ですか?
AIネットワーキングとは、大規模な人工知能(AI)および機械学習ワークロードをサポートするために必要な高性能ネットワークインフラストラクチャを指します。従来のエンタープライズアプリケーションとは異なり、AIワークロードは、コンピューティング、ストレージ、アクセラレータリソース間で膨大な量のデータが継続的にやり取りされるため、ネットワーク負荷が非常に高くなります。.
最新のAIトレーニング環境は、 東西方向の交通従来のアプリケーションに典型的な南北方向のトラフィックではなく、データセンター内のサーバー間通信。分散トレーニング中、数千個のGPUがモデルパラメータ、勾配、中間データを頻繁に交換して同期を維持し、効率的な GPUクラスタネットワーク 大規模なパフォーマンスを実現する上で不可欠。.
AI クラスターが数十から数千のアクセラレータに拡大するにつれて、ネットワークのパフォーマンスが重要になります。 商用シリコンAIスイッチ, 、 含む 400Gおよび800Gイーサネットプラットフォーム, 大規模なAIワークロードにおけるボトルネックを軽減し、スループットを維持するのに役立ちます。.

このプロセスは、高速なGPU同期と、オールリデュースなどの集団通信操作に大きく依存しています。わずかな遅延、輻輳、パケット損失でも、高価なGPUがアイドル状態になり、モデルのトレーニング速度が低下し、インフラストラクチャの効率が低下する可能性があります。.
これらの要求をサポートするために、最新のAIネットワークは、GPU利用率を最大化し、クラスタ全体でデータを効率的に転送するように設計された低遅延、高帯域幅のファブリックに依存しています。 AI/ML ホワイトペーパー, Edgecore Open Fabric、 そして ブロードコム Tomahawk 6 大規模AIファブリック設計に関する、より詳細な技術的背景を提供する。.
AIワークロードが従来のデータセンターネットワークを崩壊させる理由
AIワークロードは、従来のエンタープライズアプリケーションとは根本的に異なるネットワークインフラストラクチャへの要求を課します。AIクラスタの規模が拡大するにつれて、従来のアーキテクチャはボトルネックとなり、パフォーマンスを制限し、トレーニング時間を長期化させることがよくあります。.
大きな課題は、次のような集中的なGPU集団通信パターンから生じます。 すべて削減, トレーニングの各イテレーションにおいて、大量のデータを多数のGPU間でやり取りする必要がある。これらの処理では、分散ワークロードを同期させるために、極めて高速で予測可能な通信が不可欠である。.
AIワークロードは、短時間だが激しいトラフィックバーストも発生させます。 マイクロバースト, これは従来のイーサネットファブリックに過負荷をかけ、輻輳、パケット損失、再送信を引き起こす可能性があります。たとえ短時間の中断であっても、GPUパイプラインを停止させ、クラスタの効率を著しく低下させる可能性があります。.
これらの課題に対処するために、現代では AIデータセンターネットワーク 次のような技術への依存度が高まっている RDMA(リモートダイレクトメモリアクセス), ロスレスイーサネット, 、そして拡張性の高いleafスパインアーキテクチャ。これらの技術は、AIのトレーニングと推論におけるボトルネックを軽減し、スループットを向上させるのに役立ちます。.
多くの組織も採用している AIのためのオープンネットワーク を通して 分散型AIインフラストラクチャ, ハードウェア層とソフトウェア層を分離することで、拡張性、柔軟性、コスト効率を向上させ、ベンダーロックインを軽減する。.
基本概念
GPUクラスタ通信やイーサネットAIファブリックから、オープンで分散型のインフラストラクチャまで、現代のAIネットワークを形作る6つのコアコンセプトを探究します。.
イーサネット vs InfiniBand
議論の焦点は AIネットワークにおけるイーサネットとInfiniBandの比較 組織が大規模なAIクラスターを拡張するにつれて、その重要性はますます高まっています。両方のテクノロジーは、現代のAIに必要な低遅延と高スループットをサポートできます。 GPUクラスタネットワーク, しかし、コスト、柔軟性、エコシステムのオープン性において違いがあります。InfiniBandは長らく超低遅延HPC環境で好まれてきましたが、ロスレスイーサネット、RoCE、輻輳管理の進歩により、最新のHPCのパフォーマンスは急速に向上しています。 イーサネットAIファブリック. 拡張可能なシステムを構築する組織向け AIデータセンターネットワーク インフラストラクチャに関しては、多くの場合、性能とコスト効率、運用上の簡便性、長期的な柔軟性とのバランスを取ることが決定的な要素となる。.
| 特徴 | イーサネット + RoCE | インフィニバンド |
|---|---|---|
| 料金 | より低い | より高い |
| ベンダーロックイン | 低い | 高い |
| 生態系 | 広範 | 専門 |
| AIのパフォーマンス | 高い | 非常に高い |
より深い技術的洞察については RoCE、PFC、およびECN そして 総所有コスト, 弊社の技術リソースをご覧ください。.
AIのためのオープンネットワーキング
AIインフラの規模が拡大するにつれ、多くの組織は、緊密に統合されたハードウェアとソフトウェアに依存する独自のネットワークモデルを見直している。. AIのためのオープンネットワーク ネットワークオペレーティングシステムを基盤となるハードウェアから分離することで、より柔軟でコスト効率の高いアプローチを提供します。.
このアプローチの中核にあるのは ネットワークの分解, これにより、オペレーターは最適なハードウェアとソフトウェアを個別に選択できるようになります。これにより、よりスケーラブルな GPUクラスタネットワーク 同時に、単一ベンダーのエコシステムへの依存度を低減する。.
ホワイトボックスAIネットワーキング は、このモデルを実現する重要な要素です。標準化されたハードウェアをベースに構築され、 商用シリコンAIスイッチ, ホワイトボックスプラットフォームは、独自システムの高額なコストをかけずに、ハイパースケールクラスのパフォーマンスを実現します。.
オペレーティングシステムなど SONiC 自動化、テレメトリ、最新の API を通じて、高度にスケーラブルでプログラマブルなネットワークを実現します。適切に設計された SONiC AIファブリック 大規模なAIワークロードをサポートしながら、運用を簡素化するのに役立ちます。.
結果は低い 総所有コスト(TCO) ハードウェアの割増コストの削減、運用効率の向上、ベンダーロックインの最小化を通じて、ネットワークライフサイクル全体にわたってメリットを提供します。.
従来型ネットワークとオープンAIネットワークの比較
| 従来型のAIネットワーク | オープンAIネットワーキング |
|---|---|
| 独自のスタック | 分解されたスタック |
| 閉鎖済み NOS | SONiC |
| ベンダーロックイン | マルチベンダー対応の柔軟性 |
| 総所有コスト(TCO)が上昇 | TCOの削減 |
Edgecoreの強みはここにあります。高性能なオープンハードウェア、業界をリードするシリコン、そして幅広いエコシステムとの互換性を組み合わせることで、拡張性、効率性、そして将来性を備えたAIネットワークインフラストラクチャを実現します。詳細はこちらをご覧ください。 現実世界におけるAIの導入事例 オープンAIファブリックが実運用されている様子を見る。.
リソースライブラリ
SONiC が AI データ センターに最適な理由 SONiCが、高性能AIおよびクラウドデータセンター環境向けに最適化された、拡張性、オープン性、柔軟性に優れたネットワークアーキテクチャをどのように実現するのかを探ります。.
ビルディングブロックからソリューションへ: エンタープライズ AI 向けターンキーオープンインフラストラクチャソリューション モジュール式でオープンなネットワークコンポーネントがどのように組み合わさって、企業向けAI導入のための完全なターンキーインフラストラクチャを実現するのかを解説します。.
大規模な AI の実現: 大規模 GPU 導入における PFC と ECN によるデータセンター ブリッジの不可欠な役割 PFCおよびECN技術が、大規模GPUクラスタやAIトレーニングワークロードにとって不可欠な、損失のないイーサネット性能をどのように実現するのかを解説します。.
Broadcom Tomahawk 6: 最新世代のAIとハイパースケールネットワークを強化 BroadcomのTomahawk 6スイッチングアーキテクチャが、次世代の400G/800G AIおよびハイパースケールデータセンターネットワークをどのようにサポートするかを解説します。.
今すぐ導入すべき 5 つのキラー AI アプリの理由! 拡張性と高性能を備えたデータセンターネットワークへの需要を加速させている、現実世界における主要なAIアプリケーション推進要因を重点的に取り上げます。.
AI/ML ホワイトペーパー AIおよび機械学習ワークロードをサポートするネットワークインフラストラクチャのベストプラクティス。.
Edgecore Open Fabric ホワイトペーパー 拡張性の高いAIネットワークアーキテクチャと導入に関する考察。.
総所有コスト(TCO) 現代のAI環境におけるインフラの効率性、拡張性、およびコスト最適化に関する分析。.
AIに最適化されたデータセンターファブリックの構築:分散化と高性能ネットワークの融合 分散型インフラストラクチャとオープンネットワークが、最新のGPUワークロードに最適化された、拡張性と高性能を備えたAIファブリックをどのように実現するのかを学びましょう。.
BroadcomのEdgecoreオープンネットワークスイッチとエンタープライズグレードのSONiCでエンタープライズソリューションを強化 EdgecoreとEnterprise SONiCが、オープンなハードウェアとソフトウェアを組み合わせて、拡張性の高い、実運用可能なAIネットワークを構築する方法をご覧ください。.
AIに最適なファブリックの構築:DriveNetsスケジュールドイーサネット スケジュール型イーサネットが大規模AIクラスタの輻輳管理、レイテンシ、スループットをどのように改善するかを探ります。.
プログラマブルな分離型ネットワーク運用環境 プログラマブルで分散型のネットワークが、最新のAIインフラストラクチャに、より高度な自動化、柔軟性、および制御をもたらす方法をご覧ください。.
600のネットワーク。1つのNOS。ベンダーロックインなし。. 統合ネットワークオペレーティングシステムが、大規模展開において運用を簡素化し、ベンダーロックインを軽減する方法を学びましょう。.
Broadcom SONiC X Edgecore データセンタースイッチ EdgecoreとBroadcom SONiCが、最新のデータセンターファブリック向けに拡張性と高性能を備えたスイッチングを実現する方法を実証します。.
Edgecore コミュニティでイノベーションを解き放つ SONiC ディストリビューション Edgecoreのコミュニティ版SONiCディストリビューションが、現代のデータセンター環境向けに、柔軟性、オープン性、拡張性に優れたネットワーク展開をどのように実現するかを示します。.
IPNexia、Edgecore NetworksとDeca Consultingと提携してデータセンターを強化 IPNexiaがEdgecoreのオープンネットワーキングソリューションを使用して、高性能で拡張性の高いデータセンターネットワークを構築した方法をご覧ください。.
Edgecore Networks: Submer、Stellium Data Centers、Circle Bによる浸漬冷却の先駆者 液浸冷却とオープンネットワークが、大規模で電力効率の高い高密度AIインフラストラクチャをどのようにサポートするのかを探ります。.
LINX、LON2 LAN 更新に Edgecore Networks と IP Infusion を選択 LINXが、拡張性と運用上の柔軟性を向上させるために、分散型ネットワークを使用してネットワークインフラストラクチャをどのように近代化したかをご覧ください。.
EdgecoreはNCTUにOpenFlowベースのグローバルSDNを導入しました ソフトウェア定義ネットワークがいかにして大規模なネットワークにおいて、集中制御と高度なプログラマビリティを実現したかを解説します。.






