AI-MLデータセンターの概要

人工知能(AI)および機械学習(ML)アプリケーションが拡大するにつれて、これらのAI-MLアプリケーションをサポートするネットワークでは、大規模なデータフローを処理するための容量の増加が必要になります。この要件は、AI-MLデータセットを格納するデータセンターに特に当てはまります。Junos® OS Evolvedは、AI-MLデータセンター向けの一連の革新的な機能を提供します。ネットワーク管理者は、このガイドを使用して、これらの機能を設定し、AI-MLデータセンターファブリック内の運用を最適化する方法を学習できます。

大規模言語モデル(LLM)などの生成AIやMLアプリケーションは、データセットの統計分析に基づいています。計算モデルがデータからパターンを見つける頻度が高いほど、そのパターンを出力で強化します。この反復的なパターン検出を通じて、これらのモデルは人間の音声を説得力を持って模倣するなどのタスクを達成できます。ただし、生成AIアプリケーションの優れた性能は、トレーニングされたデータセットによってのみ有効です。データセットが大きいほど、モデルが検出できるパターンが多くなります。このため、AIおよびMLアプリケーションには大規模なデータセットが必要です。これらのデータセットはデータセンターに保存されます。

トレーニングの速度を上げるために、AI モデルや ML モデルは多くの場合、並列コンピューティングを通じてデータ センター ネットワーク内でトレーニングされます。GPU(グラフィック処理ユニット)はクラスター化され、データ センター全体に分散されたサーバー ノードでホストされます。これらのGPUクラスターでは、複雑な計算が同時に行われます。ネットワークは、完全にトレーニングされたモデルを作成するために、クラスター内のGPUからの出力を同期させる必要があります。この同期には、ネットワークのバックエンド全体で大規模なデータフロー(以下、 エレファントフローと呼びます)を継続的に移動させる必要があります。

AI-MLデータセンターにおけるエレファントフローには、堅牢なネットワークが必要です。エレファントフローに対処する際、ネットワークが不十分だと、トラフィックの混雑、パケットのドロップ、リンク障害などの問題にすぐに遭遇します。このようなネットワークの問題は、高レベルの精度が要求されるデータを扱う場合、特に許容されません。AI-MLデータセンターに最適な堅牢なネットワーク設計の1つに、レール最適化ストライプがあります。このAIクラスターアーキテクチャは、宛先と同じレール上のGPUにデータを移動することで、ネットワークの中断を最小限に抑えます。IP Closアーキテクチャも、機能的なAI-MLデータセンターファブリック設計です。

Junos OS Evolvedを搭載したジュニパーネットワークス®のQFXシリーズスイッチは、レール最適化ストライプアーキテクチャとIP Closネットワーク設計の両方に最適です。例えば、QFX5220-32CD、QFX5230-64CD、QFX5240-64OD、およびQFX5240-QDスイッチは、リーフデバイス、スパインデバイス、スーパースパインデバイスとして、どちらのネットワークタイプでもうまく機能します。これらのスイッチは、ポイントオブディストリビューション(POD)と呼ばれるリーフスパインスイッチのグループとしても機能します。データセンターでより大規模なAI-MLクラスターを構築するには、スーパースパインレイヤーを使用して異なるPODを相互接続します。これらのスイッチは、単一PODまたは複数のPODとして展開することで、最大限の柔軟性とネットワークの冗長性を得ることができます。さらに、これらのデバイスは、AI-MLデータセンターで一般的な多くのロードバランシングやトラフィック管理の問題を解決する高度なAI-ML機能をサポートしています。