IGP異常検知の概要

このトピックでは、IGP異常検知の概要、その機能、スケーリング動作、制限事項について説明します。

概要

IGP異常検知は、オンボードされたデバイスから収集したデータに基づいて、ネットワーク内で機能しているIGPの異常を特定します。Routing Directorは、オンボードデバイスからIGPリンクステートデータベース(LSDB)とIGPステート情報を定期的に収集します。プレフィックス、隣接関係、ノードに関連する逸脱を検出します。収集されたデータは、フラップ、エントリの重複、設定パラメータの突然の変更など、IGPトポロジーの異常なパターンや不一致を特定するために使用されます。これらの検知された異常は、IGPヒートマップ (Observability > Routing > Route Topology) に表示され、可視化やトラブルシューティングが容易になります。

異常検知は主に、リンク状態、隣接関係情報、プレフィックスアドバタイズメントなどのIGPデータ内の不一致や逸脱を特定することに重点を置いています。各異常は、LSDBオブジェクト(プレフィックス、隣接関係、ノード)の変化を監視する定義済みの検出ルールに関連付けられています。これらのルールは状態データを分析し、違反した場合、Routing Directorはイベントを異常メッセージとして発生させます。

検出された異常はIGPヒートマップで表示され、各ノードとリンクは異常の重大度に応じて色分けされています。この色分類により、注意が必要な問題を簡単に特定できます。このヒートマップは、ネットワークの運用状態を分析するのに役立ちます。Routing Directorは、加入したデバイスからIGP LSDBおよびIGP状態情報を定期的に収集します。収集されたデータは、フラップ、エントリの重複、設定されたパラメーターの突然の変更などのIGPの問題を分析するために使用されます。

アラートの重大度レベルとそれに対応する色は次のとおりです。

  • 重要—赤

  • メジャー—オレンジ

  • マイナー—黄色

  • 情報—白

注:

検出された異常は、イベントページ(監視機能>健全性>イベント)にIGP関連アラートとして公開されます。これらのアラートは、ネットワークの全体的なルーティングの健全性に直接寄与し、正常性ダッシュボードページ(正常性>正常性>正常性ダッシュボード)に表示されます。

Routing Directorでは、異常をアラートとして表示し、ルーティングの健全性への影響を示すことで、トポロジーレベルの問題と全体的なルーティングの健全性ステータスへの影響を簡単に関連付けることができます。

拡張性と制限

IGP異常検知は、単一のIGPドメイン内に最大1000ノード(デバイス)を持つネットワークの監視をサポートします。各デバイスのLSDBには完全なトポロジー情報が含まれているため、LSDBデータは最大2台のデバイスから収集できます。IGPの状態は、プロトコルレベルの動作を監視するために、最大200台のデバイスから収集できます。

LSDBに加えて、Routing DirectorはIGP状態データを収集してリアルタイムの動作を分析します。最大200台のデバイスでサブスクリプションできます。

警告:
  • サポートされているスケールは 1000 ノードですが、LSDB の制限である 1000 モードを超えることが妨げられることはありません。パフォーマンスの低下を防ぐために、制限内にとどまることをお勧めします。

  • LSDB は大量のリソースを消費するため、負荷の軽い CPU デバイスから LSDB ストリーミングを購読することをお勧めします。IGP状態は、スーパーコア、コア、アグリゲーション、またはプリアグリゲーションデバイスからサブスクライブできます。

異常カテゴリ

Routing Directorは、LSDBおよびIGPの状態データを継続的に監視して、ネットワーク動作の異常を検出します。 表1は 、異常の種類、その重大度、説明、およびそのような異常が観察された場合に生成される対応するメッセージを示しています。

表1:検知された異常の種類とその詳細
異常の詳細 説明
カテゴリー: フラップ

プレフィックスフラップ

メッセージ

観測されたプレフィックス<x.x.x.x>はインスタンスの<systemID>によって発信されました- DEFAULTは<date:time UTCにダウンしました>

重大度

情報

説明

この異常は、プレフィックスが IS-IS ドメインでダウンまたはアップしたことを示しています。

これは、リンクのアップグレードなどの定期的なメンテナンス作業中や、ノードの再起動時に発生する可能性があります。プレフィックスが外部で、別のドメインから再配布されている場合、その外部ドメインのメンテナンスまたは設定の更新が原因でフラップが発生する可能性があります。

隣接フラップ

メッセージ

隣接関係のフラップが観測されました:インスタンスからのネイバー<<ホスト名>との送信元ホスト名>-DEFAULTは<date:time UTCに再びアドバタイズを開始しました>

重大度

情報

説明

この異常は、IS-IS隣接関係がダウンしたか、繰り返し起動したことを示しています。

これは、定期的なメンテナンス、リンクの変更、またはノードのアップグレード中に発生する可能性があります。場合によっては、IS-IS Helloメッセージの有効期限切れやBFDセッションのダウンが原因で発生することがあります。ほとんどの場合、BFDまたはHelloメッセージのタイムアウトは、ローカルまたはネイバーノードにCPU混雑がある場合に発生します。IS-IS隣接関係がサードパーティネットワーク上で実行されている場合は、そのネットワークの輻輳が原因である可能性があります。また、設定された隣接関係のスケールが設定された間隔でサポートされていない場合にも発生します。

ノードフラップ

メッセージ

観測されたノードのフラップ: <hostname> from instance-DEFAULT at time: <start time:end time> UTC

重大度

情報

説明

この異常は、ノード上のすべての隣接関係が失われたことを示しています。ノードがダウンしていなくても、ノードがネットワークへのすべての接続を失い、ネットワークの他の部分から見えなくなるため、異常が発生します。これは、スケジュールされたメンテナンス中またはノードのアップグレード中に発生する可能性があります。場合によっては、ルーティングプロセスのソフトウェアバグが原因で発生することもあります。

カテゴリー: 重複検出
ホスト名が重複しています

メッセージ

インスタンスからの重複したエントリ hostname:<Hostname>, <systemID1>: DEFAULT found at:<start date, time: end date, time>UTC

重大度

クリティカル

説明

この異常は、2つのノードが同じホスト名で設定されていることを示しています。ネットワーク管理者は、識別やレポートの際に混乱を避けるため、各デバイスに一意のホスト名を割り当てることをお勧めします。

重複するルーターID

メッセージ

id:<ipv4-te-ルーター-id> <systemID>と<systemID>from instanceルーター重複するエントリ:デフォルトの検出場所:<date:time>UTC

重大度

クリティカル

説明

この異常は、2つのノードが同じルーターIDで設定されていることを示しています。ネットワーク管理者は、一貫性を維持し、ルート計算中の競合を防ぐために、一意のルーターIDを設定することをお勧めします。

プレフィックスとSIDの競合

メッセージ

インスタンスからの重複したエントリ prefix_sid_state_value:<number> <Prefix 1 と Prefix 2>: DEFAULT found at: <start date start time -> end date end time> UTC

重大度

クリティカル

説明

この異常は、2つのプレフィックスが同じセグメントID(SID)で設定されていることを示しています。ネットワーク管理者は、ルーティングの競合を防ぎ、予測可能なパスフォワーディングを維持するために、各プレフィックスに一意のSIDを設定することをお勧めします。

エニーキャストSIDの欠落

メッセージ

インスタンスから - デフォルト ホスト名<Hostname>からのプレフィックス<Prefix>でエニーキャストSIDが検出されました。場所:<start date start time -> end date end time> UTC

重大度

クリティカル

説明

この異常は、エニーキャストプレフィックスが2つのノードで設定されているが、SIDが設定されているのは1つのノードのみであることを示しています。ネットワーク管理者は、一貫したルーティング動作のために、エニーキャストプレフィックスが定義されているすべてのノードで同じSIDを設定することをお勧めします。

カテゴリ: 動的しきい値

プレフィックスの急増/急増

メッセージ

instance-DEFAULTから <Hostname>によって報告される突然のプレフィックスの増加/減少 最小:<number> 最大:<number>:<date:time> UTC、プレフィックス数は number に減少、正規化:<date:time> UTC

重大度

クリティカル

説明

この異常は、ノードによってアドバタイズされるプレフィックスの数が急増または急増したことを示します。これは、ルートポリシーの設定ミスにより、IS-ISの再配布ポリシーが大量のBGPプレフィックスをIS-ISに許可していることが原因で発生する可能性があります。

突然のリンク増減

メッセージ

instance-DEFAULTから [<date:time> UTC]に報告された突然のリンクの増加/減少、リンク数は<number>に減少、正規化:<date:time> UTC

重大度

クリティカル

説明

この異常は、ノードによってアドバタイズされるリンクの数が急に変更されたことを示しています。この問題は、複数のリンクまたは隣接関係が同時にダウンした場合に発生することがあります。場合によっては、生成されるIS-ISパケットが多すぎると、隣接デバイスのIS-IS DDoS保護がパケットを破棄することがあります。さらに、デフォルトの DDoS しきい値がデバイスの隣接スケールに対して低すぎる場合、同様の不安定性が発生する可能性があります。

急激なノードの増加/減少
メッセージ

instance-DEFAULTから:[<date:time> UTC]に報告された突然のノードの増加/減少、ノード数は<number>に減少、正規化:<date:time>UTC

重大度

クリティカル

説明

この異常は、ネットワーク内でアドバタイズされるノードの数が急増または急増したことを示しています。現在、この異常はAPIのレスポンスとアラートでのみ発生し、IGPヒートマップでは発生しません。ソフトウェアのバグやコントロールプレーンの不安定性により、複数のノードが同時にダウンした場合に発生する可能性があります。

SPFランの増加

メッセージ

<neighbor systemID>によって報告されたSPFrunの急激な増加/減少 最小:<number> 最大:<number> at <date:time UTC>、SPFrun数は<number>に減少、正規化:<date:time> UTC

重大度

クリティカル

説明

この異常は、ノードでトリガーされたSPF(Shortest Path First)計算の数が突然増加したことを示しています。これは通常、リンクやメトリックが頻繁に変更されるなど、ネットワークアクティビティが増加したために発生します。また、不要なSPF実行を引き起こすソフトウェアのバグが原因で発生する可能性もあります。

LSP再送信の増加

メッセージ

ホスト 名 から interface:<interface> name Min:<number> Max:<number> at <date:time UTC> 、lspretran の数が <number> に増加、正規化:<date:time> UTC

重大度

クリティカル

説明

この異常は、ノードでトリガーされた LSP 再送信の数が突然増加したことを示します。これは、パケットのドロップにより隣接ノードがLSPを受信できない場合や、CPU使用率が高いために確認応答が遅れている場合に発生します。これは、IS-IS プロトコルの潜在的な問題を早期に警告する重要な手段であり、管理者の迅速な対応が必要です。

LSP再生の繰り返し

メッセージ

<Hostname>によって報告された突然のLSP更新の増加/減少 最小:<number> 最大:<number>:< date:time UTC>、LSP更新数が<number>に増加、正規化:<date:time> UTC

重大度

クリティカル

説明

この異常は、ノードでトリガーされるLSP再生の数が突然増加したことを示しています。これは、帯域幅の更新、リンクフラップ、隣接フラップなど、ノード上のアクティビティの増加が原因で発生する可能性があります。頻繁な再生は、ネットワークの不安定さまたは過度のアップデートを示している可能性があります。