利用可能なソフトウェアとハードウェアのリソースを特定する

お使いのMX204、MX301、MX304、MX10004、MX10008ルーターで利用可能なソフトウェアおよびハードウェアリソースを見つける方法をご覧ください。

ルーティングエンジンは、MXプラットフォームのコントロールプレーンとして機能します。Junos OSを実行し、ルーティングプロトコルを維持し、シャーシを管理します。ネットワークトラフィックに影響を与える前に容量の問題、予期しないプロセス、またはハードウェアの問題を検出するには、ルーティングエンジンのCPU、メモリ、バッファリソースを定期的に監視する必要があります。

ジュニパー MX204、MX301、MX304、MX10004、およびMX10008ルーターでこれらのハードウェアおよびソフトウェアリソースを監視するには、いくつかのコマンドを知っておく必要があります。

show chassis routing-engineコマンドを使用すると、両方のルーティングエンジンスロット(プライマリとバックアップ)のステータスが表示されます。このコマンドは、温度、DRAM使用率、CPU使用率、稼働時間、および負荷平均を表示します。

主なフィールド:

フィールド 説明 健全なしきい値
Temperature / CPU temperature ルーティングエンジンボードとCPUダイの温度 < 55°C(標準)
Memory utilization インストール済みDRAMの使用中の割合 <80%
User CPU ユーザー空間デーモン(RPD、シャーシなど)に費やされる時間 <70%持続
Kernel CPU カーネルタスクに消費される時間 < 20%持続
Interrupt CPU ハードウェア割り込みによって消費される時間 < 10%
Idle CPU 使用可能なCPUヘッドルーム >30%推奨
Load averages 1/5/15分のUNIX負荷平均 — 安定している必要があります 安定性があり、CPU数に比例
Last reboot reason ルーティングエンジン再起動の最後の既知の原因 予期せぬ場合は調査する
注:

CPU使用率は、5秒、1分、5分、15分の4つの時間間隔で報告されます。通常、5秒間隔での短期間のスパイクは正常です。 show system processes extensive コマンドを使用して、すべての間隔でユーザーCPU使用率が持続的に高い状態を調べます。

プロセスレベルのCPUおよびメモリ使用率

show system processes summaryコマンドは、topユーティリティと同等のリアルタイムUNIXスタイルのプロセステーブルを提供します。どのプロセスが最も多くのCPUと常駐メモリを消費するかを特定します。

主な列:

カラム 説明
SIZE プロセスに割り当てられた仮想メモリ
RES 実際の常駐メモリ(使用物理RAM)—最も意味のあるフィールド
WCPU 加重CPU使用率 — プロセスごとのCPU負荷の主要な指標
TIME 開始以降の累積CPU消費時間
STATE プロセス状態: select/sleeping = 正常、 zombie = 終了が収穫されない
ヒント:

show system processes extensive は、CPU 順にソートされた切り捨てられていない完全なプロセス リストに使用します。rpd、chassisd、jinsightdなど、予期しない高いWCPUまたはRESを持つ非アイドルデーモンを探します。

システムメモリ分散

完全なカーネル メモリの内訳と、プロセスごとの仮想メモリおよび常駐メモリの使用量を確認するには、次のコマンドを実行します show system memory 。

メモリセグメントの説明:

セグメント 説明
Reserved カーネルによって予約され、プロセスで使用できないメモリ
Wired ページアウトできないカーネルページ(常にRAM内)
Active 現在プロセスによってアクティブに使用されているメモリ
Inactive 最近使用したメモリー、必要に応じて回収可能
Cache ファイルシステムキャッシュ
Free すぐに使用可能なメモリ

この出力では、77%の空きメモリは、正常で負荷が軽いルーティングエンジンであることを示しています。メモリ不足は通常、空きメモリと非アクティブなメモリの減少、アクティブメモリの増加、および潜在的なスワップ使用として現れます。

ネットワークバッファ使用量

カーネルネットワークバッファ(mbuf)の使用状況を確認するには、 show system buffers コマンドを実行します。FreeBSD ベースの Junos カーネルは、これらのメモリ構造を使用して、コントロールプレーンでネットワークパケットを処理します。

主な指標:

フィールド 説明 警告サイン
mbufs in use (current) アクティブに使用されているコントロールプレーンパケットバッファ 合計/最大値に近づく
requests denied mbufまたはジャンボクラスターの割り当てエラー ゼロ以外の値
requests delayed 枯渇によるバッファー割り当ての遅延 ゼロ以外の値
ジャンボクラスターの使用率 大きなパケットバッファ使用量(4k/9k/16kページ) 電流が最大値に近づく
重要:

denied行またはdelayed行に0以外の値は、カーネルがネットワークバッファーの割り当てに失敗したことを示します。この障害は、BGPキープアライブ、OSPF hello、BFD PDUなどのコントロールプレーンのパケットドロップを引き起こす可能性があり、直ちに調査する必要があります。

トラフィック転送の障害を防止するには、フレキシブルPICコンセントレータ(FPC)とパケット転送エンジンのリソースを定期的に監視する必要があります。システムがネクストホップ、ファイアウォールフィルター、論理インターフェイス(IFL)カウンター、およびサービスクラス(CoS)キューのための十分なヘッドルームを維持していることを確認します。これらのハードウェアリソースが枯渇すると、たとえルーティングエンジン(RE)が正常であっても、トラフィック転送に失敗します。

インストールされているすべてのラインカードの動作状態、温度、3つの時間枠にわたるCPU使用率、DRAMサイズ、ヒープ使用率、バッファ使用率を確認するには、 show chassis fpc コマンドを実行します。

主なフィールド:

フィールド 説明 警告しきい値
State FPCの動作ステータス それ以外のもの Online
Temp (C) FPCボード温度 > 55°C(標準)
Total CPU 全体的なFPC CPU使用率(マイクロカーネル) >80%持続
Interrupt CPU ハードウェア割り込みによって消費されるCPU時間 > 10%持続
Heap (%) 使用されているFPCヒープ(ukern)メモリの割合 > 70%(設定可能なしきい値)
Buffer (%) FPCのパケットバッファ使用率 >80%

総DRAM、Trio ASICsが転送テーブルに使用するHBM(高帯域幅メモリ)、消費電力、動作帯域幅、アクティブパケット転送エンジンと個々の帯域幅など、FPCごとのハードウェアの詳細を確認するには、 show chassis fpc <slot> detail コマンドを実行します。

主なフィールド:

フィールド 説明
Total CPU DRAM FPCマイクロカーネル(ヒープ)で汎用DRAM
Total HBM 転送テーブルストレージ(ネクストホップ、ルート、フィルター)専用の大帯域幅メモリ
Max power consumption 定格最大消費電力量 - 電力予算計画に関連
Operating Bandwidth FPCの総集約帯域幅(すべてのアクティブなPFEの合計)
PFE Bandwidth パケット転送エンジンごとの転送容量 — このMX10004 LCでPFEあたり800G

複数のカテゴリと重大度レベルにわたって、ボード(FPCマイクロカーネル)とパケット転送エンジン(ASIC)の両方のスコープでハードウェアエラーイベントを検証するには、 show chassis fpc errors コマンドを実行します。

出力構造:

カラム 説明
Scope board = FPCレベルエラー。 pfe = PFE ASICレベルエラー
Category エラードメイン:functional、memory、io、storage、switch、processinginternal
Level 重大度: Minor → Major → Fatal
Occurred このエラーがトリガーされた回数の合計
Cleared エラー状態が自己解決された回数
Action-Taken アクションがトリガーされた回数
Action システム応答: LOG、 CM ALARM、 GET STATE、 RESET、 DISABLE PFE

エラーの重大度と関連する自動アクション:

重大度 ボードアクション PFEアクション
Minor LOG + シャーシアラーム LOG + シャーシアラーム
Major 収集状態 + シャーシ アラーム 収集状態 + シャーシアラーム + PFE の無効化
Fatal 収集状態 + FPCリセット 収集状態 + FPCリセット
重要:

[発生] 列に 0 以外のカウントが表示される重大エラーまたは致命エラーを直ちに調査する必要があります。ボードスコープで軽微な機能エラーが発生した場合、イベントをsyslogメッセージおよびジュニパーJTACアドバイザリと関連付けます。どのパケット転送エンジンがアクティブなままであることを確認するには、各パケット転送エンジンスコープの下部にあるPfe-State行を確認します。

3つの主要なデータプレーンASICメモリプール(フィルターカウンターメモリ、IFLカウンターメモリ、拡張メモリ(転送テーブルエントリとネクストホップチェーンに使用))のFPC単位およびPFE単位の使用率を検証するには、show system resource-monitor summaryコマンドを実行します。このコマンドは、ヒープメモリ消費量とCoSキューブロック使用率も報告します。

パケット転送エンジンのメモリプールの説明:

メモリプール 説明 設定されたしきい値
ヒープ(ukern) 汎用FPCマイクロカーネルメモリ—デーモンとローカルプロセスで使用 70%
フィルターカウンターメモリ ファイアウォールフィルター用ASICメモリバイト/パケットカウンター 100%
IFLカウンタメモリ 論理インターフェイス(IFL)統計カウンター用ASICメモリ 95%
拡張メモリ 転送テーブルエントリ用のASICメモリ:ルート、ネクストホップ、MPLSラベル 95%
CoSキューブロック 出力キューごとに割り当てられたスケジューラメモリブロック 100%

リソース拒否カウンター:

カウンタ 意味
Client denied FPCがクライアントプロセスからのリソース割り当て要求を拒否しました
Service Denied サービスレベルのリソース要求が拒否されました
IFL Denied カウンターメモリの枯渇により新しい論理インターフェイスの作成が拒否されました
警告:

Expansion memory %が設定されたしきい値(95%)に近づくと、FPCは新しい転送エントリーのスロットリングを開始します。これは、ルートインストールの失敗やネクストホッププログラミングエラーとして現れることがあります。同様に、IFL Denied > 0は論理インターフェイスを作成できないことを意味し、加入者またはトンネルのスケーリングに影響を与えます。

この出力では、ヒープが23〜30%、フィルターカウンターが2%、IFLカウンターが4%、拡張メモリが13%という3つのFPCすべてが健全な使用率を示しており、かなりのヘッドルームを提供しています。

特定のFPCのヒープ、ネクストホップ、ファイアウォールメモリプールの空きメモリ透かしを表示するには、show system resource-monitor fpc slot<n>コマンドを実行します。このコマンドはFPC単位のビューを提供し、パケット転送エンジンごとに空きENCAP、ネクストホップ、ファイアウォールメモリを分解します。

注:

透かしのしきい値は、設定で調整できます。

主なフィールド:

フィールド 説明 アラートトリガー
% Heap Free 残りのFPCヒープメモリの割合 20%未満のウォーターマーク( *でマーク)
% NH mem Free PFE あたりの空きネクストホップ ASIC メモリ — 転送隣接関係に使用 20%未満のウォーターマーク
% FW mem Free PFEあたりの空きファイアウォール/フィルターASICメモリ 20%未満のウォーターマーク