本文へ移動

インフラ転職コンパス難しいインフラ技術を動画と図解で解説

メニュー

冗長化の障害試験で見るべき切替時間|通信断を測る方法

冗長化の障害試験では、機器がStandbyからActiveへ変わった時刻だけでなく、利用者通信が途切れ始めてから回復するまでを測ります。通信断は障害検知、コントロールプレーン切替、ARP/MAC/経路更新、セッション再確立の合計です。

この記事でわかること

  • 冗長化試験では何秒の通信断を測る?
  • 制御切替と通信復旧はどう違う?
  • どの通信を連続監視する?
  • failover・failbackをどう試験する?

この記事はネットワークエンジニアの仕事内容の各論です。工程の全体像から確認したい場合はそちらへ。

Xの元ポスト

冗長構成の障害試験では切り替わったかだけでなく何秒断したかと理由まで確認すると説明したポスト。

(出典:けんと@設計構築チャンネルのポスト(X)(X:冗長構成の障害試験では切り替わったかだけでなく何秒断したかと理由まで確認すると説明したポスト。))

冗長化試験では何秒の通信断を測る?

先に答えると、冗長化の障害試験では、機器がStandbyからActiveへ変わった時刻だけでなく、利用者通信が途切れ始めてから回復するまでを測ります。通信断は障害検知、コントロールプレーン切替、ARP/MAC/経路更新、セッション再確立の合計です。

制御切替と通信復旧はどう違う?

それぞれの役割と、実務で見るところを次の表に整理します。

仕組みと判断軸
項目 仕組み・役割 実務での判断
detect keepalive/Advertisement欠落を検知 タイマー設定
制御 failover Active/Masterを変更 状態ログ
forwarding convergence ARP/MAC/経路を更新 gateway・テーブル
アプリケーション recovery TCP/TLS/セッション再確立 利用者影響
構成・処理フロー
t0 fault
 |--- detection ---| state change | ARP/MAC/route | app reconnect |
                   t1           t2             t3            t4
control切替=t2-t1 / 利用者通信断=t4-t0

どの通信を連続監視する?

確認は「SLA/要件から許容断と対象サービスを決める」から始め、「failbackと既存セッションも確認」まで進めます。「復帰時リスク」を確認できれば完了です。

実行手順と完了条件
STEP 実施内容 確認する結果
1 SLA/要件から許容断と対象サービスを決める 合否基準
2 機器ログ・continuous ping・アプリケーション要求を時刻同期 timeline
3 障害点を一つだけ操作 原因を固定
4 failbackと既存セッションも確認 復帰時リスク
設定・確認例(対象機種・OS・バージョンで確認してください)
# 例: 100ms間隔のapplication health checkは専用toolで実施
# 一般command例
ping -i 0.2 192.0.2.1
curl --connect-timeout 2 https://service.example/health

show logging
show vrrp brief
show ip route
正常時の出力例・記録例
20:00:00.000 fault injected
20:00:01.842 backup became master
20:00:02.105 virtual MAC relearned
20:00:02.430 health check HTTP 200
Observed service interruption: 2.43 seconds

failover・failbackをどう試験する?

症状ごとの原因候補と、次に確認することを次の表にまとめます。正常時の出力と並べて差を見ます。

正常時と異常時の切り分け
症状・誤り 主な原因候補 次に確認すること
pingだけ成功 アプリケーション/セッション未確認 TCP/TLS/transaction 試験
状態切替は速いが断が長い ARP/MAC/経路/セッション 各時刻を分解
failbackで再断 preempt/経路復帰 復帰試験
試験ごとに結果差 タイマー・load・ECMP 複数回と条件記録

合否基準をどう決める?

本番でケーブル抜線や電源断を行う前に、影響対象、監視連絡、停止条件、物理復旧手順、コンソール接続を準備します。『冗長だから止まらない』を前提にせず、単一障害点と共有部品を確認します。

  • 対象機器・インターフェース・VRF/VLAN
  • 取得日時・タイムゾーン・ソフトウェアバージョン
  • 変更前後の同一コマンド出力
  • 期待値・実測値・判定者
  • 異常時の停止条件と切り戻し結果

関連する記事

まとめ:コントロールプレーンの状態ではなく利用者通信の停止時間を測る

要点は、コントロールプレーンの状態ではなく利用者通信の停止時間を測ることです。切替時間は、測定方法と測定点を書き添えて初めて比較できる数字になります。

最近の記事
ピックアップ