冗長化の障害試験では、機器がStandbyからActiveへ変わった時刻だけでなく、利用者通信が途切れ始めてから回復するまでを測ります。通信断は障害検知、control plane切替、ARP/MAC/route更新、session再確立の合計です。
⭕️インフラエンジニアが
障害試験で必ず意識した方がいいこと
切り替わったかだけでなく、
何秒断だったかを見ること冗長構成の障害試験では、
よく
ケーブルを抜く
機器を落とす
リンクをdownさせるといった試験をする。
このとき、待機系に切り替わったか
迂回経路に切り替わったか… pic.twitter.com/WiyvaKswbb— けんと@設計構築チャンネル (@yeiquer12) 2026年5月27日
冗長構成の障害試験では切り替わったかだけでなく何秒断したかと理由まで確認すると説明したポスト。
(出典:https://x.com/yeiquer12/status/2059635545408479480(X:冗長構成の障害試験では切り替わったかだけでなく何秒断したかと理由まで確認すると説明したポスト。))
冗長化試験では何秒の通信断を測る?
先に答えると、冗長化の障害試験では、機器がStandbyからActiveへ変わった時刻だけでなく、利用者通信が途切れ始めてから回復するまでを測ります。通信断は障害検知、control plane切替、ARP/MAC/route更新、session再確立の合計です。
制御切替と通信復旧はどう違う?
仕組みを構成上の位置と観測点に分けると、用語だけでなく実際のpacket・stateを説明できます。
| 項目 | 仕組み・役割 | 実務での判断 |
|---|---|---|
| detect | keepalive/Advertisement欠落を検知 | timer設定 |
| control failover | Active/Masterを変更 | state log |
| forwarding convergence | ARP/MAC/routeを更新 | gateway・table |
| application recovery | TCP/TLS/session再確立 | 利用者影響 |
t0 fault
|--- detection ---| state change | ARP/MAC/route | app reconnect |
t1 t2 t3 t4
control切替=t2-t1 / 利用者通信断=t4-t0
どの通信を連続監視する?
どの通信を連続監視する?では、対象と期待値を固定し、状態取得、実通信、変更後確認の順に進めます。commandは例であり、本番投入前に対象OSの公式資料と現行設定を確認してください。
| STEP | 実施内容 | 確認する結果 |
|---|---|---|
| 1 | SLA/要件から許容断と対象serviceを決める | 合否基準 |
| 2 | 機器log・continuous ping・application requestを時刻同期 | timeline |
| 3 | 障害点を一つだけ操作 | 原因を固定 |
| 4 | failbackと既存sessionも確認 | 復帰時risk |
# 例: 100ms間隔のapplication health checkは専用toolで実施
# 一般command例
ping -i 0.2 192.0.2.1
curl --connect-timeout 2 https://service.example/health
show logging
show vrrp brief
show ip route
20:00:00.000 fault injected
20:00:01.842 backup became master
20:00:02.105 virtual MAC relearned
20:00:02.430 health check HTTP 200
Observed service interruption: 2.43 seconds
failover・failbackをどう試験する?
一つの表示だけで原因を決めず、症状ごとに次の観測点を選びます。正常時の同条件出力が比較基準です。
| 症状・誤り | 主な原因候補 | 次に確認すること |
|---|---|---|
| pingだけ成功 | application/session未確認 | TCP/TLS/transaction test |
| state切替は速いが断が長い | ARP/MAC/route/session | 各時刻を分解 |
| failbackで再断 | preempt/route復帰 | 復帰試験 |
| 試験ごとに結果差 | timer・load・ECMP | 複数回と条件記録 |
合否基準をどう決める?
本番でcable抜線やpower断を行う前に、影響対象、監視連絡、停止条件、物理復旧手順、console接続を準備します。『冗長だから止まらない』を前提にせず、単一障害点と共有部品を確認します。
- 対象機器・interface・VRF/VLAN
- 取得日時・timezone・software version
- 変更前後の同一command出力
- 期待値・実測値・判定者
- 異常時の停止条件とrollback結果
関連する仕組みを次に確認する
定義だけで終わらせず、隣接する仕組みと障害切り分けへ進みます。
まとめ:control planeのstateではなく利用者通信の停止時間を測る
control planeのstateではなく利用者通信の停止時間を測ることが結論です。構成図、設定・command、正常時と異常時の結果を同じ条件で保存し、第三者が判断を再現できる状態にしてください。
