本文へ移動

インフラ転職コンパス現場・技術・キャリアをつなぐ専門メディア

メニュー

冗長化の障害試験で見るべき切替時間|通信断を測る方法

冗長化の障害試験では、機器がStandbyからActiveへ変わった時刻だけでなく、利用者通信が途切れ始めてから回復するまでを測ります。通信断は障害検知、control plane切替、ARP/MAC/route更新、session再確立の合計です。

この記事でわかること

  • 切替時間と通信断の違い
  • 連続通信で測る方法
  • 検知・収束・再確立のtimeline
  • failbackとrollbackの試験

Xの元ポスト

冗長構成の障害試験では切り替わったかだけでなく何秒断したかと理由まで確認すると説明したポスト。

(出典:https://x.com/yeiquer12/status/2059635545408479480(X:冗長構成の障害試験では切り替わったかだけでなく何秒断したかと理由まで確認すると説明したポスト。))

冗長化試験では何秒の通信断を測る?

先に答えると、冗長化の障害試験では、機器がStandbyからActiveへ変わった時刻だけでなく、利用者通信が途切れ始めてから回復するまでを測ります。通信断は障害検知、control plane切替、ARP/MAC/route更新、session再確立の合計です。

制御切替と通信復旧はどう違う?

仕組みを構成上の位置と観測点に分けると、用語だけでなく実際のpacket・stateを説明できます。

仕組みと判断軸
項目 仕組み・役割 実務での判断
detect keepalive/Advertisement欠落を検知 timer設定
control failover Active/Masterを変更 state log
forwarding convergence ARP/MAC/routeを更新 gateway・table
application recovery TCP/TLS/session再確立 利用者影響
構成・処理フロー
t0 fault
 |--- detection ---| state change | ARP/MAC/route | app reconnect |
                   t1           t2             t3            t4
control切替=t2-t1 / 利用者通信断=t4-t0

どの通信を連続監視する?

どの通信を連続監視する?では、対象と期待値を固定し、状態取得、実通信、変更後確認の順に進めます。commandは例であり、本番投入前に対象OSの公式資料と現行設定を確認してください。

実行手順と完了条件
STEP 実施内容 確認する結果
1 SLA/要件から許容断と対象serviceを決める 合否基準
2 機器log・continuous ping・application requestを時刻同期 timeline
3 障害点を一つだけ操作 原因を固定
4 failbackと既存sessionも確認 復帰時risk
設定・確認例(対象機種・OS・versionで確認してください)
# 例: 100ms間隔のapplication health checkは専用toolで実施
# 一般command例
ping -i 0.2 192.0.2.1
curl --connect-timeout 2 https://service.example/health

show logging
show vrrp brief
show ip route
正常時の出力例・記録例
20:00:00.000 fault injected
20:00:01.842 backup became master
20:00:02.105 virtual MAC relearned
20:00:02.430 health check HTTP 200
Observed service interruption: 2.43 seconds

failover・failbackをどう試験する?

一つの表示だけで原因を決めず、症状ごとに次の観測点を選びます。正常時の同条件出力が比較基準です。

正常時と異常時の切り分け
症状・誤り 主な原因候補 次に確認すること
pingだけ成功 application/session未確認 TCP/TLS/transaction test
state切替は速いが断が長い ARP/MAC/route/session 各時刻を分解
failbackで再断 preempt/route復帰 復帰試験
試験ごとに結果差 timer・load・ECMP 複数回と条件記録

合否基準をどう決める?

本番でcable抜線やpower断を行う前に、影響対象、監視連絡、停止条件、物理復旧手順、console接続を準備します。『冗長だから止まらない』を前提にせず、単一障害点と共有部品を確認します。

  • 対象機器・interface・VRF/VLAN
  • 取得日時・timezone・software version
  • 変更前後の同一command出力
  • 期待値・実測値・判定者
  • 異常時の停止条件とrollback結果

関連する仕組みを次に確認する

定義だけで終わらせず、隣接する仕組みと障害切り分けへ進みます。

まとめ:control planeのstateではなく利用者通信の停止時間を測る

control planeのstateではなく利用者通信の停止時間を測ることが結論です。構成図、設定・command、正常時と異常時の結果を同じ条件で保存し、第三者が判断を再現できる状態にしてください。

最近の記事
お知らせ