一聚教程网:一个值得你收藏的教程网站

热门教程

Nginx 中健康检查如何排查由于网络抖动引发的频繁主备切换

时间:2026-08-30 11:03:48 编辑:袖梨 来源:一聚教程网

核心是区分真实故障与瞬时毛刺,需抓包确认VRRP心跳、改HTTP级健康探测(interval 2、weight -5)、设preempt_delay 30、upstream检查参数匹配抖动窗口(max_fails=2 fail_timeout=30s或rise=2 fall=3 interval=3s),并排查内核中断倾斜与时间不同步。

排查因网络抖动引发的 Nginx 主备频繁切换,核心是区分“真实故障”和“瞬时毛刺”,避免健康检查把几秒内的丢包或延迟误判为服务不可用。重点不在压测链路,而在收紧检查节奏、叠加多级探测、锁定状态边界。

抓包确认 VRRP 心跳是否真实丢包

VRRP 组播是主备协同的基础,抖动往往始于心跳不稳:

  1. 在主备两台机器上同时执行:tcpdump -i ens33 ip proto 112 -w vrrp.pcap,回放比对是否双向收发正常
  2. 若单边收不到 Advertisement 报文,检查防火墙是否放行协议号 112(不是端口),以及 SELinux 是否拦截组播
  3. 确认主备网卡名完全一致(如都是 ens33)、IP 在同一子网、virtual_router_id 数值相同(如 51)

检查 Keepalived 健康脚本是否过于敏感

仅检测 Nginx 进程存活或端口通断,无法发现“进程活着但响应卡死”的假死状态,极易被抖动触发误降权:

  1. 将默认的 killall -0 nginx 改为 HTTP 级探测:curl -f -s http://127.0.0.1/health | grep "ok"
  2. 设置 interval 2(每 2 秒检查一次),失败一次 weight -5,避免单次超时就大幅拉低优先级
  3. 启用 preempt_delay 30,主节点恢复后等待 30 秒再抢 VIP,防止网络闪断引发反复漂移

核对 Nginx upstream 健康检查参数是否匹配抖动窗口

Keepalived 切换 VIP 后,若 Nginx 自身 upstream 还在频繁摘除后端,会导致流量二次震荡:

  1. 被动检查:设 max_fails=2 fail_timeout=30s,允许连续 2 次失败(如超时或 5xx),且冷却期远长于典型抖动持续时间(通常 1–5 秒)
  2. 主动检查(如用 nginx_upstream_check_module):必须配 rise=2 fall=3 interval=3s,连续 2 次成功才恢复、连续 3 次失败才下线
  3. 禁用 ip_hash,NAT 环境下会把大量用户聚到同一后端,局部过载进一步放大抖动感知

检查内核与网络层隐性干扰

某些抖动表现看似配置问题,实则源于底层资源争抢:

  1. 运行 watch -n1 'cat /proc/softirqs | grep NET_RX',观察各 CPU 的接收中断是否严重倾斜;若某核 si 长期 90%+,说明网卡中断未均衡
  2. 执行 ethtool -L eth0 combined 8 开启多队列,并启用 irqbalance 或手动绑定 RX 中断到多个 CPU
  3. 确认主备服务器时间同步(chronyd),时间差超过 3 秒会影响 VRRP 计时逻辑

热门栏目