1.
目标与关键指标
说明监控目标:评估 CN2(中国电信 CN2)国际出口到日本的链路健康。
关键指标列举:往返时延(RTT)、抖动(Jitter)、丢包率、带宽吞吐、路由稳定性(BGP 更新/路径变化)、链路错误(CRC、接口丢包)。
2.
探针部署与位置建议
在国内靠近 CN2 出口(如上海/广州/深圳)和日本 POP(东京/大阪)各部署至少 2 个探针。
小分段:可以使用 VPS、容器或物理机;确保 NTP 同步;防火墙允许 ICMP/TCP/UDP 探测端口。
3.
主动测试工具与命令
Ping:ping -c 200 -i 0.2 目标IP,统计 RTT 与丢包。
MTR:mtr -r -c 200 -i 0.2 目标IP(或使用 mtr --report-cycles),查看每跳丢包与延迟。
Paris traceroute:paris-traceroute -T -p 80 目标IP 或 tcptraceroute target 80,用于避免 ECMP 干扰。
iperf3:iperf3 -c JAPAN_SERVER -t 60 -P 8 用于吞吐测量,双向测试加 -R。
4.
被动监控与抓包流程
在链路两端抓包:tcpdump -i eth0 host
-w /tmp/cn2.pcap。
用 Wireshark/tshark 分析 TCP RTT(tcp.analysis.acks),或统计 ICMP 响应时间。
启用 SNMP/NetFlow:收集接口错误、丢包和流量分布。
5.
指标采集、存储与可视化
建议使用 Prometheus + node_exporter + blackbox_exporter 采集 ping/icmp/tcp/udp 指标。
将 iperf/自定义脚本结果推到 Pushgateway 或 InfluxDB,Grafana 做仪表盘并配置阈值告警(见第6)。
6.
阈值与告警策略(示例)
建议阈值:RTT 异常 >100ms(短突发报警 >80ms);抖动 >10ms 报警;丢包 >0.5% 报警;吞吐低于 SLA 的 80% 报警。
告警触发后自动收集 mtr/traceroute、最近 5 分钟 pcap 与 BGP 更新快照,附时间戳上报。
7.
故障定位与工单模板
定位步骤:1) 用 mtr 确定首个丢包/延迟跃点;2) 抓取两端 pcap;3) 检查本端接口/CRC 与 SNMP 计数;4) 查询 BGP 路径(whois/RIPE/ChinaTelecom 看玻璃);
工单需包含:时间(UTC/本地)、目的 IP、mtr/traceroute 输出、pcap、iperf 结果、影响范围与频率。
8.
长期基线与异常检测
持续采样至少 14 天建立小时/每周基线,使用移动中位数与 MAD 检测异常。
对比节假日/夜间流量,标注周期性波动避免误报。
9.
问:如何快速判断是 CN2 中间链路问题还是对端日本段问题?
快速方法:在国内与日本两端同时发起 MTR/traceroute;若国内侧到某一跳开始出现丢包且日本侧到该跳正常,问题在国内;若两端均在相同跃点后出现异常,多为运营商中间段问题,需提供 mtr/traceroute 与 pcap 给运营商。
10.
问:采样频率和测试窗口怎样设定比较合理?
建议:常态每 5—15 分钟采样一次 ping/mtr;每小时一次 iperf3 短测(60s);当告警触发时切换为每 30s 高频采样并保留 15 分钟 pcap 以便溯源。
11.
问:向中国电信提交故障工单需要哪些关键信息?
必须信息:发生时间(含时区)、受影响目的地 IP、mtr/traceroute 报表、pcap 截取片段、iperf 测试结果、BGP 更新(若有)、本端接口统计(SNMP),并标注你怀疑是 CN2 链路以便运维快速定位。
来源:监控策略 建议用于评估中国到日本 cn2 健康状况的关键指标