联系之前请先把关键数据收集齐全,以便对方快速定位问题。必要信息包括:故障发生的精确时间(含时区)、受影响主机的公网/内网IP、机房机柜与机位编号、服务器序列号或设备名称、最近的变更记录(如改动网络配置、上游发布等)。
同时抓取基础网络排查证据:本地与目标的 ping 命令结果(含丢包率与延迟)、从不同出口执行的 traceroute/mtr 路径截屏或文本、对关键端口的 telnet 或 curl 测试结果。若可能,提供机房监控或代理监控的告警截图、系统日志关键时间段(/var/log/ 或 Windows 事件),并注明影响范围(单台、某机柜、整个 VLAN 等)。
标题需简洁且包含紧急程度、地点与影响对象,示例:【紧急】香港-XX机房-公网IP 1.2.3.4 无连通(影响业务:网站下线)。正文结构建议:1)影响描述(简短一句),2)发生时间与持续情况,3)已排查的基础证据(粘贴 ping/traceroute 关键行),4)期望动作(远程重启、查机柜电源、断电重插 SFP、现场 remote-hands 等),5)联系人与联系电话/IM 与可接时间段。
务必在故障单内标注 SLA 或可接受的恢复时限(例如“影响线上支付,SLA 30 分钟”),并附上日志文件或截图的下载链接。使用明确的优先级标签(P0/P1)和希望的升级路径(如 15 分钟未回复请升级到值班工程师/客户经理)。
先用已发送的工单号和时间节点做记录,避免重复说明。按预先设定的升级流程操作:在故障单中追加“请求升级”(标注期望升级到 NOC 值班工程师、现场工程师或运营商客户经理),并在主题和首行重复影响范围和 SLA。若对方未在约定时间响应,可以通过电话或企业 IM 直接联系值班工程师并请求他们在工单中记录通话要点。
升级时保持信息简明:重复关键证据(如最新 traceroute)、明确请求的操作(现场查看光纤、重启交换机、替换 SFP)、并要求给出预计恢复时间(ETA)与临时应急措施。若涉及 光纤/骨干链路,同时通知上游/下游运营商联动处理并要求共享 RFO(Root Cause)与恢复计划。
当现场短期内无法解决,应立刻要求并确认临时解决方案以降低业务影响:例如切换到备用链路、启用 BGP 黑洞或临时 NAT 转发、启动备用服务器并进行 DNS/负载切换、请求机房做“远程手”(remote hands)去更换光模块或电源模块。将这些措施写入工单并要求对方在执行后更新步骤与结果。
同时要求对方在恢复后提供完整的故障报告(包含时间线、根因分析、采取措施、是否触发 SLA 赔付),并约定后续的预防计划(比如在机房做双纤路由、增加监控频率、把关键线路做二次验证)。各项约定写入邮件备份,便于后续索赔或改进。
实用命令与模板示例:1)基本网络排查:ping -c 10 1.2.3.4;traceroute -n 1.2.3.4 或 mtr -r -c 100 1.2.3.4;2)端口连通:telnet 1.2.3.4 80 或 curl -I http://1.2.3.4;3)路由与 BGP 检查:show ip route / show bgp summary(需设备权限)。
报障邮件模版简要:标题:【紧急】香港-机房X-公网IP-业务影响(P0)正文:1. 影响描述:网站/API 无法访问 2. 发生时间:YYYY-MM-DD HH:MM(HKT)3. 影响范围:单 IP / 子网 / 用户群体 4. 已执行排查:附 ping/traceroute 片段和截图 5. 期望处理:请现场检查链路/重启交换机/远程手操作 6. 联系方式:姓名/手机/IM/备选联系人 7. SLA 要求与升级规则。
