先看结论
- 01先确认影响范围和准确时间,不要立即修改所有配置
- 02按域名、网络、证书、服务器、程序和数据逐层排查
- 03状态码、日志和监控比口头描述更有价值
- 04操作前保留现场,变更后记录结果和回退方式
- 05恢复访问后仍需完成原因分析和预防措施
第一步:确认到底是谁、在哪里、访问什么失败
先记录故障开始时间、访问URL、设备、网络、浏览器和错误提示,再用不同网络或外部监测点复查。只有公司内网打不开,可能是本地DNS、代理或防火墙;所有地区都失败,才更可能是公开访问链路的问题。
还要区分全站、某个域名、某类页面或某项功能。首页正常但后台失败,与整个域名无法解析需要不同人员处理。不要只说“网站崩了”,应保存截图、状态码、请求时间和可重复步骤。
- 发生时间与时区
- 具体URL和错误
- 用户地区与网络
- 全站或局部范围
- 可重复步骤
第二步:检查域名和DNS是否仍指向正确位置
域名到期、实名或注册状态异常会影响整个入口;DNS记录被修改、解析服务故障或缓存未更新,也可能让部分用户访问旧地址。检查注册状态、权威DNS、A或CNAME记录及最近变更,不能只看自己电脑的缓存结果。
如果刚做过迁移,应比较多个解析点并确认旧服务器是否仍在承接流量。修改DNS前保存完整记录,尤其注意企业邮箱和其他子域;恢复网站时误删邮件记录,可能制造新的业务故障。
- 域名状态与到期日
- 权威DNS服务
- A和CNAME记录
- 多地区解析结果
- 近期变更及缓存
第三步:区分网络不通、端口关闭和Web服务异常
DNS得到正确IP后,继续检查服务器是否在线、安全组和防火墙是否允许80与443端口、负载均衡或CDN是否健康。能够连接服务器但网页超时,可能是Web服务无响应或后端资源耗尽。
不要把ping不通直接等同于服务器宕机,很多环境会禁用相关响应。应结合云平台状态、端口连接、Web请求和服务器监控判断,并核对最近是否修改了安全策略、线路或代理配置。
- 云实例状态
- 端口和安全组
- 防火墙与代理
- 负载均衡或CDN
- CPU内存磁盘网络
第四步:读懂HTTPS证书和握手错误
证书过期、域名不匹配、证书链缺失或服务器时间异常,会让浏览器显示安全警告甚至阻止访问。检查证书对应域名、有效期、签发链和实际提供证书的节点;使用CDN时,边缘证书和源站证书可能分别管理。
更新证书后要验证自动续期是否真正部署到Web服务,并检查HTTP到HTTPS跳转。只上传新文件但没有重新加载配置,访问者仍可能收到旧证书。
- 证书域名和有效期
- 完整证书链
- 服务器时间
- CDN与源站证书
- 续期部署和跳转
第五步:根据HTTP状态和日志定位Web层
出现502或504时,反向代理往往仍在运行,但无法正常连接后端应用;503可能是服务不可用或维护策略;大量500通常需要查看应用错误。状态码只是入口,必须结合请求时间和代理日志、应用日志交叉判断。
检查Web服务配置语法、监听端口、后端进程和最近发布记录。配置变更前先备份,修改后使用测试命令验证,再平滑加载。反复重启可能暂时恢复,却会覆盖现场或掩盖资源泄漏。
- HTTP状态码
- 访问与错误日志
- 代理到后端连接
- 进程和监听端口
- 配置及发布变更
第六步:检查程序、数据库和依赖
应用进程存在不代表业务可用。数据库连接耗尽、磁盘写满、缓存故障、依赖服务超时、配置缺失和代码异常,都可能让部分或全部页面失败。健康检查应覆盖关键依赖,而不只是返回一个固定文本。
根据错误时间查看应用日志和数据库状态,比较故障前后的发布、定时任务和数据变化。涉及修复时先选择可回退动作,例如恢复上一版本、释放明确的异常连接或切换备用服务,不在证据不足时直接删除数据。
- 应用异常栈
- 数据库连接和容量
- 缓存队列与存储
- 第三方接口
- 版本配置和定时任务
第七步:恢复过程中控制变更风险
建立单一事件负责人和操作记录,每次只改变一个可验证因素,写明执行人、时间、命令或配置、预期、实际结果和回退方法。多人同时修改DNS、证书和服务器,会让原因难以判断并扩大影响。
高风险操作前保存配置、日志和必要备份。需要回滚程序时,同时考虑数据库是否发生不兼容变更。对外沟通只确认已经验证的信息,说明影响范围和下一次更新时间,不用未经核实的原因安抚用户。
- 事件负责人
- 逐项变更记录
- 配置日志与备份
- 回退条件
- 对外状态沟通
第八步:恢复后完成原因分析和预防
页面重新打开不代表事件结束。继续验证登录、表单、支付或其他关键功能,并观察一段时间的错误率和资源。整理时间线、直接原因、促成条件、检测缺口、恢复动作和用户影响。
改进措施应对应具体负责人和日期,例如增加域名证书到期提醒、磁盘告警、应用健康检查、发布回滚、备份恢复演练和第三方降级。复盘重点是让系统更容易发现和恢复,而不是简单归咎某个人。
- 关键功能复测
- 故障时间线
- 直接与促成原因
- 监控和流程缺口
- 整改责任与复查
常见问题
01网站打不开时可以先重启服务器吗?+
不建议把重启作为第一反应。先确认范围并保留日志和资源现场;证据指向进程失效且有回退方案时,再执行受控重启。
02浏览器提示证书不安全,是服务器坏了吗?+
不一定。可能是证书过期、域名不匹配、链不完整或时间异常,应先检查HTTPS握手和实际提供的证书。
03出现502通常代表什么?+
通常表示代理无法从后端得到有效响应,可能涉及应用进程、端口、超时或资源问题,需要结合代理和应用日志判断。
04只有部分地区打不开应该怎么查?+
比较不同网络的DNS、CDN节点和线路结果,记录失败地区与时间;不要因为自己能打开就判定故障不存在。
05网站恢复后为什么还要复盘?+
临时恢复可能没有消除根因。复盘可以补齐监控、备份、回滚和责任流程,降低相同问题再次发生的概率。