后续监测要围绕“域名解析是否稳定”和“空间服务是否可用”两条线分开做。域名侧重点查解析记录、DNS生效与到期时间;空间侧重点查HTTP状态、响应时间、证书与资源占用。两种处理方案分别是:轻量方案,用免费或自带工具做定期抽查;系统方案,用自建脚本或监控服务做高频告警。选择依据是站点数量、可接受的故障时长和是否有人及时处理告警。
监测前先列出清单:主域名、常用子域名、空间IP或主机名、关键页面URL。每个对象确定检查频率。个人站点可以每天一次,电商或业务站点建议5分钟到15分钟一次。频率越高,告警越及时,但误报和通知噪音也越多。判断标准很简单:如果一次故障在30分钟内会造成实际损失,就不要用每天一次的频率。
轻量方案不写代码,靠现成工具或手工检查完成。适用条件是站点数量少、没有专人值守、能接受小时级发现故障。
dig或nslookup查A记录和CNAME;用浏览器或命令行请求首页看状态码。系统方案用监控服务或自建脚本,按固定间隔请求并记录结果。适用条件是站点多、故障容忍时间短、需要历史数据来判断趋势。
openssl s_client查看到期时间。对比时看三个条件。第一,故障发现速度:轻量方案通常小时级,系统方案可到分钟级。第二,维护成本:轻量方案几乎为零,系统方案需要配置告警渠道并定期检查误报。第三,数据价值:系统方案留下历史记录,能判断是偶发波动还是持续恶化。如果站点只有一个且不承载交易,轻量方案足够;如果有多个子域名和业务接口,系统方案更合适。
dig 域名 A对比预期IP。结果不一致时,先确认是否刚修改过记录,再检查是否有多条冲突记录。robots.txt是否误封重要目录,检查站点地图是否能正常访问。要清楚robots.txt的限制抓取不等于可靠的索引移除,站点地图提交也不保证收录。下一步,先选一个主域名和一个关键页面,按上面的清单跑一遍,记录当前状态作为基线。之后根据站点重要程度,决定是保持轻量抽查,还是升级到系统监测并设置告警。