适用场景
三支柱不是三套工具,而是三种视角:指标告诉你"有没有问题",链路告诉你"慢在哪一段",日志告诉你"为什么"。
配置步骤(三支柱打通与排障案例)
# 排障路径
# 1) 指标告警:某接口 P99 突增 → 找到时间窗口
# 2) 链路:定位慢在数据库调用 → 得到 trace_id
# 3) 日志:按 trace_id + 时间检索,看到慢 SQL 与锁等待
# 4) 处置与复盘
关键参数与建议
- 指标:聚合数据,用于告警与趋势(Prometheus 类)
- 日志:明细数据,用于定位与取证(集中日志平台)
- 链路:请求级数据,用于定位跨服务瓶颈(Tracing)
- 统一标识:trace_id 贯穿日志与链路,方便跳转
- 采样与成本:全量指标 + 采样链路 + 分级日志
容易踩的坑
- 三套系统各自为政,无法串联
- 时间未同步,跨系统对不上
- 日志缺少关键字段(SQL、下游地址)
验证与巡检
# 验证:做一次演练,记录从告警到定位的耗时
- 巡检:演练耗时趋势改善
小结
可观测性的验收场景:给一个用户报障时间点,能在 5 分钟内定位到具体接口、具体下游、具体错误。做到就合格。
> 说明:文中命令为通用写法,不同型号/版本可能略有差异,落地前请对照设备实际版本的官方文档;带外管理与安全设备变更建议先在测试设备验证。