适用场景
三支柱不是三套工具,而是三种视角:指标告诉你"有没有问题",链路告诉你"慢在哪一段",日志告诉你"为什么"。
配置步骤(链路追踪落地)
# 1) SDK 接入:在入口生成 trace_id,跨服务透传(HTTP header)
# 2) 埋点粒度:入口、下游调用、数据库、缓存
# 3) 采样:按错误优先采样 + 按比例采样
# 4) 与日志关联:日志打印 trace_id
关键参数与建议
- 指标:聚合数据,用于告警与趋势(Prometheus 类)
- 日志:明细数据,用于定位与取证(集中日志平台)
- 链路:请求级数据,用于定位跨服务瓶颈(Tracing)
- 统一标识:trace_id 贯穿日志与链路,方便跳转
- 采样与成本:全量指标 + 采样链路 + 分级日志
容易踩的坑
- 只埋入口,看不到下游耗时
- 采样率过低,问题请求没有数据
- trace_id 未透传到日志,无法关联
验证与巡检
# 验证:按 trace_id 检索,能看到完整调用链与对应日志
- 巡检:链路覆盖核心服务、trace_id 贯通
小结
可观测性的验收场景:给一个用户报障时间点,能在 5 分钟内定位到具体接口、具体下游、具体错误。做到就合格。
> 说明:文中命令为通用写法,不同型号/版本可能略有差异,落地前请对照设备实际版本的官方文档;带外管理与安全设备变更建议先在测试设备验证。