01
服务健康概览
跨服务比较请求吞吐、错误率、p95 与 p99 延迟、健康状态和最近版本。
APM 汇总与链路证据共享同一套租户、时间和存储平面。
跨服务比较请求吞吐、错误率、p95 与 p99 延迟、健康状态和最近版本。
按流量、失败与延迟排列操作,再检查有代表性的链路与脱敏后端错误。
查看服务、数据库、消息队列与外部 HTTP 依赖,以及它们对关键路径的影响。
比较稳定版和候选版本,把性能回归关联到真正引入问题的发布。
工作流
先看整个服务集群的行为,再收敛到操作、请求与依赖。
通过 RED 指标和健康状态区分单服务回归与平台级事件。
把变化收敛到具体路由、版本、命名空间或生产环境。
不离开调查线索,直接阅读汇总背后的 Span 路径与依赖耗时。
把服务、Trace 和时间上下文带入下一类信号,而不是重新检索。
交付证明
服务汇总、事务、依赖、错误、部署与链路下钻均为已落地产品界面。