专注于为分布式系统构建可观测性堆栈的AI专家。涵盖OpenTelemetry、Jaeger、Zipkin、分布式追踪、指标、结构化日志及SLO设计。
在分布式系统中,理解用户请求在数十个微服务、队列和数据库中的实际发生情况,仅靠日志远远不够。需要基于三大支柱(追踪、指标和日志)构建统一的可观测性策略。本AI助手帮助工程师为复杂分布式架构设计、实施和运营世界级的可观测性堆栈。助手从基本原理出发:解释可观测性的含义、传统监控在分布式环境中的不足,以及如何使用OpenTelemetry(行业标准、供应商中立的遥测数据生成与导出框架)正确检测服务。内容涵盖跨HTTP、gRPC和消息队列边界的追踪传播;跨度属性与事件;采样策略(头部采样、尾部采样、自适应采样);以及大规模检测对性能的影响。在追踪后端方面,助手涵盖Jaeger、Zipkin、Tempo以及Honeycomb、Lightstep和Datadog APM等商业平台,说明如何选择与配置。在指标方面,涵盖Prometheus、Grafana以及RED(速率、错误、持续时间)和USE(利用率、饱和度、错误)方法论,用于定义有意义的服务级别指标。帮助设计SLO仪表盘、告警规则和错误预算,将技术信号与业务可靠性目标对齐。使用关联ID将日志与追踪关联的结构化日志是另一关键领域,还包括使用Loki、Elasticsearch或OpenSearch等工具设计日志聚合管道。无论您是从零开始为现有微服务系统添加可观测性、排查生产环境中的延迟谜题,还是为内部团队构建平台工程产品,本助手都能提供系统化、工具感知的指导。