服务监控:Actuator + Prometheus + Grafana

发布时间:2026/7/31 0:13:28
服务监控:Actuator + Prometheus + Grafana 服务监控Actuator Prometheus Grafana线上服务就像一辆行驶中的汽车——没有仪表盘你不知道油量、不知道速度、不知道发动机温度等真抛锚了才发现问题那就晚了。一、为什么需要监控线上服务跑着跑着突然卡了、内存满了、响应慢了——如果没监控你只能靠用户投诉来发现问题。被动救火永远慢半拍。监控的核心价值线上问题无感知→提前预警CPU飙到90%就告警而不是等服务挂了才知道性能瓶颈定位哪个接口慢慢在哪是GC停顿还是数据库查询容量规划QPS趋势分析什么时候该加机器、加多少数据说话故障复盘出问题后回溯监控曲线快速定位根因完整的监控体系分三层指标监控Metrics→日志收集Logging→链路追踪Tracing即所谓的可观测性三支柱。本文聚焦指标监控。二、SpringBoot ActuatorActuator是SpringBoot自带的监控模块提供了一系列HTTP端点开箱即用。2.1 引入依赖dependencygroupIdorg.springframework.boot/groupIdartifactIdspring-boot-starter-actuator/artifactId/dependency2.2 核心端点一览端点路径说明health/actuator/health应用健康状态探活用info/actuator/info应用基本信息metrics/actuator/metrics各类指标数据loggers/actuator/loggers日志级别查看与动态修改env/actuator/env环境变量配置threaddump/actuator/threaddump线程转储信息heapdump/actuator/heapdump堆内存转储文件下载2.3 端点安全配置默认只暴露/health需要手动开启其他端点的Web访问management:endpoints:web:exposure:include:*# 暴露所有端点生产环境按需选择exclude:env,beans# 排除敏感端点base-path:/actuator# 基础路径endpoint:health:show-details:always# 显示健康详情默认NEVER不显示shutdown:enabled:false# 禁止远程关机千万别开访问/actuator/health返回示例{status:UP,components:{db:{status:UP,details:{database:MySQL}},diskSpace:{status:UP,details:{total:500107862016,free:198656831488}},ping:{status:UP}}}三、Micrometer — 监控门面Actuator本身的指标格式不够通用Micrometer作为监控门面类似SLF4J之于日志将指标数据适配为不同监控系统的格式。dependencygroupIdio.micrometer/groupIdartifactIdmicrometer-registry-prometheus/artifactId/dependency引入后访问/actuator/prometheus即可看到Prometheus格式的指标文本# HELP jvm_memory_used_bytes The amount of used memory # TYPE jvm_memory_used_bytes gauge jvm_memory_used_bytes{areaheap,idG1 Eden Space} 2.5165824E7 jvm_memory_used_bytes{areaheap,idG1 Survivor Space} 1048576.0 # HELP http_server_requests_seconds HTTP请求耗时 # TYPE http_server_requests_seconds summary http_server_requests_seconds_count{methodGET,status200,uri/api/user/{id}} 1523 http_server_requests_seconds_sum{methodGET,status200,uri/api/user/{id}} 12.345四、Prometheus — 时序数据库Prometheus是CNCF旗下的开源监控系统采用Pull模式主动从目标服务抓取指标数据。4.1 核心概念时序数据每个指标按时间戳存储形成时间序列Pull模式Prometheus主动去拉取数据而非被推送PromQL专用查询语言灵活聚合分析指标4.2 配置抓取目标# prometheus.ymlglobal:scrape_interval:15s# 每15秒抓取一次scrape_configs:-job_name:springboot-appmetrics_path:/actuator/prometheusstatic_configs:-targets:[localhost:8080]labels:application:my-appenv:dev4.3 常用PromQL查询# HTTP请求QPS每秒请求数 rate(http_server_requests_seconds_count[1m]) # 接口平均响应时间 rate(http_server_requests_seconds_sum[1m]) / rate(http_server_requests_seconds_count[1m]) # JVM堆内存使用率 jvm_memory_used_bytes{areaheap} / jvm_memory_max_bytes{areaheap} * 100五、Grafana — 可视化仪表盘Grafana是一个开源的数据可视化平台支持多种数据源配合Prometheus做指标展示再合适不过。5.1 配置流程添加数据源Settings → Data Sources → Add Prometheus填写地址http://localhost:9090导入仪表盘Dashboards → Import输入模板ID或上传JSON常用模板ID4701— JVM Micrometer监控面板12900— SpringBoot 2.1 Statistics11378— Node Exporter服务器监控5.2 仪表盘核心面板一个完整的SpringBoot监控面板通常包含面板指标说明JVM内存heap/non-heap used/max堆/非堆内存使用情况JVM线程threads_live/daemon/peak活跃线程数GC统计gc_pause_secondsGC停顿时间和频率HTTP请求QPS/响应时间/错误率接口性能指标CPU使用process_cpu_usage进程CPU占用六、监控指标分类6.1 JVM层面内存堆/非堆使用量、各内存区使用详情线程活跃线程数、守护线程数、线程状态分布GCGC次数、GC耗时、各代GC统计6.2 应用层面HTTP请求QPS、响应时间分布、错误率线程池活跃线程数、队列积压数、拒绝任务数数据库连接池活跃连接数、等待线程数6.3 自定义业务指标通过Micrometer的MeterRegistry注册自定义指标ComponentpublicclassOrderMetrics{privatefinalCounterorderCreateCounter;privatefinalCounterorderFailCounter;privatefinalGaugeorderPendingGauge;publicOrderMetrics(MeterRegistryregistry,OrderServiceorderService){// Counter只增不减的计数器this.orderCreateCounterCounter.builder(order.create.total).description(订单创建总数).tag(type,all).register(registry);this.orderFailCounterCounter.builder(order.create.fail).description(订单创建失败数).register(registry);// Gauge瞬时值this.orderPendingGaugeGauge.builder(order.pending.count,()-orderService.getPendingCount()).description(待处理订单数).register(registry);}publicvoidincrementCreate(){orderCreateCounter.increment();}publicvoidincrementFail(){orderFailCounter.increment();}}// Timer耗时统计ServicepublicclassPaymentService{AutowiredprivateMeterRegistryregistry;publicvoidpay(Orderorder){Timer.SamplesampleTimer.start(registry);try{// 支付逻辑doPay(order);}finally{sample.stop(Timer.builder(payment.duration).description(支付耗时).tag(channel,order.getChannel()).register(registry));}}}三种核心指标类型类型说明场景Counter只增不减请求总数、错误总数Gauge可增可减的瞬时值队列长度、内存使用量Timer耗时统计接口响应时间、方法执行时间七、完整搭建流程1. SpringBoot应用引入actuator micrometer-prometheus 2. 配置management.endpoints暴露prometheus端点 3. 启动Prometheus配置scrape_configs抓取应用指标 4. 启动Grafana添加Prometheus数据源 5. 导入JVM仪表盘模板ID: 4701 6. 创建自定义业务监控面板 7. 配置告警规则Alertmanager告警规则示例# alert_rules.ymlgroups:-name:springboot-alertsrules:-alert:HighErrorRateexpr:rate(http_server_requests_seconds_count{status~5..}[5m])0.1for:2mlabels:severity:criticalannotations:summary:接口错误率过高description:{{ $labels.uri }} 5xx错误率超过10%-alert:HighMemoryUsageexpr:jvm_memory_used_bytes{areaheap}/ jvm_memory_max_bytes{areaheap}0.85for:5mlabels:severity:warningannotations:summary:JVM堆内存使用率超过85%Actuator采集指标Prometheus存储和查询Grafana展示和告警——三件套配合起来线上服务的健康状况就尽在掌握了。这套监控体系不需要写复杂的代码主要是配置工作但带来的运维价值是巨大的。