hostname 已经写在 Ingress 或 HTTPRoute 里,再去 DNS 那边手建一条记录,等于给集群状态留了一份要同步维护的副本。交给 external-dns 的代价是自己定三件事:读哪种资源、target 指向哪里、哪些记录归这个实例。
Posts for: #prometheus
容器内存 99% 但没有 OOM:可能是页缓存
容器内存告警冲到 99.45% 却没触发 OOM,峰值里约 87% 是页缓存;同一个容器热缓存下重启只剩 23.70%,最后把告警的分子换成 RSS。
把重复 series 拦在入库前:我的 Prometheus 内存瘦身
homelab Prometheus 的 active series 少了一半,起因是 k3s 单进程把同一批 apiserver 和 etcd 指标重复暴露;三层核查确认可以丢就在入库前拦掉,内存峰值跟着降了大半。
Homelab 消息通知:Alertmanager 通过 Gotify 推送告警
在 Homelab K3s 集群中,通过部署 alertmanager_gotify_bridge 将 Prometheus Alertmanager 的告警推送到 Gotify,实现自托管消息通知。记录从 Vault 存储 Token、ESO 同步 Secret、到 Alertmanager 路由配置的完整步骤。
Spring Boot 应用的 Metrics 埋点:自动埋点覆盖了什么,什么时候要自己埋(2026)
以 Spring Boot 3.5 + Micrometer 为基础,整理一次应用层 Metrics 埋点实践:自动埋点覆盖范围、@Observed 注解用法、高低基数字段设计、手动 Observation API,以及与 Prometheus 和 OTel 的关系。
SLO 与多窗口多 burn-rate 告警:14.4× 和 6× 怎么来的,Prometheus 规则怎么写
SLO、error budget 和 multi-burn-rate 告警的工程实现,按问答一节节推进:为什么传统阈值告警噪声大或滞后、burn rate 14.4× 和 6× 怎么来的,Prometheus 的 recording rules 与 alert 又怎么写。