一次 Prometheus 内存瘦身:把重复的 series 在入库前丢掉
记录我这次把 homelab Prometheus 的 active series 砍掉一半的过程:k3s 单进程把同一批 apiserver/etcd 指标重复暴露,在入库前丢掉后内存峰值降了大半,顺便把几类调优手段各管什么归了位。
记录我这次把 homelab Prometheus 的 active series 砍掉一半的过程:k3s 单进程把同一批 apiserver/etcd 指标重复暴露,在入库前丢掉后内存峰值降了大半,顺便把几类调优手段各管什么归了位。
记录这轮压测怎么定口径、九个瓶颈分别是怎么一层层定位出来的,以及两种计费模型下同一个运行区间的账怎么算。
对比 ArgoCD 两种应用组织方式——App-of-Apps 和 ApplicationSet——在三个真实项目里的实践。按场景(单人多集群异构、团队多环境同构、混合需求)给出取舍建议和决策框架。
压测时副本数在 3 和 5 之间反复抖动,查到是 ArgoCD selfHeal 在和 HPA 抢 spec.replicas。记录这次排查的证据链、修复方式,以及引出的几个扩缩容问题。
Intermittent 413s caused by h2c upgrade + JDK HttpClient + Tomcat maxSavePostSize: root cause, troubleshooting playbook, and a deterministic kind reproduction.