homelab Prometheus 的 active series 少了一半,起因是 k3s 单进程把同一批 apiserver 和 etcd 指标重复暴露;三层核查确认可以丢就在入库前拦掉,内存峰值跟着降了大半。
Posts for: #k8s
软件供应链最小基线:SBOM + cosign 镜像签名
软件供应链的最小基线按问答展开:CycloneDX 生成 SBOM、cosign keyless 给镜像签名、再把 SBOM 作为 attestation 绑到镜像上,为什么这么做和绕不开的 tradeoff 一并回答。
SLO 与多窗口多 burn-rate 告警:14.4× 和 6× 怎么来的,Prometheus 规则怎么写
SLO、error budget 和 multi-burn-rate 告警的工程实现,按问答一节节推进:为什么传统阈值告警噪声大或滞后、burn rate 14.4× 和 6× 怎么来的,Prometheus 的 recording rules 与 alert 又怎么写。
K8s CPU 配置:requests/limits 各管什么、Throttling 怎么发生、谁先被驱逐
结合 Homelab 场景整理 Kubernetes 的 CPU requests/limits、CFS throttling、QoS 类别与节点压力驱逐机制,以及我当前采用的资源配置思路。
postgresql 在 prometheus stack 中没有采集到 metrics 的排查
我在 homelab 的 k8s 集群中使用 helm 部署了 postgresql,但是 prometheus stack 没有采集到 postgresql 的指标数据。怎么排查这个问题呢?
使用 helm 添加 observability 需要的服务
已经在 homelab 搭建了 microk8s 集群,需要使用 helm 为集群添加 observability 功能,包括 prometheus、grafana、loki 和 tempo 等组件。
使用 Terraform 和 Ansible 创建 K8s 集群
使用 Terraform 和 Ansible 在 proxmox 的虚拟机上创建 K8s 集群。