基于 Kubernetes 1.35 官方文档和实操验证,梳理 VPA 的 InPlaceOrRecreate 模式、原地调容的工作链路,以及落地时最容易踩的坑。
软件工程的临界点:AI 把产量推到 10x 之后,瓶颈迁到评审、测试、版本控制与安全
Google I/O 2026 上 Adam Bender 这场《Software engineering at the tipping point》的笔记:今天这套造软件、发软件的基础设施吸收不了 AI 的增量,他给的观察框架是 Software Ecology,把工程当成一个会失衡的生态系统。
Affirm 用一周让 800 人的工程组织转向 agentic 工作流
Affirm 工程效能团队复盘自己的 agentic 开发转型:一周把 800 人推上 agentic 工作流,中间遇到哪些问题,四个月后又补了哪些洞。
电商 Guest-First 购物体验:无需注册也能完整下单
注册门槛往往会抬高结账流失。Shop Platform 现在的做法是 guest JWT 加 Redis 游客购物车(TTL 48 小时),游客订单靠 order_token 追踪,登录后再合并购物车;buyer-portal 和 buyer-app 在这段体验上还有差别。
Queue-it 播客:autoscaling 什么时候会失效
Queue-it 这期播客聊生产环境的自动扩缩容:autoscaling 是必要条件但不是充分条件,瞬时尖峰下它会失效,要用 pre-scaling 补,这笔账最后落在成本上。
用两台 GB10 跑 DeepSeek-V4-Flash:149GB 权重、sm_121 引擎选型与 MTP 调优后的吞吐
用两台 DGX Spark(GB10)部署 DeepSeek-V4-Flash(284B/13B-active,官方 FP8):为什么 128GB 单机装不下 149GB 权重、如何为 GB10 的 sm_121 架构选对 vLLM 引擎、源码构建中 torch 被悄悄降级的隐蔽问题,以及 MTP 调优后的实际吞吐。
K8s Service 访问链路:域名如何解析到 ClusterIP,再转发到 Pod
我顺着一个 Pod DNS 排查短视频,把 K8s Service 网络链路重新整理了一遍:DNS 解析、ClusterIP 到 Pod IP 的 DNAT、EndpointSlice、负载均衡,以及 1.36 时代 iptables/IPVS/nftables/eBPF 的取舍。
Spring Boot 3.4+ 的结构化日志:5 行配置启用 ECS,用 Fluent API 写出 OpenSearch 可查的字段
Spring Boot 3.4+ 内建了 ECS 结构化日志支持,5 行配置能替掉大部分手写的 logback-spring.xml,再用 SLF4J Fluent API 把字段写成 OpenSearch 查得到、聚得起来的样子。
feature 加得快,不等于产品更好,AI 时代的一点克制
读 Nick Hodges 的《A new challenge for software product managers》后,我顺手记下几条工程师视角的补充:当 AI 把“工作量”这道闸拆掉后,我会怎么判断一个 feature 值不值得进来。
GitHub 用 eBPF 限制部署脚本的对外网络访问
InfoQ 总结 GitHub Engineering 2026 年 4 月那篇文章:修复系统的部署链路自己依赖着待修的系统,eBPF 挂在部署进程的 cGroup 网络出口上把这条隐性依赖管住,笔记里还过了一遍 eBPF 在 Cloud Native 项目里别的落地点。