K8s 运维系列 | 第 24 天:性能调优——节点与集群性能优化实战
在 Kubernetes 集群真正投入生产之后,绝大多数运维团队最先遇到的问题并不是'功能用不起来',而是'性能不够用'和'成本下不来'。CPU 被申请了一大堆却长期闲置、内存申请远超实际需求、节点利用...
K8s 运维系列 | 第 23 天:扩展开发——CRD 与 Operator 模式
在掌握了 Deployment、StatefulSet、Service、Ingress、Helm 等内置对象之后,很多运维工程师会问一个更深层的问题:当 Kubernetes 内置的能力不够用时,我们还能做什么?答案就是 Kubernetes ...
K8s 运维系列 | 第 22 天:可观测性——Metrics、Tracing 与事件体系
引言 在 Kubernetes 上运行微服务时,系统的复杂度和动态性会急剧上升。Pod 随时可能被重建、节点会漂移、服务依赖关系变化频繁。在这种情况下,传统的'登录机器看日志'的运维方式已经力不从心...
K8s 运维系列 | 第 21 天:安全加固——Pod Security 与准入控制
安全是 Kubernetes 生产环境的核心命题。默认配置下,集群允许 Pod 以 root 身份运行、挂载宿主机文件、共享进程命名空间,这些能力一旦被恶意镜像利用,攻击者就能横向移动、逃逸到宿主机,甚...
K8s 运维系列 | 第 20 天:服务网格——Istio 入门与流量管理
引言 随着微服务架构在生产环境的深入落地,服务之间的调用关系变得日益复杂。当我们把一个个单体应用拆分成几十上百个微服务之后,服务间的通信、流量控制、安全认证、可观测性等一系列问题接...
K8s 运维系列 | 第 19 天:流量治理——Ingress Controller 与 Gateway API
引言 在 Kubernetes 中,当你的应用由一个个 Pod 组成、通过 Service 对外暴露端口之后,真正的挑战才刚刚开始:如何优雅地把外部流量接入集群?如何基于域名和路径做路由?如何统一管理 TLS 证...
K8s 运维系列 | 第 18 天:存储进阶——CSI、动态供给与备份恢复
在前一篇《第 7 天:存储管理——PV、PVC 与持久化存储》中,我们学习了 PV 和 PVC 的基本用法,那套'管理员手动创建 PV、用户声明 PVC'的静态供给模式,对于生产环境来说效率太低。随着集群规...
K8s 运维系列 | 第 17 天:高可用集群——etcd 与控制平面 HA 部署
在生产环境中,单台 Master 节点往往是整个 Kubernetes 集群的致命单点。一旦这台节点宕机,kubectl 无法下发指令、调度器停止工作、整个集群陷入'失联'状态。本篇文章我们就从零开始,深入讲解...
K8s 运维系列 | 第 16 天:工作负载进阶——StatefulSet、DaemonSet 与 Job
在前面的文章中,我们重点学习了 Kubernetes 中最常见的无状态工作负载 Deployment,它凭借 ReplicaSet 与滚动更新机制,成为了绝大多数 Web 应用部署的首选。然而真实的生产环境远比'无状态服...
K8s 运维系列 | 第 15 天:应用打包——Helm 与 Chart 实战
引言 在前面十几天的学习中,我们已经掌握了 Kubernetes 的核心对象:Pod、Deployment、Service、ConfigMap、Secret、PV/PVC 等。随着要部署的应用越来越多,一个现实的问题摆在了我们面前:如...
K8s 运维系列 | 第 14 天:监控告警——Prometheus 与 Grafana 监控集群
Kubernetes 集群一旦投入生产,规模会迅速膨胀:成百上千的 Pod、分布在多台节点上的 Service、频繁变动的 Deployment,都让「集群是否健康」成为一个必须回答的问题。单纯靠 kubectl get 手工...
K8s 运维系列 | 第 13 天:日志体系——Loki 与 EFK 日志采集分析
在 Kubernetes 集群中,Pod 随时可能被调度、重启或销毁,容器产生的日志如果只保存在本地文件里,会随着容器的生命周期一起消失。当线上出现故障时,运维人员往往需要在成百上千个 Pod 之间来...









