作者头像

谢涵

云原生运维工程师 | Python开发

深耕Linux自动化、K8s容器与分布式存储,结合AI大模型提升运维排障效率,长期深耕云原生技术路线

关于我

拥有1年Python爬虫实战开发经验,熟练requests、JS逆向、分布式爬虫,可独立处理网站反爬、数据批量采集;熟练Python脚本开发,擅长编写自动化工具简化重复工作。

3年Linux全栈运维实践,长期自主在阿里云ECS/ACK搭建各类测试集群,自有域名与云服务器持续做技术落地。精通多发行版Linux系统调优、故障排查,熟练Shell自动化脚本、Ansible批量运维,具备完整传统集群与云原生容器落地经验。

擅长K8s、Docker容器化、Ceph分布式存储、MySQL高可用、监控告警、CI/CD流水线全套运维链路;擅长利用Claude、DeepSeek大模型搭建运维AI智能体,自定义Prompt实现一键故障定位、脚本生成,大幅提升运维效率。

喜欢搭建个人站点、研究前沿技术、写技术/troubleshooting文档、也喜欢vibe coding;遇到有挑战的工作会迎难而上,善于搭建运维agent快速定位解决问题;长期职业规划深耕云原生领域,专注容器、自动化运维、分布式架构方向。

技术栈

Linux & 自动化运维

  • Ubuntu22.04、麒麟V10、CentOS7、Rocky9.3运维调优
  • Shell脚本、文本四剑客grep/sed/awk/find
  • Ansible Playbook/Roles批量集群部署
  • Nginx+Keepalived高可用、Lsyncd文件同步
  • Git、阿里云ACR、Harbor私有镜像仓库
  • Jenkins+GitLab/Gitee CI/CD流水线搭建

云原生 & 分布式存储

  • Docker、Docker-Compose、Dockerfile镜像制作
  • K8s集群部署、StatefulSet/Deployment排障
  • Ceph集群运维、RBD、OSD扩缩容、CSI对接K8s
  • 阿里云ECS/ACK/OSS/SLB/CDN/云监控全产品实操
  • ELK日志平台、Prometheus+Grafana、Zabbix监控

数据库 & Web集群

  • MySQL主从、MHA高可用、读写分离、Binlog备份恢复
  • Redis缓存、消息队列架构落地
  • Nginx+Tomcat前后端分离部署
  • WordPress分布式7节点高可用容灾集群
  • 若依前后端容器化部署对接Ceph动态存储

开发语言 & AI运维

  • Python爬虫、数据处理脚本开发
  • 熟练阅读Go代码,深耕云原生开发方向
  • Claude/DeepSeek运维智能体搭建
  • 自定义运维Prompt、故障自动推理排错

实战项目

项目一:二进制脚本构建 K8s 高可用集群 + 若依前后端云原生 SRE 落地

K8sShell若依CephSREPrometheusELK

根因

阿里云 ACK 托管集群组件封装度高、自定义改造受限,手动二进制部署 K8s 耗时 1 小时以上效率低下;传统物理机部署若依系统软硬件深度耦合,业务扩容需要停机、数据库无动态持久化存储、缺少统一指标监控与日志排查平台,线上故障发现滞后、定位慢、数据无容灾保障。

实现原理

  • 编写 3 套 Shell 自动化脚本完成全流程 K8s 二进制部署:系统初始化脚本完成内核调优、开启 IPVS 模块、关闭 Swap、主机三节点互信配置;ETCD 部署脚本自动签发 ETCD 与 K8s 全套 TLS 证书、搭建高可用 ETCD 集群;K8s 组件部署脚本从阿里云 OSS 拉取组件包并做文件校验,一键部署 APIServer、控制器、调度器、kubelet、Containerd。
  • 若依前后端 deploy 部署:将若依 Vue 前端、SpringBoot 后端打包容器镜像,通过 Deployment 控制器实现业务弹性扩缩容、故障 Pod 自动重建,依靠 Service 实现组件内部负载均衡,前端 Service 采用 LoadBalancer 类型对外暴露访问入口,依托集群多节点特性实现接入层高可用。
  • Cephfs 动态存储:部署 Rook-Ceph CSI 驱动并配置 StorageClass 存储类,实现 PVC 动态供给,MySQL 数据库使用 StatefulSet 绑定 Ceph 远端 RBD 块存储完成持久化,依托 Ceph 多副本冗余、RBD 快照实现数据库故障漂移、数据备份恢复。
  • 搭建 SRE 可观测体系:Prometheus 采集节点硬件、K8s 核心组件、业务容器、MySQL、Ceph 全量指标,Grafana 绘制业务运行大盘,AlertManager 配置企业微信分级告警;基于简化 ELK 架构,使用 Filebeat 直接采集容器日志,推送至 Elasticsearch 集中存储,借助 Kibana 完成业务日志、报错日志可视化检索,缩短故障排查时长。

落地成果

K8s 集群部署由 1 小时降低至 5 分钟,效率提升 90%;线上故障排查时长下降 70%;数据库依托分布式存储实现数据多副本冗余,规避单点磁盘丢失风险。

项目二:Docker-Compose 全站服务容器化

Docker-ComposeNginxPHPMariaDB容器化

根因

个人 2C2G 低配阿里云服务器部署有博客、私有网盘、静态资源、工具站点等多项服务,初期采用单服务独立部署模式,存在端口杂乱、环境不隔离、中间件重复部署、服务器资源浪费严重,运维效率极低。

实现原理

  • 系统检测:基于 2C2G 低配版考量,必须整合功能,让多个应用共享 Nginx / PHP / MySQL,不重复开容器浪费资源。
  • 兼容性检测:调研各服务对组件的要求,发现 kodbox 网盘对 php 的 gd 扩展有单独的 JPEG/FreeType 支持要求,于是定制 php 的 Dockerfile,安装并开启 JPEG/FreeType 支持,编译新的 php 镜像。
  • 镜像准备:下载好 nginx:1.24、mariadb:10.6 和编译好适配后的 php 镜像。
  • 编写 docker-compose.yaml:编排好 mariadb、php、nginx,启动顺序为 mysql→php→nginx,然后挂载宿主机的程序目录、nginx 配置目录、数据库目录、证书目录。

落地成果

docker-compose 一键启停所有服务,博客和网盘共享 nginx+php+mariadb 稳定运行;存储全部挂载宿主机资源,修改资源方便,不用重建镜像。

项目三:WordPress 分布式高可用容灾集群(7 节点)

Nginx+KeepalivedLsyncdMySQL高可用Redis容灾备份

根因

传统单机 WordPress 存在严重单点故障,无故障自动切换、无文件同步、备份机制薄弱,无法保障业务 7×24 小时稳定运行。为此搭建七层分布式集群架构,从负载均衡、Web 业务、数据缓存、容灾备份多维度消除单点隐患,实现业务高可用。

实现原理

  • 部署双机 nginx+keepalived 架构,配置 VRRP 双实例互为备份,支持 VIP 自动漂移,实现主节点故障秒级切换,保障入口流量不中断。
  • 搭建 3 台 WordPress+PHP 业务节点,通过 nginx 反向代理实现流量负载均衡,依托 lsyncd 实时同步站点文件,确保多节点业务数据一致。
  • 搭建 MySQL+Redis 数据架构,利用 Redis 缓存优化访问速度;配置 MySQL 每日增量备份,通过 rsync+定时任务将备份文件同步至独立备份节点,实现数据容灾留存。

落地成果

多节点对外提供服务,承载流量大,同时消除单点故障;每日备份,保障数据安全可靠性;Redis 做缓存,数据吞吐量更大。

项目四:Rook-Ceph 分布式存储支撑 Kodbox 私有网盘业务落地

RookCephCeph-CSIRBDPrometheus

根因

单机部署 Kodbox 私有网盘依赖本地物理磁盘存储,硬盘单点故障会直接造成用户文件丢失,存储容量无法在线横向扩容,网盘附件、文档、图片等海量文件缺少定时快照和备份机制,数据安全性较差。

实现原理

  • 在现有 K8s 集群之上使用 Rook 容器化编排部署 Ceph 分布式存储集群,部署 Ceph-CSI 存储驱动,创建 StorageClass 实现 K8s 业务 PVC 动态创建、在线扩容。
  • Kodbox 网盘容器挂载 Ceph RBD 块存储用于存放用户上传附件、图片、文档等非结构化文件,网盘配套数据库同样对接 Ceph 持久化存储。
  • 依靠 Ceph 三副本机制保障文件数据高可用,实操故障磁盘下线、新增存储节点横向扩容、集群数据重平衡,通过 RBD 定时快照完成网盘全量数据备份,可快速快照回滚恢复业务。
  • 将 Ceph OSD 磁盘状态、PG 集群状态、磁盘 IO 读写指标接入 Prometheus 监控,配置存储异常告警,提前预警磁盘满、集群失衡等存储故障。

落地成果

消除存储单点故障,文件丢失风险大幅降低;支持存储节点无缝横向扩容,快照实现分钟级业务数据恢复。

AI运维创新实践

依托Claude、DeepSeek大模型,在Linux命令行搭建专属运维智能体,针对集群报错、日志异常、存储故障、容器排障场景定制专属Prompt与技能库;

可自动分析报错日志、输出修复命令、批量生成Shell/Ansible脚本、定位K8s与Ceph集群异常,大幅缩短故障排查时间,把AI工具融入整套运维工作流,提升自动化与排障效率。

联系我