关于我
拥有1年Python爬虫实战开发经验,熟练requests、JS逆向、分布式爬虫,可独立处理网站反爬、数据批量采集;熟练Python脚本开发,擅长编写自动化工具简化重复工作。
3年Linux全栈运维实践,长期自主在阿里云ECS/ACK搭建各类测试集群,自有域名与云服务器持续做技术落地。精通多发行版Linux系统调优、故障排查,熟练Shell自动化脚本、Ansible批量运维,具备完整传统集群与云原生容器落地经验。
擅长K8s、Docker容器化、Ceph分布式存储、MySQL高可用、监控告警、CI/CD流水线全套运维链路;擅长利用Claude、DeepSeek大模型搭建运维AI智能体,自定义Prompt实现一键故障定位、脚本生成,大幅提升运维效率。
喜欢搭建个人站点、研究前沿技术、写技术/troubleshooting文档、也喜欢vibe coding;遇到有挑战的工作会迎难而上,善于搭建运维agent快速定位解决问题;长期职业规划深耕云原生领域,专注容器、自动化运维、分布式架构方向。
实战项目
项目一:二进制脚本构建 K8s 高可用集群 + 若依前后端云原生 SRE 落地
K8sShell若依CephSREPrometheusELK
根因
阿里云 ACK 托管集群组件封装度高、自定义改造受限,手动二进制部署 K8s 耗时 1 小时以上效率低下;传统物理机部署若依系统软硬件深度耦合,业务扩容需要停机、数据库无动态持久化存储、缺少统一指标监控与日志排查平台,线上故障发现滞后、定位慢、数据无容灾保障。
实现原理
- 编写 3 套 Shell 自动化脚本完成全流程 K8s 二进制部署:系统初始化脚本完成内核调优、开启 IPVS 模块、关闭 Swap、主机三节点互信配置;ETCD 部署脚本自动签发 ETCD 与 K8s 全套 TLS 证书、搭建高可用 ETCD 集群;K8s 组件部署脚本从阿里云 OSS 拉取组件包并做文件校验,一键部署 APIServer、控制器、调度器、kubelet、Containerd。
- 若依前后端 deploy 部署:将若依 Vue 前端、SpringBoot 后端打包容器镜像,通过 Deployment 控制器实现业务弹性扩缩容、故障 Pod 自动重建,依靠 Service 实现组件内部负载均衡,前端 Service 采用 LoadBalancer 类型对外暴露访问入口,依托集群多节点特性实现接入层高可用。
- Cephfs 动态存储:部署 Rook-Ceph CSI 驱动并配置 StorageClass 存储类,实现 PVC 动态供给,MySQL 数据库使用 StatefulSet 绑定 Ceph 远端 RBD 块存储完成持久化,依托 Ceph 多副本冗余、RBD 快照实现数据库故障漂移、数据备份恢复。
- 搭建 SRE 可观测体系:Prometheus 采集节点硬件、K8s 核心组件、业务容器、MySQL、Ceph 全量指标,Grafana 绘制业务运行大盘,AlertManager 配置企业微信分级告警;基于简化 ELK 架构,使用 Filebeat 直接采集容器日志,推送至 Elasticsearch 集中存储,借助 Kibana 完成业务日志、报错日志可视化检索,缩短故障排查时长。
落地成果
K8s 集群部署由 1 小时降低至 5 分钟,效率提升 90%;线上故障排查时长下降 70%;数据库依托分布式存储实现数据多副本冗余,规避单点磁盘丢失风险。
项目二:Docker-Compose 全站服务容器化
Docker-ComposeNginxPHPMariaDB容器化
根因
个人 2C2G 低配阿里云服务器部署有博客、私有网盘、静态资源、工具站点等多项服务,初期采用单服务独立部署模式,存在端口杂乱、环境不隔离、中间件重复部署、服务器资源浪费严重,运维效率极低。
实现原理
- 系统检测:基于 2C2G 低配版考量,必须整合功能,让多个应用共享 Nginx / PHP / MySQL,不重复开容器浪费资源。
- 兼容性检测:调研各服务对组件的要求,发现 kodbox 网盘对 php 的 gd 扩展有单独的 JPEG/FreeType 支持要求,于是定制 php 的 Dockerfile,安装并开启 JPEG/FreeType 支持,编译新的 php 镜像。
- 镜像准备:下载好 nginx:1.24、mariadb:10.6 和编译好适配后的 php 镜像。
- 编写 docker-compose.yaml:编排好 mariadb、php、nginx,启动顺序为 mysql→php→nginx,然后挂载宿主机的程序目录、nginx 配置目录、数据库目录、证书目录。
落地成果
docker-compose 一键启停所有服务,博客和网盘共享 nginx+php+mariadb 稳定运行;存储全部挂载宿主机资源,修改资源方便,不用重建镜像。
项目三:WordPress 分布式高可用容灾集群(7 节点)
Nginx+KeepalivedLsyncdMySQL高可用Redis容灾备份
根因
传统单机 WordPress 存在严重单点故障,无故障自动切换、无文件同步、备份机制薄弱,无法保障业务 7×24 小时稳定运行。为此搭建七层分布式集群架构,从负载均衡、Web 业务、数据缓存、容灾备份多维度消除单点隐患,实现业务高可用。
实现原理
- 部署双机 nginx+keepalived 架构,配置 VRRP 双实例互为备份,支持 VIP 自动漂移,实现主节点故障秒级切换,保障入口流量不中断。
- 搭建 3 台 WordPress+PHP 业务节点,通过 nginx 反向代理实现流量负载均衡,依托 lsyncd 实时同步站点文件,确保多节点业务数据一致。
- 搭建 MySQL+Redis 数据架构,利用 Redis 缓存优化访问速度;配置 MySQL 每日增量备份,通过 rsync+定时任务将备份文件同步至独立备份节点,实现数据容灾留存。
落地成果
多节点对外提供服务,承载流量大,同时消除单点故障;每日备份,保障数据安全可靠性;Redis 做缓存,数据吞吐量更大。
项目四:Rook-Ceph 分布式存储支撑 Kodbox 私有网盘业务落地
RookCephCeph-CSIRBDPrometheus
根因
单机部署 Kodbox 私有网盘依赖本地物理磁盘存储,硬盘单点故障会直接造成用户文件丢失,存储容量无法在线横向扩容,网盘附件、文档、图片等海量文件缺少定时快照和备份机制,数据安全性较差。
实现原理
- 在现有 K8s 集群之上使用 Rook 容器化编排部署 Ceph 分布式存储集群,部署 Ceph-CSI 存储驱动,创建 StorageClass 实现 K8s 业务 PVC 动态创建、在线扩容。
- Kodbox 网盘容器挂载 Ceph RBD 块存储用于存放用户上传附件、图片、文档等非结构化文件,网盘配套数据库同样对接 Ceph 持久化存储。
- 依靠 Ceph 三副本机制保障文件数据高可用,实操故障磁盘下线、新增存储节点横向扩容、集群数据重平衡,通过 RBD 定时快照完成网盘全量数据备份,可快速快照回滚恢复业务。
- 将 Ceph OSD 磁盘状态、PG 集群状态、磁盘 IO 读写指标接入 Prometheus 监控,配置存储异常告警,提前预警磁盘满、集群失衡等存储故障。
落地成果
消除存储单点故障,文件丢失风险大幅降低;支持存储节点无缝横向扩容,快照实现分钟级业务数据恢复。
AI运维创新实践
依托Claude、DeepSeek大模型,在Linux命令行搭建专属运维智能体,针对集群报错、日志异常、存储故障、容器排障场景定制专属Prompt与技能库;
可自动分析报错日志、输出修复命令、批量生成Shell/Ansible脚本、定位K8s与Ceph集群异常,大幅缩短故障排查时间,把AI工具融入整套运维工作流,提升自动化与排障效率。