崗位職責
1. 維護 GitLab+Jenkins,支援灰度/藍綠/滾動發佈與緊急回滾,規範 Docker 映像檔與多環境部署。
2. 負責 Java 微服務部署與故障處理,維護 Nacos 註冊與配置中心、權限與變更流程。
3. 部署與運維 C++ 分散式服務,進行效能調優與異常排查,編寫/維護啟動與監控腳本。
4. 維護阿里雲 SLS 日誌採集與告警,完善 Prometheus 指標與 Grafana 看板,配置 Alertmanager 路由與 Telegram 推送。
5. 管理阿里雲資源(ECS/SLB/RDS/OSS 等),進行容量與成本優化,優化 DNS/CDN/負載平衡與跨地域網路體驗。
6. 參與輪值班,7×24 緊急應變,緊急處理生產問題,輸出故障報告與覆盤。
7. 用 Bash/Python/Go 實現發佈、巡檢、變更、擴容等自動化,推進流程標準化與平台化。
任職要求
1. 3年以上運維經驗;扎實 Linux 與網路基礎,熟練常用排障工具,良好的協作能力,能適應值班。
2. 熟悉阿里雲/亞馬遜雲核心服務與成本優化,具備容量規劃與權限隔離實踐(Terraform/ROS 優先)。
3. 熟練 GitLab/Jenkins 流水線,精通 Docker 建置與運行,了解容器網路/儲存,有灰度/藍綠/滾動發佈經驗(K8s 加分)
4. 了解 Spring Boot 運行特性與常見問題定位,熟練使用 Nacos(註冊、發現、配置、命名空間、權限)
5. 有 C++ 服務部署與監控經驗,能用 perf/valgrind/core dump 等進行問題定位,理解高並發與高可用運維實踐。
6. 熟悉 Prometheus(抓取、Relabel、Recording Rules)、Grafana(模板化與告警);熟練阿里雲 SLS;掌握 Alertmanager 與 Telegram/Webhook 整合。
7. 精通至少一種腳本語言,了解 IaC/配置管理(Ansible/Terraform/Helm 任一),具備安全與合規意識(憑證、審計、修補、映像檔安全)
8. 具備事件閉環能力(定位、處置、RCA、覆盤與改進),能建置 SOP/值班手冊/知識庫,推動指標化運維(MTTA/MTTR 等)。