阿里云阿里云智能-容器SRE平台技术专家-杭州/北京/深圳
任职要求
1、5年以上工作经验;有大规模容器集群研发、运营、稳定性体系建设,研发体系建设经验者优先; 2、熟练使用AI工具和平台,有提升开发效率、优化代码质量、加速问题排查与产品迭代经验者优先; 3、熟练掌握Golang语言,熟悉k8s生态和其中关键组件(如apiser…
工作职责
1、负责阿里云容器服务SRE平台建设工作,负责 K8S 生命周期管理,自愈/弹性/限流/驱逐等稳定性能力相关 operator 研发工作,确保集群稳定性SLA达标; 2、负责建立 K8S 配套运维平台,SRE AI Agent 研发,提升运维效率,确保集群运维能力的可持续发展; 3、负责 K8S 集群日常 oncall 体系和能力建设,端到端定位 K8S 集群的功能和性能问题,解决线上问题; 4、牵头跨部门复杂项目(如业务容器化项目),推进业务和技术目标落地。
1. 负责容器环境(如 Kubernetes、Docker)的日常运维工作,包括安装、配置、升级、扩容、性能优化、基础镜像构建等 2. 负责容器平台的监控、应急响应,及时定位和解决常规故障,保障业务高可用 3. 建立并完善容器运维流程,包括上线、变更、回滚策略,定期组织应急演练,不断提升平台稳定性 4. 协助设计和落地容器化最佳实践,持续优化部署流程和资源使用效率

1. 负责公司容器与云原生平台的整体技术规划与架构设计 主导 Kubernetes 平台的整体架构设计、演进路线和技术选型 构建稳定、高可用、可扩展的容器运行时与调度平台,支撑核心业务系统 2. 建设和优化容器基础设施能力 深度参与 Kubernetes 核心组件(Scheduler、Controller、CRI、CNI、CSI 等)的定制、调优与问题排查 设计并落地多集群、多可用区、混合云、多云架构 提升集群稳定性、资源利用率与调度效率(弹性伸缩、资源超卖、QoS、潮汐调度等) 3. 打造云原生平台化能力 建设容器平台的 PaaS / 内部平台能力(应用发布、灰度发布、弹性伸缩、服务治理等) 推动 GitOps、声明式交付、自动化运维体系建设 与 CI/CD、服务网格、可观测性体系(Metrics、Logs、Tracing)深度集成 4. 复杂问题处理与稳定性保障 负责容器平台重大故障的技术分析、定位与治理方案 建立平台级 SLO / SLA、容量规划、稳定性与风险评估体系 优化平台在大规模业务、高并发场景下的性能与可靠性 5. 技术影响力与团队建设 负责容器团队的技术方向把控、技术评审与技术债治理 指导和培养高级工程师,提升团队整体技术深度 推动云原生最佳实践在公司内部的落地与规范化