logo of aliyun

阿里云阿里云智能-容器SRE平台技术专家-杭州/北京/深圳

社招全职5年以上云智能集团地点:北京 | 深圳 | 杭州状态:招聘

任职要求


1、5年以上工作经验;有大规模容器集群研发、运营、稳定性体系建设,研发体系建设经验者优先;
2、熟练使用AI工具和平台,有提升开发效率、优化代码质量、加速问题排查与产品迭代经验者优先;
3、熟练掌握Golang语言,熟悉k8s生态和其中关键组件(如apiser…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1、负责阿里云容器服务SRE平台建设工作,负责 K8S 生命周期管理,自愈/弹性/限流/驱逐等稳定性能力相关 operator 研发工作,确保集群稳定性SLA达标;
2、负责建立 K8S 配套运维平台,SRE AI Agent 研发,提升运维效率,确保集群运维能力的可持续发展;
3、负责 K8S 集群日常 oncall 体系和能力建设,端到端定位 K8S 集群的功能和性能问题,解决线上问题;
4、牵头跨部门复杂项目(如业务容器化项目),推进业务和技术目标落地。
包括英文材料
Go+
Kubernetes+
还有更多 •••
相关职位

logo of futu
社招3年以上技术类

1. 负责容器环境(如 Kubernetes、Docker)的日常运维工作,包括安装、配置、升级、扩容、性能优化、基础镜像构建等 2. 负责容器平台的监控、应急响应,及时定位和解决常规故障,保障业务高可用 3. 建立并完善容器运维流程,包括上线、变更、回滚策略,定期组织应急演练,不断提升平台稳定性 4. 协助设计和落地容器化最佳实践,持续优化部署流程和资源使用效率

更新于 2026-03-27深圳
logo of ly
社招5年以上

1. 负责公司容器与云原生平台的整体技术规划与架构设计 主导 Kubernetes 平台的整体架构设计、演进路线和技术选型 构建稳定、高可用、可扩展的容器运行时与调度平台,支撑核心业务系统 2. 建设和优化容器基础设施能力 深度参与 Kubernetes 核心组件(Scheduler、Controller、CRI、CNI、CSI 等)的定制、调优与问题排查 设计并落地多集群、多可用区、混合云、多云架构 提升集群稳定性、资源利用率与调度效率(弹性伸缩、资源超卖、QoS、潮汐调度等) 3. 打造云原生平台化能力 建设容器平台的 PaaS / 内部平台能力(应用发布、灰度发布、弹性伸缩、服务治理等) 推动 GitOps、声明式交付、自动化运维体系建设 与 CI/CD、服务网格、可观测性体系(Metrics、Logs、Tracing)深度集成 4. 复杂问题处理与稳定性保障 负责容器平台重大故障的技术分析、定位与治理方案 建立平台级 SLO / SLA、容量规划、稳定性与风险评估体系 优化平台在大规模业务、高并发场景下的性能与可靠性 5. 技术影响力与团队建设 负责容器团队的技术方向把控、技术评审与技术债治理 指导和培养高级工程师,提升团队整体技术深度 推动云原生最佳实践在公司内部的落地与规范化

更新于 2026-01-06北京
logo of baidu
社招3年以上ACG

-负责云手机容器技术选型、调优和业务落地 -负责Linux内核研发 -负责Android虚拟化技术研发 -负责Linux/aosp系统性能优化

更新于 2026-01-09广州
logo of bytedance
社招5年以上A24006C

1、负责容器服务单集群节点规模上限提升,通过系统化和产品化的方式解决容量和规模问题; 2、负责容器服务节点、Pod扩缩容速度,在提升速度的同时能够保证整体系统的稳定性与健壮性; 3、负责客户托管面组件高可用和可靠性建设,通过技术架构的迭代与升级支撑后续客户持续上量与业务增长; 4、负责运用技术和业界影响力推动新技术领域的规划,落地实施以及布道推广。

更新于 2026-01-16杭州