logo of aliyun

阿里云阿里云智能-云存储运维系统研发专家-杭州/上海

社招全职5年以上云智能集团地点:杭州 | 上海状态:招聘

任职要求


1、熟悉软件开发和系统架构,熟练掌握至少一门编程语言,C++javapythongo;
2、五年以上云计算、存储运维系统相关的工作经验。熟悉云存储文件存储(NAS)、对象存储(OSS)等产品的核心架构,了解分布式存储系统的设计,能根据产品特性设计针对性的运维流程如部署升级、故障自愈等;
3、有大规模分布式系统监控架构设计经验,包括日志,监控,…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1、负责运维管控系统子模块设计和研发工作,如部署升级系统、根因分析系统、监控告警体系、故障自愈系统等;
2、负责可观测性平台系统的设计和研发工作,提升服务质量和系统的可观测能力;
3、制定交付标准和运维规范,通过自动化的方式,提升系统运行的效率及稳定性。
包括英文材料
C+++
Java+
Python+
Go+
分布式系统+
系统设计+
还有更多 •••
相关职位

logo of aliyun
社招5年以上云智能集团

1. 负责面向高持久性、高可用、高性能的云上块存储服务 EBS 的先进支撑底座系统的设计与开发,支撑千万级云盘实例、日均百万亿级别 I/O 请求的分布式存储系统,持续增强其可观测性、可诊断性与可运维性; 2. 构建面向高性能分布式存储的智能可观测体系,在传统监控与诊断基础上融合 AI 异常检测与诊断能力,实现故障的早期预警与精准定界; 3. 建设故障快速恢复与预防体系,通过平台工程策略与 AI 智能决策,实现故障的分钟级恢复乃至主动预防,持续降低系统 MTTR; 4. 设计覆盖全链路的稳定性技术体系,制定面向高持久性、高可用、高性能复杂场景的稳定性保障策略与标准; 5. 长期追踪工业界与学术界前沿技术(如面向时序数据的基础大模型、先进混沌工程实践等),主导技术预研与规模化落地,驱动团队技术持续演进。

更新于 2025-11-20杭州
logo of antgroup
社招5年以上技术-运维

● 负责云上网络架构设计、优化及故障排查,管理云上网络资源,确保网络高可用性,提升运维效率 ● 负责设计并实施网络访问控制策略,保障业务系统安全访问 ● 负责阿里云ECS实例、容器服务(ACK)、存储服务(OSS、块存储、文件存储)的日常运维与优化 ● 参与多活数据中心规划,支持业务全球部署与灾备需求 ● 管理云上计算资源调度与优化,确保高可用性与资源利用率。 ● 优化操作系统性能,处理系统级问题,提升系统稳定性 ● 为业务部门提供网络、计算、存储及操作系统相关技术支持

更新于 2025-10-11深圳
logo of tencent
社招2年以上COS存储技术

1.负责分布式存储相关方向的技术研发以及运营,打造业界领先的超大规模存储系统 ; 2.不断丰富产品功能,提升产品竞争力,满足不同行业客户的业务诉求; 3.持续优化系统服务质量,提升系统性能,降低运营成本,为客户提供稳定可靠的云存储服务。

更新于 2026-06-30北京
logo of tencent
社招5年以上TEG技术

1.负责存储相关技术方向的系统架构设计及技术研发; 2.负责存储相关技术方向的规划、前瞻性探索、影响力建设等综合事务 ; 3.指导并培养相关技术方向团队成员,带领团队不断攻克技术难题,达成既定的业务目标; 4.与周边团队紧密协作,不断提升产品竞争力和用户体验。

更新于 2026-06-12深圳