阿里云阿里云智能-云存储运维系统研发专家-杭州/上海
社招全职5年以上云智能集团地点:杭州 | 上海状态:招聘
任职要求
1、熟悉软件开发和系统架构,熟练掌握至少一门编程语言,C++、java、python、go; 2、五年以上云计算、存储运维系统相关的工作经验。熟悉云存储文件存储(NAS)、对象存储(OSS)等产品的核心架构,了解分布式存储系统的设计,能根据产品特性设计针对性的运维流程如部署升级、故障自愈等; 3、有大规模分布式系统监控架构设计经验,包括日志,监控,…
登录查看完整任职要求
微信扫码,1秒登录
工作职责
1、负责运维管控系统子模块设计和研发工作,如部署升级系统、根因分析系统、监控告警体系、故障自愈系统等; 2、负责可观测性平台系统的设计和研发工作,提升服务质量和系统的可观测能力; 3、制定交付标准和运维规范,通过自动化的方式,提升系统运行的效率及稳定性。
包括英文材料
C+++
https://www.learncpp.com/
LearnCpp.com is a free website devoted to teaching you how to program in modern C++.
https://www.youtube.com/watch?v=ZzaPdXTrSb8
Java+
https://www.youtube.com/watch?v=eIrMbAQSU34
Master Java – a must-have language for software development, Android apps, and more! ☕️ This beginner-friendly course takes you from basics to real coding skills.
Python+
https://liaoxuefeng.com/books/python/introduction/index.html
中文,免费,零起点,完整示例,基于最新的Python 3版本。
https://www.learnpython.org/
a free interactive Python tutorial for people who want to learn Python, fast.
https://www.youtube.com/watch?v=K5KVEU3aaeQ
Master Python from scratch 🚀 No fluff—just clear, practical coding skills to kickstart your journey!
https://www.youtube.com/watch?v=rfscVS0vtbw
This course will give you a full introduction into all of the core concepts in python.
Go+
https://www.youtube.com/watch?v=8uiZC0l4Ajw
学习Golang的完整教程!从开始到结束不到一个小时,包括如何在Go中构建API的完整演示。没有多余的内容,只有你需要知道的知识。
分布式系统+
https://www.distributedsystemscourse.com/
The home page of a free online class in distributed systems.
https://www.youtube.com/watch?v=7VbL89mKK3M&list=PLOE1GTZ5ouRPbpTnrZ3Wqjamfwn_Q5Y9A
系统设计+
https://roadmap.sh/system-design
Everything you need to know about designing large scale systems.
https://www.youtube.com/watch?v=F2FmTdLtb_4
This complete system design tutorial covers scalability, reliability, data handling, and high-level architecture with clear explanations, real-world examples, and practical strategies.
还有更多 •••
相关职位
社招5年以上云智能集团
1. 负责面向高持久性、高可用、高性能的云上块存储服务 EBS 的先进支撑底座系统的设计与开发,支撑千万级云盘实例、日均百万亿级别 I/O 请求的分布式存储系统,持续增强其可观测性、可诊断性与可运维性; 2. 构建面向高性能分布式存储的智能可观测体系,在传统监控与诊断基础上融合 AI 异常检测与诊断能力,实现故障的早期预警与精准定界; 3. 建设故障快速恢复与预防体系,通过平台工程策略与 AI 智能决策,实现故障的分钟级恢复乃至主动预防,持续降低系统 MTTR; 4. 设计覆盖全链路的稳定性技术体系,制定面向高持久性、高可用、高性能复杂场景的稳定性保障策略与标准; 5. 长期追踪工业界与学术界前沿技术(如面向时序数据的基础大模型、先进混沌工程实践等),主导技术预研与规模化落地,驱动团队技术持续演进。
更新于 2025-11-20杭州
社招5年以上技术-运维
● 负责云上网络架构设计、优化及故障排查,管理云上网络资源,确保网络高可用性,提升运维效率 ● 负责设计并实施网络访问控制策略,保障业务系统安全访问 ● 负责阿里云ECS实例、容器服务(ACK)、存储服务(OSS、块存储、文件存储)的日常运维与优化 ● 参与多活数据中心规划,支持业务全球部署与灾备需求 ● 管理云上计算资源调度与优化,确保高可用性与资源利用率。 ● 优化操作系统性能,处理系统级问题,提升系统稳定性 ● 为业务部门提供网络、计算、存储及操作系统相关技术支持
更新于 2025-10-11深圳
社招2年以上COS存储技术
1.负责分布式存储相关方向的技术研发以及运营,打造业界领先的超大规模存储系统 ; 2.不断丰富产品功能,提升产品竞争力,满足不同行业客户的业务诉求; 3.持续优化系统服务质量,提升系统性能,降低运营成本,为客户提供稳定可靠的云存储服务。
更新于 2026-06-30北京