logo of antgroup

蚂蚁金服蚂蚁集团-基础设施高可用工程师-杭州

社招全职2年以上技术-SRE地点:杭州状态:招聘

任职要求


我们欢迎两类背景的候选人:
1、基础设施领域研发,想转向稳定性架构方向
如果你正在做中间件/容器/网络/存储等基础设施的研发,在研发过程中深度参与过故障应急、稳定性治理,并且对"从架构层面系统性解决稳定性问题"这个方向有强烈兴趣——我们非常欢迎你。你不需要有完整的SRE经验,技术深度和稳定性方向的热情是最重要的。
2、已有基础设施SRE经验,想在大规模场景下做更有挑战的事
如果你已经在存储、数据库、大数据、网络、中间件或容器等基础设施领域做过SRE,有独立处理线上故障的经验,想在千万级日请求的规模下验证和提升自己的架构能力——这里有足够大的舞台。
我们希望你具备:
● 至少一个基础设施领域的深度技术经验(中间件/容器/网络/存储/数据库/大数据中选一),能讲清底层实现原理,而非停留在方案层面。我们更看重你在某个领域的深度,而非面面俱到。
● 大规模系统经验:参与过百节点以上规模的系统建设或运维,对大规模分布式系…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


● 守护蚂蚁全球级基础设施的稳定性:负责蚂蚁全站数百万级容器规模、数百亿次调用的基础设施服务可靠性和稳定性,覆盖服务注册中心、配置中心、限流中心、消息中心、任务调度、分布式事务、MOSN/Layotto、七层网关、HCS、DNS、NTP等核心组件。
● 从架构层面设计高可用能力:这不是传统的"被动运维"角色。你将参与产品的稳定性架构设计,主导SLA体系建设、容灾多活方案规划、混沌工程、变更防御、自愈容灾等高可用能力的设计与落地,而不仅仅是执行日常运维。
● 用技术手段解决规模化难题:深入理解基础设施产品和架构,结合业务场景对生产问题进行根因诊断和持续优化;帮助业务应用在可用性、成本、效率上做好合适的架构选型。
● 推动前沿技术大规模落地:设计并落地Service Mesh、Serverless、FaaS等在蚂蚁数百万容器场景下的接入、部署和升级方案,构建平台化能力体系化识别和管控风险。
● 探索AI驱动的智能运维:结合大模型探索AI Agent在稳定性保障中的落地实践,引领中间件产品的稳定性保障模式向数字化、智能化方向演进。
包括英文材料
中间件+
稳定性治理+
大数据+
分布式系统+
Java+
Go+
Python+
高可用+
系统设计+
还有更多 •••
相关职位

logo of antgroup
社招2年以上技术-SRE

● 负责蚂蚁全站数百万级容器规模、数百亿次调用的中间件服务可靠性和稳定性工作,包括但不限于服务注册中心、配置中心、限流中心、消息中心、任务调度、分布式事务、MOSN/Layotto,设计并实施SLA体系、监控、定位应急、容量管理、自愈容灾等高可用能力,确保中间件服务和上游业务的持续可用 ● 深入理解中间件产品和架构,结合业务场景对生产问题进行诊断和持续优化;参与中间件产品的稳定性架构设计和改进,帮助业务应用在可用性、成本、效率上做好合适的架构选型。 ● 设计并落地Service Mesh、Serverless、FaaS等在蚂蚁数百万容器的大规模场景下的接入、部署和升级方案,构建平台化能力体系化识别和管控业务风险 ● 结合AI探索大模型落地实践,引领中间件产品的稳定性保障模式向数字化、智能化方向演进。

更新于 2026-06-29杭州
logo of antgroup
社招5年以上技术-开发

1.负责蚂蚁数据库以及计算、存储基础设施PaaS平台研发,打造顶尖的自动化/智能化/Self-Driving的数据库PaaS平台产品。 2.负责蚂蚁数据库以及数据基础设施的高可用平台产品研发,大规模场景下的安全变更管控、超大规模下的极致弹性能力建设、无人值守化容灾能力建设,异常检测、根因定位、故障自愈能力建设。 3.负责蚂蚁数据库以及计算、存储产品的混合云架构,及产品研发。

更新于 2025-12-12杭州
logo of alibaba
社招3年以上技术类-开发

构建面向大规模AI集群的GPU微架构采集、性能剖析与优化决策系统,建设集群的性能分析、瓶颈定位、故障诊断等核心能力。 1. 针对NVIDIA、AMD、国产GPGPU等多厂商芯片,设计并实现规模化、无侵入的kernel级采集工具链和微架构指标体系; 2. 构建AI continuous profiling系统,将GPU kernel数据与算子执行、框架调度、通信原语、CPU性能、高性能通信性能相关联,为全栈性能优化提供量化的性能瓶颈数据和画像系统; 3. 结合理论 Roofline 分析与 simulation 方法,融合线上 profiling 数据,建设集群范围的软硬件配合与关键性能瓶颈分析体系,支撑AI训练与推理典型负载下的系统级优化; 4. 跟踪主流GPU架构演进,参与AI基础设施规划与设计,结合生产应用画像,支撑多元GPU/AI ASIC芯片的适配与优化,构建异构硬件性能的全链路量化分析模型,面向scale-up等未来AI硬件架构演进,建立硬件性能建模与TCO评估能力,形成数据驱动的决策支撑。

更新于 2026-06-16杭州
logo of alibaba
社招3年以上技术-基础平台

负责集团多种大模型的基础训推性能优化,聚焦异构GPU的高性能算子库、通信库的开发和优化,提升计算、通信的并行效率,设计并实现高效的并行计算策略、分布式推理方案等。面向集团多变的大模型训推场景,提炼核心的优化方法,探索通用的编译优化方案,跟进前沿技术,并将优化能力集成到自研/开源大模型推理/训练框架/编译器,推动优化方案在实际业务场景中的落地,持续创新构建业界领先的AI Infra。

更新于 2026-06-11北京|杭州