通义通义实验室-技术专家-SRE运维
任职要求
1、计算机及相关专业,3年以上的SRE/Devops经验,有大型互联网公司运维经验者优先; 2、熟悉常见的公共云服务,熟练使用通用云产品(如VPC、ECS、SLB、RDS等),具备云原生运维经验; 3、深入理解Linux系统原理及运维体系,熟悉分布式系统设计。熟练掌握Kubernetes与Docker架构及技术原理,有大规模生产集群的部署、调优及故障…
工作职责
1、稳定性保障与体系建设:负责大模型服务平台及人工智能产品的稳定性保障工作,通过指标建设、预案设计、容量规划、监控完善、建立SOP等手段提升业务可用性与可靠性; 2、高并发流量治理:主导大规模分布式系统及高并发场景下的流量治理方案设计与实施,包括弹性扩缩容以及熔断、限流、降级等容灾策略,确保业务连续性与鲁棒性; 3、新环境部署:在新环境上进行一整套推理系统及其上下游依赖的部署和运维,负责日常模型的上架、性能监测、中间件和底层基建性能监测等。 4、Oncall与应急响应:参与OnCall值班,快速定位并解决生产环境故障,主导重大事件应急响应与复盘;建立故障快速恢复机制,推动根因分析及长效改进措施落地。 5、运维自动化:优化现有部署、监控及维护流程,推动运维自动化与平台化建设,提升研发效率与系统可观测性。负责监控/日志/网络/存储等原生基础设施的保障和工具开发。
1、负责阿里云容器服务SRE平台建设工作,负责 K8S 生命周期管理,自愈/弹性/限流/驱逐等稳定性能力相关 operator 研发工作,确保集群稳定性SLA达标; 2、负责建立 K8S 配套运维平台,SRE AI Agent 研发,提升运维效率,确保集群运维能力的可持续发展; 3、负责 K8S 集群日常 oncall 体系和能力建设,端到端定位 K8S 集群的功能和性能问题,解决线上问题; 4、牵头跨部门复杂项目(如业务容器化项目),推进业务和技术目标落地。
1. 负责小米汽车相关云平台业务的技术架构设计、模块设计与研发工作; 2. 保证服务安全、高可用性、高扩展性,持续改进系统架构、优化性能,提高服务质量,保障系统稳定、高效运行; 3. 维护、升级和优化现有系统,并能够快速定位并及时修复软件缺陷; 4. 负责项目推进和外部协调沟通达到项目高效高质量快速落地;
核心业务开发:主导携程门票活动业务的后端架构设计与开发,深入业务场景,提升业务支撑能力。 技术攻坚与优化:针对高并发场景进行性能调优,解决系统鲁棒性、一致性及实时性难题;作为技术攻坚核心,持续进行架构迭代与重构。 需求生命周期管理:深入理解业务逻辑,从技术视角评估需求合理性,兼顾扩展性与复用性;保障项目高质量按期交付。 跨团队协作:作为技术接口人,与产品、运营及跨部门团队紧密沟通,协调资源,推动复杂项目落地。 AI工程化实践:积极探索AI Coding工具(如Copilot、Cursor、Claude等)在研发流程中的应用,优化开发效率与代码交付质量。 线上保障:负责线上故障的快速响应与处理,主导流量高峰期的技术支持与压测保障。
滴滴国际化Fintech业务,是滴滴国际化战略的重要组成板块。近年来,滴滴Fintech在拉美地区积极探索和开展电子支付、信贷、信用卡、商户收单等业务,为当地用户带来更便捷、优质、更高性价比的金融服务。我们诚挚邀请真诚、可靠、勇于挑战的您和我们一起,携手并肩,拥抱金融出海的浪潮,和滴滴Fintech一起快速成长。 1. 负责多国金融业务账号体系、统一KYC领域的系统架构设计和研发工作,包括注册登录、鉴权、用户管理、统一账号管理、统一KYC等领域,为研发质量和系统稳定性负责。 2. 有机会主导并深度参与多个0-1、或1-100的关键项目建设,主导系统规划、讨论,共同打造业界领先的支付、金融平台。 3. 有机会学习并理解金融行业知识,了解海外的支付和金融市场,成为有国际化视野的技术专家。 4. base地:上海/杭州/北京