滴滴专家工程师-稳定性(J250605024)
任职要求
任职要求 1. 全日制本科及以上,计算机相关专业;3年及以上互联网后端/业务研发经验,熟练掌握Go/Java/PHP任一语言,编程功底扎实。 2.熟悉Linux环境、Shell编程、主流网络协议,了解分布式系统、微服务、容器化技术,掌握MySQL、Redis等常用中间件及SQ…
工作职责
部门介绍 我们是滴滴网约车-稳定性团队,负责网约车整体服务稳定性,建设稳定性技术体系、打造高可用系统,为业务稳健发展提供保障。当前正将AI能力深度融入稳定性工程(智能监控、容量预测等),构建下一代智能化稳定性保障体系,诚邀加入共建出行领域“智能+稳定”技术基石! 职位描述 1.主导构建与演进网约车核心业务稳定性保障体系及全链路稳定性平台,覆盖风险度量、监控报警、故障应急等核心场景。 2.结合大模型技术,打造AIOps工具链(故障预警、根因分析、智能压测等),支撑业务高可用。 3.定义SLA/SLO/SLI指标体系,构建风险巡检引擎,推动风险治理与可用性提升。 4.研发稳定性相关基础组件与工具,探索LLM/Agent在稳定性治理场景的应用,赋能业务研发提效。 5.落地故障应急机制与On-call文化,将排障流程自动化,构建“AI提效”的工程文化。
1. 稳定性体系规划与落地(质量侧): 负责业务线整体生产安全与稳定性保障体系的建设。作为质量侧代表,与 SRE、业务研发团队紧密协同,制定并落地高可用架构标准。 从业务视角出发,定义稳定性衡量标准(SLA/SLO),并推动技术团队达成稳定性指标(如降低故障率、缩短 MTTR)。 2. 红蓝对抗与全链路演练(质量侧): 主导或参与常态化的红蓝对抗演练。负责设计高复杂度的业务故障场景(蓝军视角/导演视角),验证系统的容灾能力和团队的应急响应能力。 协同 SRE 建设故障注入平台,推动“以演代战”,确保应急预案的有效性和自动化执行率。 3. 变更风险管控: 建立严格的变更管控机制(发布红线、灰度策略、回滚机制)。 建设“变更防御”能力,利用自动化手段拦截高风险代码和配置进入生产环境,治理因变更导致的稳定性问题。 4. 线上巡检与业务核对(BCP): 建设分钟级的业务一致性核对系统,确保在系统未报错但业务逻辑异常(如资金损失、数据不一致)时能快速发现。 补齐监控盲区:不仅关注系统监控(CPU/内存等),更要补齐业务监控盲区。
1. 参与网约车C端乘客业务的架构演进,如负责对网约车C端业务进行架构分析、建模、推进落地的工作,覆盖网约车首页、预估、交易、履约等核心流程,以及稳定性建设等工作; 2. 负责对核心、复杂业务系统进行抽象优化设计,如搭建高扩展性的业务平台,确保技术方案的合理性、前瞻性与可扩展性,推进领域服务的拆分和建设落地,提升系统性能和研发效率,并推动技术创新以适应业务的长期发展。 岗位亮点: 涉及网约车核心战略业务,主要是C端业务,场景复杂,系统复杂度高,涉及上下游全链路流程;
1、稳定性保障与体系建设:负责大模型服务平台及人工智能产品的稳定性保障工作,通过指标建设、预案设计、容量规划、监控完善、建立SOP等手段提升业务可用性与可靠性。 2、高并发流量治理:主导大规模分布式系统及高并发场景下的流量治理方案设计与实施,包括弹性扩缩容以及熔断、限流、降级等容灾策略,确保业务连续性与鲁棒性。 3、新环境部署:在新环境上进行一整套推理系统及其上下游依赖的部署和运维,负责日常模型的上架、性能监测、中间件和底层基建性能监测等。 4、Oncall与应急响应:参与OnCall值班,快速定位并解决生产环境故障,主导重大事件应急响应与复盘;建立故障快速恢复机制,推动根因分析及长效改进措施落地。 5、运维自动化:优化现有部署、监控及维护流程,推动运维自动化与平台化建设,提升研发效率与系统可观测性。负责监控/日志/网络/存储等原生基础设施的保障和工具开发。

1、稳定性保障与体系建设:负责大模型服务平台及人工智能产品的稳定性保障工作,通过指标建设、预案设计、容量规划、监控完善、建立SOP等手段提升业务可用性与可靠性。 2、高并发流量治理:主导大规模分布式系统及高并发场景下的流量治理方案设计与实施,包括弹性扩缩容以及熔断、限流、降级等容灾策略,确保业务连续性与鲁棒性。 3、新环境部署:在新环境上进行一整套推理系统及其上下游依赖的部署和运维,负责日常模型的上架、性能监测、中间件和底层基建性能监测等。 4、Oncall与应急响应:参与OnCall值班,快速定位并解决生产环境故障,主导重大事件应急响应与复盘;建立故障快速恢复机制,推动根因分析及长效改进措施落地。 5、运维自动化:优化现有部署、监控及维护流程,推动运维自动化与平台化建设,提升研发效率与系统可观测性。负责监控/日志/网络/存储等原生基础设施的保障和工具开发。