阿里云阿里云智能-网络服务化平台Java研发专家-北京/杭州
任职要求
1. 5年以上IT、互联网、云计算开发相关工作经验; 2. 熟悉Java,Python,Golang等一种或多种编程语言/框架,熟悉分布式开发常用核心技术,有大型分布式、高并发系统开…
工作职责
负责阿里云全球网络的服务化平台研发,包括但不限于平台开发、模型/算法构建、海量数据分析处理等。 具体岗位职责: 1. 负责阿里全球网络的数据分析、网络优化、资源规划等自动化和智能化系统研发,包括但不限于面向稳定性保障、质量优化和成本经营的算法、模型和平台研发; 2. 负责阿里全球网络的质量探测与保障、流量采集与分析、Qos管控、计量计费等系统设计研发; 3. 负责阿里全球网络的服务化系统设计和研发,基于自动化流程与AI大模型,为阿里云上层产品及用户提供自动化、智能化的网络的服务。
1、负责公司网络基础服务体系的日常运维、故障处理、变更发布与稳定性保障,独立承接专项工作与模块落地,可直接负责某一技术方向的全流程实施工作; 2、负责核心网络服务(LVS、DNS、NAT、基础网络)的日常运维、容量规划、风险治理,持续优化网络链路与服务质量,保障业务高可用; 3、基于业务流量、网络架构现状,具备一定的技术规划与演进优化能力,能够发现架构短板、输出优化方案、推动服务迭代升级; 4、沉淀运维标准化、自动化能力,梳理故障案例、优化变更流程,降低网络基础服务故障率与运维成本; 5、主动探索 AI 提效落地方式,利用 AI 工具提升故障分析、脚本开发、日志分析、方案输出、问题排查等运维工作效率。
1.负责新零售业务门店/仓库网络的日常运维、故障处理、应急响应,保障网络及相关业务的稳定运行,有能力处理突发事件、对疑难问题进行跟踪并最终解决。 2.负责新零售业务门店/仓库网络的开仓建设,对涉及到系统架构中存在的网络设计提出解决方案,与其他协同团队一起完成重点项目的实施、配置等服务交付。 3.负责新零售业务门店/仓库网络的质量监控及用户体验收集,监控告警、运维自动化平台的持续性建设及功能优化,不断提高网络质量。 4.参与自动化工具开发,对网络基础信息、资产、故障率、可用性、容量性能、成本等数据的运营和分析,提升网络稳定性和运维效率。 5.参与对新零售网络相关技术、产品与工具、行业最佳实践进行研究、测试及运用,有探索和实践精神,满足业务发展需求。 6.在日常运维过程中为一线服务团队提供标准、流程规范和指导文档。
1. 应急响应与故障管理:提供7×24小时网络运维支持,主导工厂网络故障的快速定位与恢复,制定并维护应急预案;建立网络健康度评估体系,推动重大事故的根因分析与预防机制建设; 2. 安全架构全生命周期管理:规划、部署及持续优化企业级网络安全架构,主导防火墙策略的制定、交付与治理闭环;每季度开展网络架构风险评估,输出加固方案及落地验证报告; 3. 智能运维体系构建:基于Python或Ansible等工具开发自动化脚本,实现网络设备的批量配置与策略下发;搭建网络流量回溯分析系统,通过Wireshark、tcpdump等工具实现故障分钟级定位; 4. 安全攻防与合规管理:执行网络设备安全基线配置,主导漏洞扫描、渗透测试及安全加固的完整闭环;构建网络风险量化评估模型,制定防御策略并推动跨部门协同落地; 5. 运维平台集成与优化:主导CMDB网络资产数字化管理,通过ITSM平台实现网络变更的标准化流程管控;基于SolarWinds或Zabbix构建可视化监控体系,实现网络性能指标的实时告警与趋势预测。
1. 混合云网络规划与建设:主导公司混合云网络(含公有云与私有云)的规划设计、建设与演进,确保满足高可用性SLA要求; 2. 骨干网络规划与集成管理:负责集团公司骨干网络的规划、运维管理与集成工作,支持各级单位网络改造项目的方案编写、实施交付与演进支持; 3. 日常运维与故障闭环:主导公司混合云网络、数据中心(含贵安数据中心)及局域网的日常运维、故障分析、定位、处理及性能优化,输出故障报告与应急保障流程; 4. 网络架构标准制定与技术落地:制定网络架构相关标准方案,协同云厂商(如AWS、阿里云)推动技术落地,参与公司网络及其他相关项目,提供架构指导与决策支持; 5. 技术文档与优化报告输出:负责网络优化报告编写、技术文档管理及领导交办的其他工作事项。