快手存储SRE工程师
任职要求
1、对Linux操作系统有深入的理解,至少精通Shell/Python/perl/php/go语言中的一种; 2、了解文件系统基本运行原理; 3、了解基础网络架构,了解服务器、网络硬件相关知识; 4、熟练使用排查工具,包括不限于sar,sed,awk…
工作职责
1、负责快手超大规模分布式存储,包括文件存储、对象存储、块存储等分布式存储系统的日常维护,保障服务高可用和高可靠性; 2、管理大规模存储引擎资源,从资源的申请、交付、使用、治理的全流程运营,保障资源运行效率以及控制容量风险; 3、建设大规模存储系统运维平台和工具,保障数万规模存储系统操作效率以及操作质量; 4、负责服务的监控报警、巡检管理,为线上的稳定性负责。
1. 面向业务和数据库/存储产品构建连续性策略,为集团内部及外部客户提供行业绝对领先的数据库/存储可靠性技术服务。围绕业务持续安全、可用目标,构建多端智能预警、根因定位、动线分析、资金安全保障、自愈、降级、限流、智能运维能力,协同&推动数据库/存储全局架构演进,进行前瞻性的数据库/存储稳定性设计与规划,为全集团业务持续稳定运行负责。 2. 面向全站数据库/存储基础架构,构建站点容灾、建站、弹性等全局技术架构,保障各站点稳定运行,提升业务可用率;识别数据库/存储业务发展过程中的效能&成本问题,结合AI与智能化技术,进行工程效率提升,降低流量成本与算力成本,改进工程交付效率与质量。 3. 围绕各业务大促活动,提供高性能、高可用、资金安全的常态数据库/存储活动保障方案,构建灵活弹性的容量调度策略,为各头部电商平台提供峰值秒杀技术能力与容量服务。 4. 构建数据库/存储高可用平台体系、基础设施的开发和建设,追求100%的服务持续可用、秒级故障恢复能力;数据库/存储成本优化,通过新技术、新产品、新方案全方位地优化系统性能;构架数据库/存储新技术的探索及落地,如存算分离/AIOPS/Agent等。
1.主导DRAM电性失效分析及电路原理拆解,提供技术性指导,推动失效根因定位与闭环; 2.掌握DRAM测试pattern sequence原理及模拟验证方法,并能对团队进行技术性指导。
1.负责 DRAM失效分析,并提供针对性的测试方案; 2.熟悉ADVANTEST机台 Memory测试,制定和优化测试方案并分析测试数据; 3.从质量和成本角度,优化测试策略。
1.负责公司 IT 基础架构存储相关日常健康巡检、容量水位监控、硬件置换及版本生命周期、管理体系的规划及落地 2.主导存储 API/CLI 工具链的对接,负责对象存储桶创建/权限策略/生命周期、块存储创建映射、文件存储的权限管理 3.响应业务侧针对各类存储的精细化需求,具备优秀的沟通协作能力 4.负责存储与虚拟化对接场景,确保虚拟机迁移及高可用场景下的存储链路稳定性 5.负责梳理并加固文件共享目录权限治理 6.制定并演练各品牌存储的灾备切换与数据恢复预案,独立主导存储集群的故障根因分析 7.作为技术接口人对接存储原厂或代理商售后,把控服务 SLA 审核、技术方案评审及重大变更的风险评估,逐步将黑盒交付转化为内部知识库文档,降低外部依赖