快手基础平台研发工程师
任职要求
1、1年及以上基础平台建设经验,有大型互联网公司稳定性平台建设经验优先; 2、熟悉Java/Golang/C++中一种或多种编程语言,熟悉各…
工作职责
1、负责快手稳定性平台建设,借助AI技术建设服务链路流量加固、风险识别、故障发现与定位、预案止损等能力,支撑百万规模服务的稳定性; 2、协同业务团队,挖掘稳定性痛点,不断完善稳定性建设标准,并推动相关能力落地与解决; 3、跟进业界先进理论和实践,结合公司实际业务需求,打造业界领先的稳定性保障体系。
阿里巴巴智能信息事业群,聚焦AI在信息服务赛道的创新应用,从工具到服务,持续为用户提供高效、智能的AI应用。智能信息事业群核心产品为夸克、通义、UC浏览器、书旗小说、超级汇川等,以多产品矩阵,覆盖横跨各年龄段的7亿+用户人群,服务超10万+客户。 负责智能信息基础技术平台系统相关研发,包括不限于以下方向: 1、构建高效可靠的云原生容器平台、提出资源优化模型以提升业务资源效率、参与机器学习工程平台的建设和优化,以及运用技术和标准化方案确保平台服务的稳定性和可维护性。 2、负责开发和优化大模型应用开发框架,创造高效的搜索应用解决方案,并深度参与智能信息系统的基础架构与组件开发,以确保技术的高效集成与实际落地。 3、开发和优化搜索引擎,高并发检索、大数据分布式存储及流批计算等系统,深入搜索业务需求设计实现解决方案,不断提高业务性能、系统稳定性,提升系统效率和成本效益。 4、开发和优化推荐引擎、模型预测和向量检索等基础系统,深入参与信息流推荐业务以实现业务需求,同时基于业务洞察设计新平台或改进现有系统,提升系统效率和成本效益。 5、开发和优化实验平台与系统,紧跟AB测试技术前沿,为业务提供精准的实验设计和分析、优化关键指标,并应用算法提高业务参数寻优的效果和效率。 6、具备数理统计基础,在数据科学、数据分析方向有经验者优先。
1. 负责云原生基础设施技术,包括研发面向百万级服务器的应用容器网络、面向AI超算的100G/200G/400G大规模高性能网络及通信基础设施建设,面向电商、AI、大数据等核心互联网应用场景的高性能计算、存储服务器研发、数据中心,以及构建超大规模的基础设施智能化集群管理和运维系统(例如研发运维平台、资源调度、监控报警、AIOPS等技术方向); 2. 负责系统软件研发,包括操作系统/内核、JVM、编译器、Docker/安全容器、ETCD/Zookeeper分布式协调系统、网络&存储虚拟化等技术方向; 3. 负责阿里巴巴中间件产品的研发与维护,包括但不限于服务、消息、缓存、数据库、微服务框架等;负责 AI /高性能计算所需要的高性能分布式通信框架;负责阿里巴巴全局高可用产品的研发与维护,包括但不限于单元化架构、容灾、快恢、演练等;负责不断提升应用运行时的研发效率和分析诊断效率;探索 Serverless、AIGC 等新场景下的解决方案; 4. 负责MySQL、Postgre SQL、MongoDB、Redis、HBase等开源数据库内核的改进,TDDL等分布式数据库中间件研发及大规模集群运维平台建设; 5. 参与大型技术平台的开发和维护,完成从需求到设计、开发和上线等整个项目周期内的工作。
负责云计算和大数据基础技术研发,包括但不限于以下方向: 1. 云原生基础设施技术,包括研发面向百万级服务器的应用容器网络、面向AI超算的100G/200G/400G大规模高性能网络及通信基础设施建设,面向电商、AI、大数据等核心互联网应用场景的高性能计算、存储服务器研发、数据中心,以及构建超大规模的基础设施智能化集群管理和运维系统(例如研发运维平台、资源调度、监控报警、AIOPS等技术方向); 2. 系统软件研发,包括操作系统/内核、JVM、编译器、Docker/安全容器、ETCD/Zookeeper分布式协调系统、网络&存储虚拟化等技术方向; 3. 负责阿里巴巴中间件产品的研发与维护,包括但不限于服务、消息、缓存、数据库、微服务框架等;负责 AI /高性能计算所需要的高性能分布式通信框架;负责阿里巴巴全局高可用产品的研发与维护,包括但不限于单元化架构、容灾、快恢、演练等;负责不断提升应用运行时的研发效率和分析诊断效率;探索 Serverless、AIGC 等新场景下的解决方案; 4. MySQL、Postgre SQL、MongoDB、Redis、HBase等开源数据库内核的改进,TDDL等分布式数据库中间件研发及大规模集群运维平台建设; 5. 参与大型技术平台的开发和维护,完成从需求到设计、开发和上线等整个项目周期内的工作。
负责云计算和大数据基础技术研发,包括但不限于以下方向: 1. 云原生基础设施技术,包括研发面向百万级服务器的应用容器网络、面向AI超算的100G/200G/400G大规模高性能网络及通信基础设施建设,面向电商、AI、大数据等核心互联网应用场景的高性能计算、存储服务器研发、数据中心,以及构建超大规模的基础设施智能化集群管理和运维系统(例如研发运维平台、资源调度、监控报警、AIOPS等技术方向); 2. 系统软件研发,包括操作系统/内核、JVM、编译器、Docker/安全容器、ETCD/Zookeeper分布式协调系统、网络&存储虚拟化等技术方向; 3. 负责阿里巴巴中间件产品的研发与维护,包括但不限于服务、消息、缓存、数据库、微服务框架等;负责 AI /高性能计算所需要的高性能分布式通信框架;负责阿里巴巴全局高可用产品的研发与维护,包括但不限于单元化架构、容灾、快恢、演练等;负责不断提升应用运行时的研发效率和分析诊断效率;探索 Serverless、AIGC 等新场景下的解决方案; 4. MySQL、Postgre SQL、MongoDB、Redis、HBase等开源数据库内核的改进,TDDL等分布式数据库中间件研发及大规模集群运维平台建设; 5. 参与大型技术平台的开发和维护,完成从需求到设计、开发和上线等整个项目周期内的工作。