字节跳动AI基础设施架构师/高级AI基础设施研究员-基础架构
任职要求
1、计算机科学、工程或相关技术领域的硕士及以上学位; 2、5年以上基础设施或系统工程工作经验,至少2年专注于ML/AI基础设施方向; 3、熟练使用Python、C++、Go或Rust等任一编程语言。
工作职责
1、领导可扩展、可靠的AI基础设施(AI加速器、计算集群、存储、网络)的端到端设计,用于Training和Inference大模型工作负载; 2、定义并实现面向服务的容器化架构(Kubernetes、VM框架、Unikernels),优化ML性能和安全性; 3、分析和优化ML堆栈的每一层ML编译器、GPU/TPU调度、NCCL/RDMA网络、数据预处理和训练/推理框架,开发低开销Metrics和基准测试框架,以识别和消除分布式训练和Inference中的瓶颈; 4、构建和运营跨多个数据中心(本地和云)自动扩展的大规模部署和编排调度系统,通过智能资源管理和工作负载放置来支持容错、高可用性和成本效益; 5、为PB级大模型数据集量身定制强大的ETL和数据摄取管道(Spark/Beam/Dask/Flume),集成实验管理和工作流编排工具(Airflow、Kubeflow、Metaflow)以简化研究到生产的过程; 6、与机器学习研究人员合作,将原型需求转化为生产级系统,指导工程师在性能调整、系统设计和可靠性工程方面的最佳实践。
1. 负责百炼专属版大模型AI Infra产品定义、设计及商业化落地; 2. 制定产品策略以及商业策略,以业务成功为导向,协同研发工程师,售前架构师, 产品运营等多角色共同努力达成业务目标; 3. 深刻理解客户业务和场景需求,追踪行业发展趋势及技术发展动态,规划产品演进路径及迭代,保持具有持续产品力竞争优势; 4. 追踪标杆客户,确保技术可行性,以及对产品演进的持续反馈,沉淀最佳实践,标杆项目案例; 5. 收集客户需求,结合技术理解和研判,推动产品功能升级迭代,提升产品市场竞争力和市场占有率。
我们是小红书中台大模型 Infra 团队,专注打造领先易用的「AI 大模型全链路基础设施」!团队深耕大模型「数-训-压-推-评」技术闭环,在大模型训练加速、模型压缩、推理优化、部署提效等方向积累了深厚的技术优势,基于 RedAccel 训练引擎、RedSlim 压缩工具、RedServing 推理部署引擎、DirectLLM 大模型 API 服务、QuickSilver 大模型生产部署平台等核心产品,持续赋能社区、商业、交易、安全、数平、研效等多个核心业务,实现 AI 技术高效落地! 1、负责大模型平台的架构设计和核心功能研发,构建云原生架构,设计高可用、高性能的微服务体系; 2、负责构建面向大模型全流程的DevOps,与下游云原生平台深度融合,支撑大模型在公司内各业务生产链路稳定高效地落地; 3、负责万卡规模GPU集群效能分析及优化,通过调度策略优化、在离线混部、GPU虚拟化、存储&网络加速等手段,提升GPU集群使用效率; 4、将平台和框架结合,通过任务调度、弹性容灾、性能优化等措施端到端提升AI生产效率,涉及k8s/kubeflow、网络通信、分布式训练等; 5、优化各AI平台性能,提升系统稳定性和可扩展性,保障大规模并发场景下的服务质量与用户体验; 6、持续研究分析业内创新AI平台产品,优化技术方案,改进产品功能,提升创新能力与产品体验。
阿里巴巴自研的应用网络系统,已广泛应用于阿里集团应用、阿里云通用计算和AI智算产品,承载着海量的实时数据,实现了百万数量级应用节点的超大集群规模。 1、负责阿里巴巴智算网络中的容器网络、管控系统在多个场景中的需求分析,深入理解阿里集团和阿里云产品的业务部署模式,支撑应用和产品的网络演进; 2、负责阿里巴巴网络解决方案设计和交付,从业务场景出发,围绕云原生业务需求和基础设施环境,打造极致性能、部署灵活的应用网络系统; 3、参与阿里巴巴云原生的网络的技术创新和探索,与公司内外专家合作,不断提升品牌价值。