logo of xpeng

小鹏汽车强化学习系统工程师

社招全职地点:深圳 | 上海状态:招聘

任职要求


1. 有机器学习大数据平台的工程架构落地经验,熟练掌握常见的分布式训练、计算框架(pytorch/tensorflow/ray/spark/flink)原理及工程实现,熟悉GPU、大模型相关软硬件技术栈;
2. 有计算产品落地经验(最好是tob paas/saas 项目或公有云项目,深度使用经验也算),对该领域用户画像和用户故事有深入理解,有打造世界级产品的热情;
3. 熟悉NLP、CV相关的算法和技术,熟悉大模型训练、RL算法者优先;
4. 有以下某一方向领域的经验:CUDA,RDMA,AI Infrastructure,HW/SW Co-Design,High Performance Computing,ML Hardware Architecture (GPU, Accelerators, Networking),ML for System,Distributed Storage;
5. 熟悉开源的RL训练框架,例如RL lib、VERL、OpenRLHF等。

工作职责


1. 熟练掌握Linux环境下的Go/Java/Python等1-2种语言;
2. 具备扎实的计算机科学功底和编程能力,熟悉常见算法和数据结构,具有良好的编程习惯;
3. 熟悉至少一种主流的机器学习框架(TensorFlow / PyTorch 或其他自研框架);
4. 熟悉 Kubernetes 架构和生态,熟悉 Docker/Containerd/Kata 等容器技术,有丰富的云原生机器学习系统实践和开发经验;
5. 掌握分布式系统原理,参与过大规模分布式系统的设计、开发和维护,熟悉Ray;
6. 有优秀的逻辑分析能力,能够对业务逻辑进行合理的抽象和拆分;
7. 有强烈的工作责任心,较好的学习、沟通能力和自驱力,能够快速的响应和行动;
8. 有良好的工作文档习惯,及时按要求撰写更新工作流程及技术文档。
包括英文材料
机器学习+
大数据+
PyTorch+
TensorFlow+
Ray+
Spark+
大模型+
PaaS+
SaaS+
NLP+
算法+
强化学习+
CUDA+
相关职位

logo of xiaohongshu
社招后端开发

【职位描述】 1、设计和实现机器学习平台业务系统, 包括工具链/组件等AI基础设施, 落地业务功能需求; 2、高效优化和部署 计算机视觉、语音识别、语音合成、自然语言处理 等业务模型; 3、与公司各算法部门深度合作, 分析业务性能瓶颈和系统架构特征, 软硬件结合优化, 实现极致性能。

logo of mihoyo
社招程序&技术类

1、负责大语言模型的后训练(强化学习)框架研发与优化; 2、与算法团队深度合作,进行算法与系统的联合设计与优化; 3、保持关注行业前沿技术,且有能力和热情开展创新研究。

logo of xpeng
校招

1. 熟练掌握Linux环境下的Go/Java/Python等1-2种语言; 2. 具备扎实的计算机科学功底和编程能力,熟悉常见算法和数据结构,具有良好的编程习惯; 3. 熟悉至少一种主流的机器学习框架(TensorFlow / PyTorch 或其他自研框架); 4. 熟悉 Kubernetes 架构和生态,熟悉 Docker/Containerd/Kata 等容器技术,有丰富的云原生机器学习系统实践和开发经验; 5. 掌握分布式系统原理,参与过大规模分布式系统的设计、开发和维护,熟悉Ray; 6. 有优秀的逻辑分析能力,能够对业务逻辑进行合理的抽象和拆分; 7. 有强烈的工作责任心,较好的学习、沟通能力和自驱力,能够快速的响应和行动; 8. 有良好的工作文档习惯,及时按要求撰写更新工作流程及技术文档。

更新于 2025-04-28
logo of bytedance
社招A197649

1、负责机器学习系统训练架构和产品的设计开发,支持火山方舟大模型平台和机器学习平台的产品业务; 2、负责充分利用各种异构计算(GPU、CPU、其他异构硬件)、存储(各种云存储)、网络(VPC、RDMA)等资源,支持主流的PyTorch、Megatron、TensorFlow等训练框架,支持大规模 LLM 预训练、Finetuning、强化学习等各种训练范式,支持大模型、自动驾驶、生信计算等各种业务场景下算法需求; 3、负责训练系统的产品化落地,打造算法工程师友好的、体验一流的公有云训练平台。

更新于 2024-06-28