小鹏汽车RLHF强化学习算法工程师

社招全职3年以上2025-03-04地点：上海 | 深圳状态：招聘

扫码手机上打开

任职要求

1. 具备扎实的机器学习基础和强悍的编码能力，能熟练使用 PyTorch；
2. 3年左右工作经验，在大模型训练和强化学习至少一个方向上有经验；
3. 对人工智能和大模型技术有强烈的兴趣和热情，愿意不断学习和探索新技术。

加分项：
1. 有 ICM…

登录查看完整任职要求

微信扫码，1秒登录

工作职责

我们致力于推动强化学习（Reinforcement Learning, RL）在人形机器人运动控制、大语言模型推理优化、和具身智能体（Embodied AI） 领域的突破性应用。现招募具备深厚RL技术背景的算法工程师，参与从算法设计、仿真训练到真实场景部署的全链路研发，探索AI与物理世界的深度融合。

1. 研究大语言模型RLHF阶段的广义强化算法，提升大模型的能力，探索大模型的自我进化之路；
2. 研究大模型驱动的智能体算法，包括但是不局限于ReACT、Voyager、WebGPT、AutoGPT；
3. 撰写技术报告和论文，分享研究成果，参与内外部的技术交流和合作，推动团队技术水平的提升，提高团队在行业内的影响力。

📮 投递简历 ✨AI模拟面试

难度：

包括英文材料

机器学习+

PyTorch+

大模型+

强化学习+

还有更多 •••

登录查看完整学习资料

相关职位

大模型训练框架研发工程师/专家

社招5-10年引擎

我们是小红书中台大模型 Infra 团队，专注打造领先易用的「AI 大模型全链路基础设施」！团队深耕大模型「数-训-压-推-评」技术闭环，在大模型训练加速、模型压缩、推理优化、部署提效等方向积累了深厚的技术优势，基于 RedAccel 训练引擎、RedSlim 压缩工具、RedServing 推理部署引擎、DirectLLM 大模型 API 服务、QuickSilver 大模型生产部署平台等核心产品，持续赋能社区、商业、交易、安全、数平、研效等多个核心业务，实现 AI 技术高效落地！ 1、参与设计实现支持RLHF/DPO等对齐技术的高效训练框架，优化强化学习阶段的Rollout、Reward Model集成、多阶段训练 Pipline； 2、研发支持多机多卡 RL 的分布式训练框架，开发TP/PP/ZeRO-3与RL流程的动态协同机制，解决 RL 算法在超长时序下的显存/通信瓶刭 3、构建端到端后训练工具链，主导框架与 MLOps 平台集成，提供训练可视化、自动超参搜索等生产级能力 4、与公司各算法部门深度合作，参与大语言模型LLM、多模态大模型 MLLM等业务在 SFT/RL领域的算法探索和引擎迭代； 5、参与分析各业务 GPU 利用率与饱和度等指标，结合业务场景持续优化训练框架能力，提升框架领先性。

更新于 2026-03-28上海|北京

大模型后训练算法工程师/专家

社招引擎

中台稠密引擎组，是小红书负责建设通用深度学习训练推理引擎的团队，面向全公司LLM、多模态LLM、SD、传统CV&NLP等稠密计算型模型训练与推理的业务场景，打造高效、易用、业界领先的训练与推理引擎，为小红书社区、商业化、安全等众多业务方向提供先进的引擎能力，支撑业务持续提升训练推理效率、模型迭代效率与算法研发效率。 1、参与设计和实现深度学习后训练及微调的前沿算法（包括但不限于RFT、RLHF等），以适应多样化的业务场景； 2、结合业务数据和场景，评估选择最适合的微调算法，以支撑业务大语言模型（LLM）微调指标的提升； 3、与数据团队紧密合作，深入理解数据特性，参与设计实现数据提质算法引擎工具，产出高质量数据集提升模型微调效果； 4、与公司内各算法团队深度合作，参与或负责大语言模型、多模态大模型等业务场景的后训练端到端效果提升及落地； 5、密切关注业界 LLM 微调算法和数据提质领域的前沿论文，并整合新技术和算法到训练引擎中，提升框架的领先性；

上海|北京

大语言模型AI搜索Agent算法工程师-Seed

社招A102569

1、深入探索LLM在搜索场景中的推理能力与深度研究（Deep Research）模式，优化信息整合与总结效果，打造高效、精准的智能搜索产品，推动AI技术在实际应用中的突破； 2、AI搜索总结Agent研发： 1）设计并实现基于LLM的搜索总结Agent，提升搜索结果的理解、推理与结构化总结能力； 2）探索LLM Reasoning技术（如思维链、多步推理），优化复杂查询的Deep Research模式，实现长文本理解与跨文档信息融合； 3）构建端到端系统，涵盖意图识别、知识检索、结果生成与偏好对齐，提升用户体验； 3、模型优化及应用： 1）通过指令微调（Instruction Tuning）、偏好对齐（RLHF/DPO）等技术优化模型在搜索场景的适应性； 2）探索多模态信息（文本、代码、结构化数据）融合的搜索与生成技术； 3）研究未来生活中的创新应用场景（如个性化知识助手、自动化研究工具），探索技术边界。

更新于 2025-03-11北京

大语言模型应用算法工程师-豆包大模型

社招1年以上A247041

团队介绍：字节跳动豆包大模型团队成立于 2023 年，致力于开发业界最先进的 AI 大模型技术，成为世界一流的研究团队，为科技和社会发展作出贡献。豆包大模型团队在AI领域拥有长期愿景与决心，研究方向涵盖NLP、CV、语音等，在中国、新加坡、美国等地设有实验室和研究岗位。团队依托平台充足的数据、计算等资源，在相关领域持续投入，已推出自研通用大模型，提供多模态能力，下游支持豆包、扣子、即梦等50+业务，并通过火山引擎开放给企业客户。目前，豆包APP已成为中国市场用户量最大的AIGC应用。 1、团队负责公司大模型的研发和应用，研究相关技术在搜索、推荐、广告、创作、对话和客服等领域的全新应用和解决方案，满足用户不断增长的智能交互需求，全面提升用户在未来世界的生活和交流方式；主要工作方向包括： 1）优化&创新RLHF算法训练效率与模型泛化能力； 2）Long CoT技术的实现和应用； 3）多模态大模型（文本、图像、语音）的Posttraining算法； 4）构建高质量、多领域的数据合成方法； 5）探索LLM在情感对话、创作等场景的应用。

更新于 2025-02-18上海