logo of momenta

Momenta端到端决策规划算法工程师(Mstar)

校招全职地点:北京 | 上海 | 苏州状态:招聘

任职要求


1、计算机、人工智能等相关专业硕士/博士应届毕业生;
2、必须具备Flow Matching相关经验;
3、深入理解后训练核心范式,对以下概念有实质性认知:
- On-Policy Vs Off-policy采样的本质区别
- Dense vs Sparse Reward对训练效果与收敛的影响
4、在以下至少一个方向有研究或工程实践经验:
- RL后训练(PPO、GRPO、RLHF 等)
- On-policy/Sequence-level蒸馏(GKD、MiniLLM、DAGGER 相关方…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1、面向端到端自动驾驶大模型,研究并落地RL、On-policy Distillation等后训练范式,提升模型在复杂驾驶场景下的决策质量与泛化能力;
2、结合Momenta海量量产真实路测数据,设计数据闭环驱动的后训练策略,加速模型在长尾驾驶场景中的能力提升;
3、对比和融合SFT、RL、On-policy Distillation等范式,针对驾驶决策任务的特殊性设计最优后训练方案;
4、结合分布式训练框架优化后训练系统效率,推动模型从研究到量产的快速迭代;
5、追踪并复现LLM、端到端自动驾驶领域最新研究成果。
包括英文材料
RLHF+
Megatron+
NeurIPS+
还有更多 •••
相关职位

logo of momenta
实习研发

1、负责端到端决策规划算法的开发和迭代; 2、负责训练数据与评测数据的日常挖掘与维护; 3、负责端到端智驾大模型方案的研发迭代体系的建设与完善。

更新于 2025-12-22北京
logo of alibaba
实习阿里巴巴2027

1、负责统一语音多模态大模型的设计、训练、优化,涵盖语音识别、语音合成、语音理解、文本-语音融合、跨模态检索与生成等方向; 2、推动语音与其他模态(文本、图像等)在统一建模框架下的深度融合,提升模型的理解、生成与交互能力; 3、跟踪并研究前沿的多模态学习方法,包括但不限于Transformer、对比学习、扩散模型、自监督学习、强化学习等; 4、参与大规模数据预处理、模型训练与推理优化,推动模型在实际场景中的高效部署; 5、与产品、工程团队紧密协作,将研究成果应用于智能助手、虚拟人、智能硬件、会议记录等业务场景。

更新于 2026-03-17北京|杭州|上海
logo of horizon
社招算法序列

1、负责/参与端到端自动驾驶模型的性能迭代与突破,通过数据和模型的优化迭代,推动模型在量产产品中的效果闭环; 2、深度搭建并优化数据挖掘与数据闭环链路,基于量产场景的真实数据分布,设计高效的数据筛选、清洗、标注、回流策略,通过数据驱动的方法持续提升模型在长尾场景、极端工况下的鲁棒性与可靠性,要求具备量产项目中数据驱动性能提升的实战落地经验; 3、负责/参与合成数据相关工作,聚焦长尾场景数据补充,通过合成数据与真实数据的协同应用,实现模型在长尾场景下的性能显著提升,要求具备合成数据落地应用的实战经验; 4、构建并迭代端到端模型评测体系,结合仿真测试、实车验证等多维度手段,建立科学的性能评估指标与自动化评测流程,能通过评测结果精准定位模型短板,并主导评测系统的优化升级,为模型迭代提供核心决策依据; 5、具备模型训练相关经验者优先(包括大规模数据训练、分布式训练、训练框架应用等场景经验); 6、传统决策规划算法领域的优秀人才优先考虑; 7、紧跟业界前沿技术动态,重点研究自动驾驶领域最先进的数据闭环方案、评测方法与端到端模型应用,推动技术预研与工程化落地,保持团队在数据驱动与评测体系上的核心竞争力。

更新于 2026-01-22北京|上海
logo of momenta
社招算法

1. 端到端模型研发: 负责新一代 End-to-End 自动驾驶算法的泊车场景的研发,包括但不限于基于 World Model(世界模型)、Video Generation(视频生成) 或 VLM(视觉语言模型) 的驾驶策略生成。 2. 数据闭环与评测: 搭建针对生成式规划算法的自动化评测体系,利用大模型进行数据挖掘、自动标注(Auto-labeling)及场景重建,通过数据闭环持续提升模型性能。

更新于 2026-07-06北京|广州|深圳