
Momenta端到端决策规划算法工程师(Mstar)
任职要求
1、计算机、人工智能等相关专业硕士/博士应届毕业生;
2、必须具备Flow Matching相关经验;
3、深入理解后训练核心范式,对以下概念有实质性认知:
- On-Policy Vs Off-policy采样的本质区别
- Dense vs Sparse Reward对训练效果与收敛的影响
4、在以下至少一个方向有研究或工程实践经验:
- RL后训练(PPO、GRPO、RLHF 等)
- On-policy/Sequence-level蒸馏(GKD、MiniLLM、DAGGER 相关方…工作职责
1、面向端到端自动驾驶大模型,研究并落地RL、On-policy Distillation等后训练范式,提升模型在复杂驾驶场景下的决策质量与泛化能力; 2、结合Momenta海量量产真实路测数据,设计数据闭环驱动的后训练策略,加速模型在长尾驾驶场景中的能力提升; 3、对比和融合SFT、RL、On-policy Distillation等范式,针对驾驶决策任务的特殊性设计最优后训练方案; 4、结合分布式训练框架优化后训练系统效率,推动模型从研究到量产的快速迭代; 5、追踪并复现LLM、端到端自动驾驶领域最新研究成果。
1、负责统一语音多模态大模型的设计、训练、优化,涵盖语音识别、语音合成、语音理解、文本-语音融合、跨模态检索与生成等方向; 2、推动语音与其他模态(文本、图像等)在统一建模框架下的深度融合,提升模型的理解、生成与交互能力; 3、跟踪并研究前沿的多模态学习方法,包括但不限于Transformer、对比学习、扩散模型、自监督学习、强化学习等; 4、参与大规模数据预处理、模型训练与推理优化,推动模型在实际场景中的高效部署; 5、与产品、工程团队紧密协作,将研究成果应用于智能助手、虚拟人、智能硬件、会议记录等业务场景。

1、负责/参与端到端自动驾驶模型的性能迭代与突破,通过数据和模型的优化迭代,推动模型在量产产品中的效果闭环; 2、深度搭建并优化数据挖掘与数据闭环链路,基于量产场景的真实数据分布,设计高效的数据筛选、清洗、标注、回流策略,通过数据驱动的方法持续提升模型在长尾场景、极端工况下的鲁棒性与可靠性,要求具备量产项目中数据驱动性能提升的实战落地经验; 3、负责/参与合成数据相关工作,聚焦长尾场景数据补充,通过合成数据与真实数据的协同应用,实现模型在长尾场景下的性能显著提升,要求具备合成数据落地应用的实战经验; 4、构建并迭代端到端模型评测体系,结合仿真测试、实车验证等多维度手段,建立科学的性能评估指标与自动化评测流程,能通过评测结果精准定位模型短板,并主导评测系统的优化升级,为模型迭代提供核心决策依据; 5、具备模型训练相关经验者优先(包括大规模数据训练、分布式训练、训练框架应用等场景经验); 6、传统决策规划算法领域的优秀人才优先考虑; 7、紧跟业界前沿技术动态,重点研究自动驾驶领域最先进的数据闭环方案、评测方法与端到端模型应用,推动技术预研与工程化落地,保持团队在数据驱动与评测体系上的核心竞争力。