
Momenta端到端大模型算法工程师(Mstar)
校招全职地点:北京 | 上海 | 深圳 | 苏州状态:招聘
工作描述
任职要求
1、计算机、人工智能等相关专业硕士/博士应届毕业生;
2、必须具备Flow Matching相关经验;
3、深入理解后训练核心范式,对以下概念有实质性认知:
- On-Policy Vs Off-policy采样的本质区别
- Dense vs Sparse Reward对训练效果与收敛的影响
4、在以下至少一个方向有研究或工程实践经验:
- RL后训练(PPO、GRPO、RLHF 等)
- On-policy/Sequence-level蒸馏(GKD、MiniLLM、DAGGER 相关方法)
…登录查看完整工作描述
微信扫码,1秒登录
包括英文材料
RLHF+
[英文] What is RLHF?
https://aws.amazon.com/what-is/reinforcement-learning-from-human-feedback/
Reinforcement learning from human feedback (RLHF) is a machine learning (ML) technique that uses human feedback to optimize ML models to self-learn more efficiently.
https://www.ibm.com/think/topics/rlhf
Reinforcement learning from human feedback (RLHF) is a machine learning technique in which a “reward model” is trained with direct human feedback, then used to optimize the performance of an artificial intelligence agent through reinforcement learning.
Megatron+
https://www.youtube.com/watch?v=hc0u4avAkuM
NeurIPS+
https://neurips.cc/
ICML+
https://icml.cc/
还有更多 •••
相关职位

校招
1. 计算机、人工智能、自动化等相关专业硕士/博士应届毕业生; 2. 扎实的深度学习基础,熟悉Transformer、ViT、LLM等主流模型架构; 3. 具备VLM或VLA方向的研究或工程经验,理解
更新于 2026-07-08北京|上海|苏州

校招
1.学历背景: 计算机、自动化、人工智能等相关专业,211/985 硕士及以上学历 2.大模型技术栈: 深入理解 Transformer 架构,有 LLM(大语言模型) 或 多模态模型(VLM) 的训
更新于 2026-07-27北京|上海
社招A259862
1. 具备自动驾驶规划模型量产经验; 2. 具备行车端到端大模型的量产经验; 3. 模型学习与强化学习有深入认知; 工作职责 拥有端到端规划模型量产经验,尤其是主流的AR/Diffusion架构量产
更新于 2026-09-03北京
