logo of mihoyo

米哈游LLM Post-train 算法研究员 - 星布谷地

社招全职3年以上程序&技术类地点:上海 | 北京状态:招聘

工作描述


任职要求
1)硕士及以上学历,计算机科学、人工智能、机器学习NLP 或相关专业
2)3年以上大模型训练或 NLP 算法相关经验,有 SFTRLHF/DPO、Reward Model 训练的实际项目经验
3)熟悉 Transformer / MoE 架构原理,熟练使用 PyTorch 及主流大模型训练/推理框架(如 DeepSpeed、Megatron-LM、VeRL、Slime、vLLM、SGLang 等)
4)具备优秀的工程实现能力,能够独立设计和搭建训练流水线,快速复现和改进前沿算法
5)对数据质量敏感,具备高质量 SFT/偏好数据构建经验,了解数据对模型效果的影响机制
6)具备扎实的强化学习基础,理解 PPO/DPO/GRPO 等算法原理,有将 RL 方法应用于语言模型对齐的实践经验
7)具备良好的分析和调试能力,能定位训练过程中的稳定性、收敛性和效果问题

加分项
1)有对话系统…
登录查看完整工作描述
微信扫码,1秒登录

包括英文材料
学历+
机器学习+
NLP+
大模型+
算法+
SFT+
RLHF+
Transformer+
还有更多 •••
相关职位

logo of mihoyo
实习程序&技术类

1)2027/2028 届在校硕士及以上学历,计算机科学、人工智能、机器学习、NLP 或相关专业 2)熟悉 Transformer / MoE 架构原理,熟练使用 PyTorch 及主流大模型训练/推

上海
logo of mihoyo
社招3年以上程序&技术类

1)硕士及以上学历,计算机科学、人工智能、机器学习、NLP 或相关专业 2)3年以上大模型训练或 NLP 算法相关经验,有 SFT、RLHF/DPO、Reward Model 训练的实际项目经验 3)

上海|北京
logo of mihoyo
社招程序&技术类

1. 硕士及以上学历,计算机、数学、人工智能等相关专业,数理与工程基础扎实; 2. 有后训练实战经验:独立完成过 SFT 及至少一轮 RL 训练(PPO / GRPO / DAPO / DPO 任一)

上海
logo of mihoyo
校招程序&技术类

1)2027 届在校硕士及以上学历,计算机科学、人工智能、机器学习、NLP 或相关专业 2)熟悉 Transformer / MoE 架构原理,熟练使用 PyTorch 及主流大模型训练/推理框架(如

上海|北京