
MiniMax大模型算法工程师-后训练
社招全职算法地点:北京 | 上海状态:招聘
工作描述
我们致力于提升大模型的通用能力,让模型更好地理解用户意图、处理复杂信息,并通过推理、工具使用与多轮协作完成真实任务。你将参与通用模型的后训练研发,探索训练方法、能力协同优化与评测反馈机制,持续提升模型的整体表现和实际任务完成质量。根据个人经验与兴趣,你将重点负责以下一个或多个方向: 1. 研发监督微调、强化学习与偏好优化等后训练方法,提升模型的指令遵循、推理、工具使用和复杂任务执行…
登录查看完整工作描述
微信扫码,1秒登录
包括英文材料
大模型+
https://www.youtube.com/watch?v=xZDB1naRUlk
You will build projects with LLMs that will enable you to create dynamic interfaces, interact with vast amounts of text data, and even empower LLMs with the capability to browse the internet for research papers.
https://www.youtube.com/watch?v=zjkBMFhNj_g
强化学习+
https://cloud.google.com/discover/what-is-reinforcement-learning?hl=en
Reinforcement learning (RL) is a type of machine learning where an "agent" learns optimal behavior through interaction with its environment.
https://huggingface.co/learn/deep-rl-course/unit0/introduction
This course will teach you about Deep Reinforcement Learning from beginner to expert. It’s completely free and open-source!
https://www.kaggle.com/learn/intro-to-game-ai-and-reinforcement-learning
Build your own video game bots, using classic and cutting-edge algorithms.
还有更多 •••
相关职位
社招3年以上云智能集团
1、计算机、人工智能等相关专业硕士/博士学位,在语音处理、多模态学习、大模型后训练等领域具备扎实的理论基础; 2、实战经验与工程能力: ● 有实际落地语音或音视频多模态项目经验,能处理真实场景
更新于 2026-03-23北京|杭州

社招
1. 在大模型领域一个或多个方向有深厚积累与突破性成果,具备带领团队攻坚复杂问题的能力。 2. 主导过基座模型的完整迭代,对算法原理与工程实现均有极致掌控力。 3. 对技术驱动现实变革有强烈热情,
更新于 2026-09-16北京|上海
社招2年以上企业微信SaaS
1.计算机、人工智能、机器学习、数学等相关专业,硕士及以上学历,具备扎实的计算机基础与算法基础,2 年以上相关领域工作经验; 2.深入理解大语言模型与 Agent 技术体系,熟练掌握主流后训练技术(
更新于 2026-09-06成都