飞猪旅行飞猪-大模型算法专家-RL 环境合成
社招全职3年以上地点:杭州状态:招聘
工作描述
任职要求 1. 具备大模型后训练或强化学习的研究、项目经验,了解监督微调及 PPO、GRPO 等强化学习方法,理解训练数据、采样策略和奖励信号对模型效果的影响。 2. 熟悉 Agent 的任务规划、工具调用、多轮交互与状态管理,能够分析复杂执行轨迹,识别模型的行为模式和失败原因。 3. 在任务或环境合成、Agent 数据构造、自动验证、奖励设计中至少一个方向有实践经验,能够为具体任务设计明确的完成条件和可执行的评价方法。 4. 熟练使用 Python 和 PyTorch,熟悉 ROLL、verl 等大模型强化学习训练框架,具备环境接入、轨迹采样、奖励计算或训练调试经验。 5. 能够独立提出研究假设、设计对照与消融实验,判断效果变化来自数据、环境、奖励还是训练方法,并形成可复现的实验结论。 加分项: - 有奖励模型(Reward Model)的数据构建、训练、评估…
登录查看完整工作描述
微信扫码,1秒登录
包括英文材料
大模型+
https://www.youtube.com/watch?v=xZDB1naRUlk
You will build projects with LLMs that will enable you to create dynamic interfaces, interact with vast amounts of text data, and even empower LLMs with the capability to browse the internet for research papers.
https://www.youtube.com/watch?v=zjkBMFhNj_g
强化学习+
https://cloud.google.com/discover/what-is-reinforcement-learning?hl=en
Reinforcement learning (RL) is a type of machine learning where an "agent" learns optimal behavior through interaction with its environment.
https://huggingface.co/learn/deep-rl-course/unit0/introduction
This course will teach you about Deep Reinforcement Learning from beginner to expert. It’s completely free and open-source!
https://www.kaggle.com/learn/intro-to-game-ai-and-reinforcement-learning
Build your own video game bots, using classic and cutting-edge algorithms.
AI agent+
https://www.ibm.com/think/ai-agents
Your one-stop resource for gaining in-depth knowledge and hands-on applications of AI agents.
还有更多 •••
相关职位
社招1年以上技术类-算法
1. 计算机科学、人工智能等相关专业硕士及以上学历,1 年以上 LLM 相关工作经验。 2. 扎实的强化学习和大模型算法基础,有 LLM、VLM 对齐(Alignment)或 RLHF 实际落地经验。
更新于 2026-07-09北京|杭州
社招8年以上核心本地商业-基
1. 大学本科及以上学历,计算机、人工智能、数学等相关专业。 2. 扎实的深度学习理论基础,精通PyTorch等主流框架,具备独立复现和改进前沿模型的能力。 3. 在NLP/多模态/强化学习至少一个方
更新于 2026-06-11北京
社招核心本地商业-基
1. 对大模型有技术热情,熟悉GPT/BERT/T5等模型的原理; 2. 熟悉Python,熟练使用TensorFlow/PyTorch/Megatron/Triton等深度学习训练或推理框架,熟悉j
更新于 2026-04-02北京|上海