logo of fliggy

飞猪旅行飞猪-大模型算法专家-RL 环境合成

社招全职3年以上地点:杭州状态:招聘

工作描述


任职要求
1. 具备大模型后训练或强化学习的研究、项目经验,了解监督微调及 PPO、GRPO 等强化学习方法,理解训练数据、采样策略和奖励信号对模型效果的影响。
2. 熟悉 Agent 的任务规划、工具调用、多轮交互与状态管理,能够分析复杂执行轨迹,识别模型的行为模式和失败原因。
3. 在任务或环境合成、Agent 数据构造、自动验证、奖励设计中至少一个方向有实践经验,能够为具体任务设计明确的完成条件和可执行的评价方法。
4. 熟练使用 Python 和 PyTorch,熟悉 ROLL、verl 等大模型强化学习训练框架,具备环境接入、轨迹采样、奖励计算或训练调试经验。
5. 能够独立提出研究假设、设计对照与消融实验,判断效果变化来自数据、环境、奖励还是训练方法,并形成可复现的实验结论。

加分项:
- 有奖励模型(Reward Model)的数据构建、训练、评估…
登录查看完整工作描述
微信扫码,1秒登录

包括英文材料
大模型+
强化学习+
AI agent+
还有更多 •••
相关职位

logo of tongyi
社招1年以上技术类-算法

1. 计算机科学、人工智能等相关专业硕士及以上学历,1 年以上 LLM 相关工作经验。 2. 扎实的强化学习和大模型算法基础,有 LLM、VLM 对齐(Alignment)或 RLHF 实际落地经验。

更新于 2026-07-09北京|杭州
logo of meituan
社招8年以上核心本地商业-基

1. 大学本科及以上学历,计算机、人工智能、数学等相关专业。 2. 扎实的深度学习理论基础,精通PyTorch等主流框架,具备独立复现和改进前沿模型的能力。 3. 在NLP/多模态/强化学习至少一个方

更新于 2026-06-11北京
logo of meituan
社招核心本地商业-基

1. 对大模型有技术热情,熟悉GPT/BERT/T5等模型的原理; 2. 熟悉Python,熟练使用TensorFlow/PyTorch/Megatron/Triton等深度学习训练或推理框架,熟悉j

更新于 2026-04-02北京|上海
logo of jd
社招算法开发岗

1.有计算机科学、数学、统计学或相关领域的硕士或博士学位; 2. 熟悉Python与深度学习框架,具有良好的编程能力和扎实的数学理论基础; 3.熟悉掌握大模型相关技术,有实际主导或参与过大模型训练工作

更新于 2025-12-16北京