logo of 10jqka

同花顺基座后训练算法工程师(强化学习方向)

校招全职AI算法类地点:杭州状态:招聘

工作描述


任职要求
【工作内容】
1、负责智能体基座模型后训练算法的设计与落地,覆盖 SFT、DPO、RLHF、RLVR 等训练范式,持续提升模型在金融任务上的能力表现。
2、负责奖励体系设计,包括规则奖励、可验证奖励、Reward Model 与 Judge Model 的训练与校准,解决奖励作弊与目标错配问题。
3、负责 Agentic RL 训练链路建设,包括多轮轨迹采样、工具调用环境接入、长程信用分配与训练/采样效率优化。
4、负责后训练过程的稳定性工程,包括熵坍缩、能力遗忘、KL 失控等问题的诊断与治理,保障多阶段训练的可控与可复现。
5、负责能力归因与迭代闭环,与数据评测、金融研究团队协作,将评测暴露的能力短板转化为下一轮训练目标。

【职位要求】
1、本科及以上学历,计算机、人工智能、数学、统计学等相关专业优先。
2、熟悉大语言模型与智能体基本原理,深入理解 SFT、偏好学习与强化学习的训练流程与失效模式。
3、熟悉 PPO、GRPO 等策略优化算法,熟练使用 verl、OpenRLHF、TRL 等主流后训练框架。
4、具备扎实的 Python 与 PyTor…
登录查看完整工作描述
微信扫码,1秒登录

包括英文材料
智能体+
算法+
SFT+
RLHF+
学历+
强化学习+
Python+
PyTorch+
Ray+
Kubernetes+
还有更多 •••
相关职位

logo of 10jqka
校招AI算法类

【职位要求】 1、本科及以上学历,计算机、人工智能、数学、统计学等相关专业优先。 2、熟悉大语言模型和智能体基本原理,理解 SFT、强化学习等后训练流程。 3、具备优秀的问题分析和实验研究能力,能够从

杭州
logo of 10jqka
校招AI算法类

【职位要求】 1、本科及以上学历,计算机、人工智能、数学、统计学等相关专业优先。 2、熟悉大语言模型与智能体基本原理,深入理解 SFT、偏好学习与强化学习的训练流程与失效模式。 3、熟悉 PPO、GR

杭州
logo of amap
社招3年以上技术类-算法

学历与专业背景:计算机/机器人/AI 相关专业硕士及以上学历,3 年以上多模态大模型或具身智能核心研发经验。 项目经历(满足其一): •主导过 VLA/VLM/WAM 至少一个方向从 0 到 1 的模

更新于 2026-08-14北京
logo of tencent
社招3年以上WXG公共技术

1.计算机科学、数学、人工智能等相关专业硕士及以上学历; 2.具备良好的数理基础和 NLP 技术基础,能够熟练使用 Megatron,HuggingFace,DeepSpeed,PyTorch 等框

更新于 2026-06-16北京