logo of 10jqka

同花顺大模型后训练算法工程师(博士专项)

校招全职ai 算法类地点:杭州状态:招聘

任职要求


1.计算机、人工智能、机器学习自然语言处理强化学习等相关专业,博士优先。
2.熟悉大模型训练和后训练流程,理解 SFT、RLHF、DPO、PPO、GRPO、Reward Model、RLVR 等方法。
3.具备扎实的机器学习强化学习基础,熟悉 PyTorch、Transformers、DeepSpeed、Megatron、TRL 等框架…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


岗位方向
围绕金融大模型在专业场景中的可靠性、准确性、推理能力和用户体验,负责模型后训练、偏好对齐、奖励建模、强化学习、数据构造、评测体系和安全合规能力建设。
岗位职责
1.负责大模型后训练体系建设,包括 SFT、RLHF、DPO、RLAIF、RFT、GRPO、拒答策略、风格对齐、领域适配等。
2.构建金融领域高质量指令数据、偏好数据、评测数据和奖励信号,提升模型在金融专业任务上的表现。
3.设计面向金融问答、投研分析、合规审查、风控预警、数据解释、复杂推理等任务的后训练方案。
4.建设模型评测体系,包括金融知识、事实准确性、逻辑推理、时效性、幻觉率、安全合规、拒答边界、用户满意度等。
5.研究可验证奖励、自动评测、LLM-as-Judge、Reward Model、Process Reward Model 等技术。
6.与大模型、Agent、推荐、多模态、语音团队协作,提升整体 AI 产品的可靠性和业务效果。
包括英文材料
机器学习+
NLP+
强化学习+
还有更多 •••
相关职位

logo of tencent
社招3年以上元宝技术

1.面向AI应用场景的大模型微调,优化PostTraining (SFT/RM/RL) 算法的训练效率和实际用户体验效果; 2.研究各领域高质量数据的自动化合成方法,建设高效的线上数据飞轮链路; 3.配合产品和工程,探索LLM在创作、教育、金融、代码等场景下的创新应用。

更新于 2026-06-22北京
logo of tencent
社招3年以上元宝技术

1.面向AI应用场景的大模型微调,优化PostTraining (SFT/RM/RL) 算法的训练效率和实际用户体验效果; 2.研究各领域高质量数据的自动化合成方法,建设高效的线上数据飞轮链路; 3.配合产品和工程,探索LLM在创作、教育、金融、代码等场景下的创新应用。

更新于 2026-06-05上海
logo of antgroup
社招1年以上技术类-算法

1. 参与训练医疗大模型,包括但不限于模型SFT、强化学习系统的算法实验设计、数据收集合成消融、infra 团队协作等; 2. 探索高效的后训练范式,包括高效 SFT、Model Merge、On-policy Distill、 RL等后训练算法以及pipeline,提升发布效果和效率。 3. 提升大模型在Reasoning、Agentic等任务上的能力上限,构建在医疗场景具备深度思考和自主行动能力的基座模型。

更新于 2026-07-15北京|上海|杭州
logo of tencent
社招5年以上反洗钱与风控公共

1.面向AI应用场景的大模型后训练方向的核心技术研发,包括SFT、偏好学习、强化学习等算法研发、优化与创新,提升业务效果; 2.利用LLM能力,构建用户异常交易、可疑行为特征模型,深度识别客户风险; 3.跟踪大模型后训练方向的前沿技术,参与前沿算法研究,推动研究成果在反洗钱与风控场景的落地应用; 4.基于用户特征、文本数据及尽调资料等信息,探索创新的技术来更好了解客户,洞察用户交易风险。

更新于 2026-06-05深圳