
同花顺大模型后训练算法工程师(博士专项)
校招全职ai 算法类地点:杭州状态:招聘
任职要求
1.计算机、人工智能、机器学习、自然语言处理、强化学习等相关专业,博士优先。 2.熟悉大模型训练和后训练流程,理解 SFT、RLHF、DPO、PPO、GRPO、Reward Model、RLVR 等方法。 3.具备扎实的机器学习和强化学习基础,熟悉 PyTorch、Transformers、DeepSpeed、Megatron、TRL 等框架…
登录查看完整任职要求
微信扫码,1秒登录
工作职责
岗位方向 围绕金融大模型在专业场景中的可靠性、准确性、推理能力和用户体验,负责模型后训练、偏好对齐、奖励建模、强化学习、数据构造、评测体系和安全合规能力建设。 岗位职责 1.负责大模型后训练体系建设,包括 SFT、RLHF、DPO、RLAIF、RFT、GRPO、拒答策略、风格对齐、领域适配等。 2.构建金融领域高质量指令数据、偏好数据、评测数据和奖励信号,提升模型在金融专业任务上的表现。 3.设计面向金融问答、投研分析、合规审查、风控预警、数据解释、复杂推理等任务的后训练方案。 4.建设模型评测体系,包括金融知识、事实准确性、逻辑推理、时效性、幻觉率、安全合规、拒答边界、用户满意度等。 5.研究可验证奖励、自动评测、LLM-as-Judge、Reward Model、Process Reward Model 等技术。 6.与大模型、Agent、推荐、多模态、语音团队协作,提升整体 AI 产品的可靠性和业务效果。
包括英文材料
机器学习+
https://www.youtube.com/watch?v=0oyDqO8PjIg
Learn about machine learning and AI with this comprehensive 11-hour course from @LunarTech_ai.
https://www.youtube.com/watch?v=i_LwzRVP7bg
Learn Machine Learning in a way that is accessible to absolute beginners.
https://www.youtube.com/watch?v=NWONeJKn6kc
Learn the theory and practical application of machine learning concepts in this comprehensive course for beginners.
https://www.youtube.com/watch?v=PcbuKRNtCUc
Learn about all the most important concepts and terms related to machine learning and AI.
NLP+
https://www.youtube.com/watch?v=fNxaJsNG3-s&list=PLQY2H8rRoyvzDbLUZkbudP-MFQZwNmU4S
Welcome to Zero to Hero for Natural Language Processing using TensorFlow!
https://www.youtube.com/watch?v=R-AG4-qZs1A&list=PLeo1K3hjS3uuvuAXhYjV2lMEShq2UYSwX
Natural Language Processing tutorial for beginners series in Python.
https://www.youtube.com/watch?v=rmVRLeJRkl4&list=PLoROMvodv4rMFqRtEuo6SGjY4XbRIVRd4
The foundations of the effective modern methods for deep learning applied to NLP.
强化学习+
https://cloud.google.com/discover/what-is-reinforcement-learning?hl=en
Reinforcement learning (RL) is a type of machine learning where an "agent" learns optimal behavior through interaction with its environment.
https://huggingface.co/learn/deep-rl-course/unit0/introduction
This course will teach you about Deep Reinforcement Learning from beginner to expert. It’s completely free and open-source!
https://www.kaggle.com/learn/intro-to-game-ai-and-reinforcement-learning
Build your own video game bots, using classic and cutting-edge algorithms.
还有更多 •••
相关职位
社招3年以上元宝技术
1.面向AI应用场景的大模型微调,优化PostTraining (SFT/RM/RL) 算法的训练效率和实际用户体验效果; 2.研究各领域高质量数据的自动化合成方法,建设高效的线上数据飞轮链路; 3.配合产品和工程,探索LLM在创作、教育、金融、代码等场景下的创新应用。
更新于 2026-06-22北京
社招3年以上元宝技术
1.面向AI应用场景的大模型微调,优化PostTraining (SFT/RM/RL) 算法的训练效率和实际用户体验效果; 2.研究各领域高质量数据的自动化合成方法,建设高效的线上数据飞轮链路; 3.配合产品和工程,探索LLM在创作、教育、金融、代码等场景下的创新应用。
更新于 2026-06-05上海
社招1年以上技术类-算法
1. 参与训练医疗大模型,包括但不限于模型SFT、强化学习系统的算法实验设计、数据收集合成消融、infra 团队协作等; 2. 探索高效的后训练范式,包括高效 SFT、Model Merge、On-policy Distill、 RL等后训练算法以及pipeline,提升发布效果和效率。 3. 提升大模型在Reasoning、Agentic等任务上的能力上限,构建在医疗场景具备深度思考和自主行动能力的基座模型。
更新于 2026-07-15北京|上海|杭州