深度求索后训练(数据/算法)研究员
社招全职深度学习研究员地点:北京 | 杭州状态:招聘
工作描述
【团队使命】
通过高质量后训练数据与前沿算法,最大化释放Base模型潜能,打造兼具强大智能与深度意图理解力的AI模型。使得模型既能解决最难的问题,也能读懂每一个意图,更能作为自主Agent在复杂真实世界中可靠地行动。
【岗位类别】:实习/全职
【工作职责】
1.持续迭代与优化强化学习算法,在预训练模型与数据既定的条件下,最大限度地释放模型潜力…登录查看完整工作描述
微信扫码,1秒登录
包括英文材料
大模型+
https://www.youtube.com/watch?v=xZDB1naRUlk
You will build projects with LLMs that will enable you to create dynamic interfaces, interact with vast amounts of text data, and even empower LLMs with the capability to browse the internet for research papers.
https://www.youtube.com/watch?v=zjkBMFhNj_g
RLHF+
[英文] What is RLHF?
https://aws.amazon.com/what-is/reinforcement-learning-from-human-feedback/
Reinforcement learning from human feedback (RLHF) is a machine learning (ML) technique that uses human feedback to optimize ML models to self-learn more efficiently.
https://www.ibm.com/think/topics/rlhf
Reinforcement learning from human feedback (RLHF) is a machine learning technique in which a “reward model” is trained with direct human feedback, then used to optimize the performance of an artificial intelligence agent through reinforcement learning.
还有更多 •••
相关职位

校招算法
1、2027届本科及以上学历,计算机、软件工程、人工智能等相关专业 ; 2、对通用人工智能和基础模型长期发展有强烈兴趣,具备优秀的学习能力、工程意识、团队协作能力和结果导向; 3、 具备较强的 AI
更新于 2026-07-07北京|深圳|上海

校招算法
1、2027届本科及以上学历,计算机、软件工程、人工智能等相关专业 ; 2、对通用人工智能和基础模型长期发展有强烈兴趣,具备优秀的学习能力、工程意识、团队协作能力和结果导向; 3、 具备较强的 AI
更新于 2026-07-07北京|深圳|上海
实习技术类
工作职责: 1. 面向视频生成模型的 SFT、偏好优化和强化学习,设计并构建高质量后训练数据。 2. 分析模型在指令遵循、主体一致性、动作生成、复杂运镜、时序稳定性、物理规律和视觉审美等方面的能力短板
更新于 2026-09-14上海
