深度求索后训练(数据/算法)研究员
社招全职深度学习研究员地点:北京 | 杭州状态:招聘
任职要求
(满足其一即可)】 1.对大模型后训练有深入理解,熟悉 RLHF / RLVR / PPO / GRPO 等主流强化学习框架与范式,具备从算法设计到工程落地的完整经验。 2.具备扎实的数据直觉与工程能…
登录查看完整任职要求
微信扫码,1秒登录
工作职责
【团队使命】 通过高质量后训练数据与前沿算法,最大化释放Base模型潜能,打造兼具强大智能与深度意图理解力的AI模型。使得模型既能解决最难的问题,也能读懂每一个意图,更能作为自主Agent在复杂真实世界中可靠地行动。 【岗位类别】:实习/全职 1.持续迭代与优化强化学习算法,在预训练模型与数据既定的条件下,最大限度地释放模型潜力。 2.跨部门团队紧密协作,构建高质量、高多样性的后训练数据集;设计并落地自动化数据清洗、评测及合成管线,系统性提升模型在写作、问答、Agent 等核心场景的表现。 3.建立科学、敏捷、多维度的模型能力评测体系,覆盖通用能力与 Agent 场景,精准定位模型短板并驱动针对性优化。
包括英文材料
大模型+
https://www.youtube.com/watch?v=xZDB1naRUlk
You will build projects with LLMs that will enable you to create dynamic interfaces, interact with vast amounts of text data, and even empower LLMs with the capability to browse the internet for research papers.
https://www.youtube.com/watch?v=zjkBMFhNj_g
RLHF+
[英文] What is RLHF?
https://aws.amazon.com/what-is/reinforcement-learning-from-human-feedback/
Reinforcement learning from human feedback (RLHF) is a machine learning (ML) technique that uses human feedback to optimize ML models to self-learn more efficiently.
https://www.ibm.com/think/topics/rlhf
Reinforcement learning from human feedback (RLHF) is a machine learning technique in which a “reward model” is trained with direct human feedback, then used to optimize the performance of an artificial intelligence agent through reinforcement learning.
还有更多 •••
相关职位
社招5年以上腾讯云-数据库技
1.负责腾讯云数据库AI服务领域大模型的SFT(监督微调)、RLHF(强化学习)等后训练工作,提升模型在SQL生成、性能诊断、故障分析等数据库专业任务上的准确性和可靠性; 2.负责数据库领域训练数据体系建设与模型评测基准(Benchmark)构建,包括高质量数据集采集标注、评估指标设计、模型能力持续迭代优化,确保模型满足重点客户的专业需求; 3.参与数据库场景的Prompt工程优化、模型安全防护、领域知识注入等关键技术落地,跟踪领域模型适配、指令微调、MoE、LoRA等前沿技术并推动创新应用,不断提升产品技术竞争力。
更新于 2026-04-01成都
校招核心本地商业-基
我们致力于用科技创新为用户和生态伙伴创造超预期的交互体验和效率提升,依托生活服务领域多样化且复杂的业务场景,聚焦基座技术与公司战略级应用方向的深度融合,持续推动前沿技术的落地,同时积极探索和挑战技术的无人区,不断定义并刷新行业的最先进技术标准。 1、异构数据理解与数值推理:突破大模型在Table+文本混合形态下的信息丢失与幻觉瓶颈 2、Agentic RL与数据环境交互:构建基于代码执行沙盒与真实数据计算结果反馈的强化学习闭环 3、复杂推理与过程奖励(PRM):构建细粒度过程奖励模型,研究Test-Time Compute策略与MCTS搜索
更新于 2026-06-03北京|上海
社招核心本地商业-基
1. 深度参与LongCat模型基础能力优化,包括但不限于指令遵循、幻觉、推理、智能体等; 2. 探索大规模RL及多目标RL的训练方案,与上下游团队合作,构建长期稳定的RL Scaling训练能力,推动模型能力持续提升; 3. 探索Long Horizon场景下大模型的优化方案,包括不限于数据合成、上下文管理、长上下文RL方案等。
更新于 2026-05-28北京|上海