logo of tongyi

通义Token Foundry-RLHF 算法专家-Qwen

社招全职3年以上技术类-算法地点:北京 | 杭州状态:招聘

任职要求


1.    计算机、机器学习、人工智能、自然语言处理等相关专业,硕士及以上学历。
2.    具有 RLHF / Reward Modeling / 偏好对齐方向的实践经验,熟悉 PPO、DPO、GRPO 等主流算法的原理与工程实现。
3.    精通 PythonPyTorch 等深度学习框架,具备扎实的工程能力,能够独立完成从数据处理、模型训练到评测部署的全链路工作。
4.    对数据质量高度敏感,具备优秀的数据分析与问题诊断能力,能够从复杂反馈信号中提炼有效的优化方向。

加分项

1.    熟悉主流 R…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1. 用户偏好采集与建模:设计并构建系统化的用户偏好数据采集方案,深入分析用户行为与反馈信号,建立多维度、可扩展的用户偏好表征与建模体系,为 Reward Model 训练提供高质量数据基础。
2. Reward Model 训练与优化:训练高精度、低偏差的 Reward Model,覆盖创作质量、指令遵循、安全对齐、人类偏好等多个专项维度;持续优化训练策略,有效缓解 Reward Hacking 与分布偏移问题,为下游 RL 训练(PPO / GRPO 等)和用户偏好评测提供可靠的奖励信号。
3. 用户反馈分析与 Badcase 聚类:建立从线上用户反馈到模型迭代的闭环机制,利用聚类、归因分析等方法系统性挖掘 Badcase,定位模型能力短板与偏好盲区,驱动数据策略与训练目标的持续优化。
4. LLM Judge / Verifier 体系建设:研究并构建基于 LLM 的自动化评测与验证体系,设计可 Scalable 的 Verifier 信号,使其既能作为高效的偏好评测工具,也能作为奖励信号直接融入 RL 训练流程,提升模型迭代的自动化程度与覆盖广度。
5. 偏好对齐前沿探索:持续跟踪 RLHF / RLAIF / DPO / Constitutional AI 等对齐技术的前沿进展,探索更高效的偏好学习范式,推动 Qwen 在对齐质量与训练效率上的双重突破。
包括英文材料
机器学习+
NLP+
学历+
RLHF+
算法+
Python+
PyTorch+
还有更多 •••
相关职位

logo of aligenie
社招3年以上技术类-开发

1. 面向ToB行业场景(如AI手机等),设计并构建可扩展、高可用的Agent编排系统,支撑多模态交互系统中复杂任务的自动化执行。 2. 深度整合阿里集团内部丰富的Agent能力,同时对接第三方生态服务,打造统一的行业级Agent应用。 3. 制定标准化的工具描述协议、Agent接入规范与开发者工具链(SDK/CLI/调试平台),降低内外部生态伙伴的接入门槛。 4. 针对移动端等资源受限环境,优化Agent调用链路的性能、延迟与鲁棒性,支持离线、弱网、低功耗等边缘场景下的可靠运行。

更新于 2026-06-15北京|杭州
logo of tongyi
社招1年以上技术类-开发

1. 负责机器人操作系统的整体软硬件集成与真机部署,完成机械臂、传感器、计算单元等系统的搭建、调试与优化,构建稳定可靠的机器人运行环境。 2. 负责实时遥操作系统的开发与优化,满足高时效性和可靠性要求,设计并搭建真机评测体系与数据管线。 3. 解决真实机器人系统中的部署问题(延迟、标定误差等),优化异步推理系统(RTC等),设计安全保护机制(碰撞检测、异常行为监测、急停),持续提升系统鲁棒性与安全性。 4. 协同算法、数据、硬件团队,将前沿算法成功转化为可稳定运行的机器人系统,推动在真实场景和任务的落地闭环。

更新于 2026-06-16杭州
logo of tongyi
社招3年以上技术类-算法

1. 探索研究多模态生成大模型的设计与开发,探究高效生成、生成理解统一、多模态理解、强化学习/RLHF后训练和高效数据管线设计等方向。 2. 参与研发多模态生成大模型开发等下一代人工智能核心技术,参与大规模生成基础模型预训练与后训练开发。 3. 负责跟踪和研究多模态生成大模型前沿技术调研、落地、对业务进行优化。

更新于 2026-06-16北京|杭州
logo of aligenie
社招1年以上技术类-算法

千问(Qwen)是由阿里巴巴研发的超大规模语言模型,具备跨语言、跨任务的理解与生成能力。Qwen系列模型,涵盖参数量从几百 M 到 T 级的基座大语言模型,并相继推出Qwen-VL、Qwen-Audio、Qwen-Omni、Qwen-Coder、Qwen-Image等系列模型。从多轮对话到代码生成,从逻辑推理到内容创作,从单一多模态到全模态统一理解生成,Qwen 正在打造全球领先的全模态模型技术体系,推动AI在企业服务、开发者生态、个人用户等领域的深度应用,引领下一代人工智能的发展。 我们期望打造世界一流的预训练 LLM 基座,开发涵盖参数量从几百M到T级的基座模型,并将作为 Qwen / QwenVL / Qwen-Omni / Qwen-Coder 等系列模型的基座。我们追求将现有的预训练技术做到极致,并积极探索下一代的预训练技术。 工作职责: 1. 预训练数据:大规模预训练数据合成技术探索、STEM & reasoning 优化、长尾知识优化、精品数据挖掘过滤、自然数据 scaling、长文本优化、面向 test-time scaling 的数据优化。 2. 预训练策略:新型预训练损失函数探索、遗忘对抗与持续学习、optimizer 优化、lr scheduler 优化、课程学习、scaling law 预测、超参优化。 3. 模型结构:新型模型结构探索、模型可解释性、MoE 优化、参数扩展与裁剪蒸馏、线性注意力、动态稀疏注意力、draft model 优化、动态计算优化、KV cache压缩、长序列优化、decoding 加速等。

更新于 2026-06-18北京|杭州|上海