
智能互联千问事业部-大模型训练优化专家-基础架构方向
任职要求
1、1年及以上后端系统研发、调优经验,熟练掌握Go/Java/Python以及MySQL/MongoDB/PostgreSQL,并可基于此搭建稳定高效系统;…
工作职责
1、负责千卡以上大规模混合模态大模型强化学习训练框架建设,调研和实现业界先进的强化学习方法,并探索算法工程结合的训练方法创新设计,实现模型性能和训练效率的双提升; 2、参与奖励系统、工具系统交互的设计与研发,打造高效率的可持续扩展架构;并通过线上链路的联合设计保障模型训练效果的对齐,保障模型在事实性、复杂任务规划解决等方面的能力提点可以落地千问App。

1、参与万卡大规模文本及多模态大模型训练框架建设,为Quark、通义等国民级APP的大模型提供持续效果优化能力; 2、参与算法与工程结合的模型结构创新设计,并通过工程实现验证模型性能和训练效率; 3、参与万卡规模训练任务的极致训练效率优化,负责前沿技术的调研、引入和创新,效果验证与落地等工作。
1、负责千卡以上大规模混合模态大模型强化学习训练框架建设,调研和实现业界先进的强化学习方法,并探索算法工程结合的训练方法创新设计,实现模型性能和训练效率的双提升; 2、打通复杂工具调用场景的高性能推理与Agent训练系统,攻克长程数据训练中的训练效率、训推一致性等难点,显著提升千问模型基于多种阿里生态工具(如闪购、飞猪等)的用户真实任务解决率; 3、参与奖励系统、工具系统交互的设计与研发,打造高效率的可持续扩展架构;并通过线上链路的联合设计保障模型训练效果的对齐,保障模型在事实性、复杂任务规划解决等方面的能力提点可以落地千问App。
1. 负责面向AI教育领域战略级内容产品建设和应用,结合大模型前沿技术解决行业核心问题。 2. 负责提升面向核心任务的大模型后训练和综合效果迭代。通过大模型、NLP、强化学习等级技术完善智能决策、内容理解等核心领域的应用技术体系。

1.模型微调与训练:负责针对特定业务场景下的 Agent 需求,构建高质量指令微调数据集,对主流大模型(如Qwen 等)进行 SFT / DPO 微调,提升模型在推理、规划和工具调用上的表现; 2.Prompt工程与评测:设计并持续优化系统级 Prompt,构建针对 Agent 应用的自动化评测集(Evaluation)与评估指标,确保系统输出的准确性、稳定性和鲁棒性。 3.前沿技术追踪:持续关注 LLM、多模态、Agent 等方向的学术界最新论文及开源社区动态(如 HuggingFace, Github),并快速进行技术原型(PoC)的验证与落地。