logo of alibaba

阿里巴巴数据技术及产品部-大模型算法研发工程师-LLM&Agentic RL

社招全职2年以上技术类-算法地点:北京 | 杭州状态:招聘

任职要求


1、硕士及以上学历,计算机科学与技术、数学等相关专业优先;
2、有2年以上大模型相关算法研发经验,熟悉常见的深度学习框架(如Tensorflow、Pytorch),有Agentic大模型开发经验优先;
3、熟练掌握机…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1、负责Agentic大模型相关算法开发与优化,开发性能达到业界sota的Agentic大模型并能在实际业务场景中应用落地
2、针对Agentic模型的训练特点,探索Agentic数据的合成策略与后训练数据配比策略,探索稳定高效的Agentic RL 方案,持续迭代模型在Agent场景的应用性能
3、探索创新Agentic RL算法,撰写发表创新论文或技术报告,参与模型开源,和社区、学术界保持良好的交流。
包括英文材料
学历+
大模型+
算法+
深度学习+
还有更多 •••
相关职位

logo of alibaba
社招2年以上技术类-算法

1.评测集自动构建技术:研究跨模态通用的评测集自动生成方法,构建不同模态(文本/图像/视频/音频/3D 等)评测集生产框架;研究动态评测集与抗污染技术,解决各模态静态评测集被"刷榜"后失效的通用问题;探索面向模型弱点的定向探测数据生成,通过错误模式分析自动生成针对性测试样本。 2.自动裁判技术:构建多模态通用的自动评判算法框架,统一支撑文本质量评判、生成内容质量评估、交互过程评估等不同评判范式,设计可插拔的评判策略组件;研究LLM as a judge及Agent as a judge,支撑 Agent 轨迹的中间步骤质量评估、推理链路正确性验证、世界模型的时序物理一致性检验等既需要结果评分也需要过程评分的评判场景。 3.Agent评测技术:设计Coding Agentic应用的端到端评估算法,包括多轮对话质量建模、用户意图满足度预测、任务完成率估计等;研究评测信号与用户真实体验的对齐技术,通过线上行为数据反标定离线评测指标的有效性,构建离线评测可预测线上表现的校准模型。

更新于 2026-06-09北京|杭州
logo of alibaba
社招2年以上技术类-算法

1、和集团内基础大模型团队紧密合作,研发多模态数据理解与处理算子,覆盖图像、视频、音频等多模态数据的识别、理解、质量评估等核心能力,以高质量合成数据驱动集团大模型实现行业领先 2、负责多模态领域专家模型的研发,负责从任务定义、数据构建、模型训练、推理优化、评测迭代到业务落地的全流程闭环,持续提升模型的泛化能力与稳定性。 3、负责全模态理解大模型的研发,持续优化模型从底层感知(时空定位、细粒度识别)到高阶认知(结构化输出、逻辑推理)的核心能力,打造业界sota。 4、探索创新的多模态/全模态大模型训练范式,撰写发表创新论文或技术报告,参与模型开源与社区建设。

更新于 2026-07-20北京|杭州
logo of alibaba
社招2年以上技术类-算法

1. 负责视觉生成大模型 Post-Training 核心算法研发,包括 RL、蒸馏、reward model等,持续提升生成结果的质量与多样性 2. 跟踪视觉生成领域的最新学术进展和行业动态,鼓励发表高水平论文和开源成果,提升团队算法影响力 3. 参与高质量训练数据的构建与合成,包括但不限于数据清洗、标注与评估体系搭建等 4. 探索多模态理解与生成统一架构,探索视觉感知与生成能力的协同演进,推动文本、图像、视频等多模态信息的联合建模

更新于 2026-07-10杭州
logo of alibaba
社招3年以上

1.在阿里集团语音大模型及相关业务场景下,参与输出侧与系统级交互评测路线图的执行落地,负责所属方向在组件级、系统级、产品能力三个层次的体系建设; 2.设计新型评测方法论,将模糊的音质感知、交互体验、对抗鲁棒性等维度转化为可标注、可量化、可复现的指标体系;并参与产品能力评测的具体落地,为业务场景实现场景化 Profile; 3.构建高吞吐量评测基础设施,把单次评测从手工脚本变成可调用的研究工具,支持模型团队的高频迭代节奏; 4.分析评测结果并归因模型缺陷,将技术发现转化为模型团队可执行的改进建议; 5.设计对抗性测试(红队测试),构建高质量评测数据集,并设计防数据泄露与防刷分机制,系统性发现模型边界 case; 6.定期独立横评所属方向的竞品语音能力,跟踪行业进展;参与方法论研究并产出顶级会议论文(ICASSP / Interspeech / ACL 等); 7.示例研究方向(任选其一深入负责):(1) TTS / 语音克隆方向——建立自然度、韵律多样性、中文声调多音字专项等评测方法论;(2) 系统级语音交互方向——建立延迟、全双工、打断、多轮记忆、情感、安全等评测方法论,含模拟用户测试与中文适配。

更新于 2026-07-20北京|杭州