
智能互联淘天算法技术-大模型&Agent算法工程师-杭州
任职要求
1. 计算机、人工智能、机器学习或相关专业本科及以上学历(硕士优先),具备 1–5 年工作经验; 2. 熟练掌握 Python,熟悉 PyTorch 或 TensorFlow 框架,理解 Transformer 架构与大语言模型基本原理; 3. 具备大模型后训练实践经验,熟悉 Prompt Tuning、…
工作职责
我们是一支充满活力与技术深度的自营行业算法团队,致力于驱动天猫超市、天猫国际等核心自营业务的智能化升级。在这里,我们不仅用数据理解消费趋势,更用算法重塑商品运营与客户服务——从“人工经验驱动”到“AI自主决策”,构建更具竞争力的商品供给与更高效、可规模化的智能服务体系。 我们积极拥抱生成式AI浪潮,已在多个关键场景实现落地突破: ● 商品侧:探索基于大模型的智能选品辅助、营销素材生成与合规性机审,提升商品上架效率与内容质量; ● 客服侧:构建支持多轮意图识别、任务规划与跨系统调用的智能客服Agent,实现从“问答匹配”到“问题解决”的跃迁。 当前,我们正打造以大模型为认知核心、Agent为执行载体的下一代智能体系统,覆盖商品全生命周期管理与用户服务闭环。加入我们,你将参与设计并落地真正意义上的AI原生电商引擎,推动业务进入自动化、可进化的新阶段。 岗位描述: 1. 负责大模型后训练与领域适配,参与通用大模型在自营场景下的微调、指令对齐与多轮对话优化,提升模型在商品问答、素材生成、客服应答等任务中的专业性与一致性。 2. 负责智能Agent体系的研发与落地,涵盖工具调用(Tool Use)、任务规划、状态管理与多Agent协作机制,实现在智能选品、客服QA等复杂场景中的端到端闭环执行。 3. 负责设计并优化检索增强(RAG)系统,从索引构建、召回排序到知识融合与上下文压缩,全面提升RAG在商品知识、营销信息、服务标准等高准确性需求场景下的效果与稳定性。 4. 负责建立科学评测体系,设计覆盖功能性、合规性、一致性与业务转化的多维评估指标,系统分析模型表现,指导模型与Agent策略的精准优化。 5. 推进前沿技术在业务中的验证与落地,深入跟踪 LLM领域前沿进展,在真实场景中快速实验并应用。 6. 协同产品与工程团队,将算法能力高效集成至线上系统,兼顾性能、延迟与可用性,确保用户体验与业务目标双达成。 我们能提供: 1. 高价值业务场景:深耕天猫超市、天猫国际的商品与客服体系,覆盖跨境选品、用户咨询、履约售后等完整链路,技术直击业务核心。 2. 快速闭环验证:依托自营决策权,算法可快速上线并反馈于转化率、响应准确率、人力替代率等核心指标。 3. 丰富数据与资源支持:拥有完整的商品知识库、用户行为流与客服对话日志,支撑高质量训练与评测。 4. 复合成长路径:在技术深度(大模型/Agent)与业务广度(电商/跨境/客服)双重挑战中成长,核心骨干带教支持,晋升通道畅通。
我们在建设淘宝下全场景统一的多轮需求预测Agent,定位是:在淘宝购物过程中(搜前、搜中、搜后、购后),能够及时捕捉用户的兴趣偏好,通过query的方式对用户进行引导。该能力是淘宝搜索导购的一个重要能力,每天影响亿级别用户的消费决策。主要的工作包含不仅限于以下: 1、需求预测Agent的长程多轮推理与系统自进化:面向需求预测Agent在被动交互、隐式非稳态反馈与毫秒级延迟下的三重挑战,我们探索如何实现Session内多轮长程信用分配、如何构建预算感知的 Harness自进化机制、以及如何在毫秒预算内完成多层异质决策的单次高效推理,支撑端到端优化闭环。 2、电商场景下的基于用户多模态复杂行为的Memory系统设计:面向电商Agent在高频隐式多模态信号、意图非稳态耦合与工业级RT约束下的三重挑战,我们探索如何构建无显式边界 Session 的层级化记忆组织体系、如何实现基于信息增量驱动与规则约束的双轨衰减更新机制、支撑复杂场景下的精准记忆沉淀闭环。 3、多模态行为序列压缩与跨场景统一模型的融合训练和分级推理:面对行为序列膨胀与毫秒级延迟的双重约束,如何对文本/图片/行为meta进行差异化语义压缩以控制token规模;如何生成跨场景连贯的个性化Query表达,通过跨场景蒸馏将多场景能力融合至统一VLM。
1、参与电商大模型智能体产品研发,包括框架设计、算法开发、迭代优化等 2、根据业务产品形态对大模型进行post training(SFT/RLHF等)优化、结构优化、prompt engineering等 3、基于LLM的机器人AI Agent模块与产品其他功能模块交互的工程实现 4、跟进大模型智能体前沿技术趋势,结合实际业务需求,将技术应用到实际业务场景
1、深度参与淘宝AI购物助手统一大模型的全链路训练,包括预训练退火、监督微调(SFT)、基于真实用户行为的奖励建模(RLVR)及人类反馈强化学习(RLHF),持续提升模型在电商场景下的任务完成能力。 2、设计并实现大模型原生的Agent框架,通过Skill编排、工具调用(Tool-use)、Sub-agent协作等机制,将淘系生态能力注入AI助手,使其具备“执行闭环”能力——不仅能理解用户意图,更能完成推荐、比价、下单、售后等真实购物任务。 3、基于淘天数亿级用户的真实交互行为,挖掘高信噪比的隐式与显式反馈信号,构建面向电商场景的奖励函数体系,并通过强化学习驱动模型持续优化用户体验与商业指标。 4、探索无人区问题,AI Agent在真实业务约束下的前沿挑战,包括但不限于:异步实时推理调度、Any-to-Any原生多模态理解(文本/图像/视频/商品卡片)、动态工具发现与组合、长程任务规划等。