淘宝闪购淘宝闪购-算法工程专家-营销超算-杭州
任职要求
1.计算机科学、软件工程、人工智能等相关专业,3年以上工程化开发经验(含1年以上 RL 或深度学习基础设施相关经验); 2.熟练掌握 Python编程,具备扎实的工程编码能力,熟悉 C/C++ 者优先(底层优化场景); 3.深入理解深度学习框架(PyTorch),精通分布式训练原理与实践(FSDP/DeepSpeed/Megatron/Ray 等工具使用经验); 4.具备强化学习基础,理解 RL 训练流…
工作职责
1.负责LLM RL、Agentic RL强化学习训练框架的设计、开发与性能优化,支撑大规模 RL算法(如 PPO、DQN、GRPO等)的高效落地; 2.构建分布式训练体系,优化训推异步、partial rollout、数据并行、模型并行、Replay Buffer分布式存储与调度策略,提升GPU 利用率与训练吞吐; 3.设计并实现 RL 训练全流程工具链:包括环境封装、数据预处理、模型版本管理、训练日志监控、指标可视化(TensorBoard/Weights & Biases)等; 4.解决 RL 训练中的工程瓶颈:如样本传输延迟、GPU 显存溢出、训练稳定性(梯度爆炸/消失)等问题,提供工程化解决方案; 5.与 RL 算法团队紧密协作,理解算法需求,迭代基础设施,适配多场景的训练需求; 6.跟进强化学习与分布式训练领域的前沿技术(如 VERL、rllm、Agentlightning、Ray、Megatron-LM等),并落地到实际系统中。

1.负责LLM RL、Agentic RL强化学习训练框架的设计、开发与性能优化,支撑大规模 RL算法(如 PPO、DQN、GRPO等)的高效落地; 2.构建分布式训练体系,优化训推异步、partial rollout、数据并行、模型并行、Replay Buffer分布式存储与调度策略,提升GPU 利用率与训练吞吐; 3.设计并实现 RL 训练全流程工具链:包括环境封装、数据预处理、模型版本管理、训练日志监控、指标可视化(TensorBoard/Weights & Biases)等; 4.解决 RL 训练中的工程瓶颈:如样本传输延迟、GPU 显存溢出、训练稳定性(梯度爆炸/消失)等问题,提供工程化解决方案; 5.与 RL 算法团队紧密协作,理解算法需求,迭代基础设施,适配多场景的训练需求; 6.跟进强化学习与分布式训练领域的前沿技术(如 VERL、rllm、Agentlightning、Ray、Megatron-LM等),并落地到实际系统中。
1、结合营销业务场景(如优惠券、补贴、活动奖励、游戏等),设计并实现针对虚假交易、批量注册、套现、团伙等异常行为的实时风控算法。 2、利用机器学习、深度学习及相关数据分析技术,对用户行为和交易数据进行实时监控与分析,识别可疑行为和潜在风险; 3、与业务、产品和风控团队紧密合作,定义并完善风控指标体系,持续跟进风险案例并制定对应策略; 4、设计并实现高效、稳定的风控数据处理流程,包括数据清洗、特征工程、模型训练及线上预测部署; 5、持续跟踪电商行业风险趋势及新技术发展,及时更新和升级风控算法与策略,提升整体防控能力。
负责高德共享出行(打车)业务核心链路的推荐 & 营销算法与大模型技术落地,直接对打车主链路 GMV、订单转化率与营销 ROI 负责: • 主导打车核心链路推荐算法与营销算法的构建与迭代,覆盖多任务学习(MTL)、多场景建模、用户长短期序列建模、因果推断(Uplift Modeling)等方向; • 负责营销补贴/权益的智能分发策略,通过因果建模与运筹优化实现预算约束下的 ROI 最大化; • 推动 LLM 在打车主链路各个场景的落地,包括但不限于:大模型用户画像与意图理解、生成式推荐(Generative Recommendation)、大模型营销文案生成等。

负责高德共享出行(打车)业务核心链路的推荐 & 营销算法与大模型技术落地,直接对打车主链路 GMV、订单转化率与营销 ROI 负责: • 主导打车核心链路推荐算法与营销算法的构建与迭代,覆盖多任务学习(MTL)、多场景建模、用户长短期序列建模、因果推断(Uplift Modeling)等方向; • 负责营销补贴/权益的智能分发策略,通过因果建模与运筹优化实现预算约束下的 ROI 最大化; • 推动 LLM 在打车主链路各个场景的落地,包括但不限于:大模型用户画像与意图理解、生成式推荐(Generative Recommendation)、大模型营销文案生成等。