拼多多大模型开发工程师(多模态)
任职要求
任职要求 1. 本科及以上学历,计算机科学、人工智能、软件工程等相关专业,具备扎实的计算机系统基础(操作系统、计算机网络、编译原理); 2. 精通Python,熟练使用PyTorch,至少参与过1个多模态大规模模型的系统开发; 3. 具备分布式训练优化经验(DeepSpeed、FSDP、Mega…
工作职责
岗位职责 1. 负责多模态大模型的架构设计、开发与优化; 2. 设计并实现多模态数据处理流水线、跨模态对齐机制、并行训练系统,优化显存利用、采样速度与生成一致性; 3. 支持模型并行、数据并行、混合并行等分布式训练策略,优化显存利用率、计算效率与通信开销,提升整体训练吞吐量; 4. 与算法团队紧密协作,快速定位并解决多模态融合、生成幻觉、跨模态一致性、长时序建模等系统瓶颈,持续进行性能调优与成本优化。
1.负责大模型训练框架的开发和维护,以提高训练平台效率和稳定性为主要目标 2.负责大模型的部署和优化, 包括服务效率和稳定性提升,gpu/cpu部署和 资源调度, 数据IO和模型推理加速 3.负责大模型的业务探索,与算法团队和业务团队紧密配合,提升业务收益
1、参与内容理解系统的工程开发,在快手短视频、直播、电商等业务场景落地; 2、设计和实现高并发、高可用的大规模算法服务架构,服务于数亿用户群体; 3、围绕AI算法研发过程,开发相关平台工具,提升算法研发效率; 4、保障现有服务的可用性和稳定性,分析系统的问题和瓶颈,优化提高系统性能;

1.负责主流及自研模型(如Qwen、DeepSeek、MiniMax等)的全链路运维,涵盖部署、监控、高可用保障与故障应急处理,构建可观测体系(日志/指标),确保模型服务稳定性与低延迟响应。 2.优化基于Docker/Kubernetes的模型部署与资源调度策略,提升GPU/CPU资源利用率,推动模型平滑升级与业务无损切换。 3.主导大模型运维平台建设,集成模型监控、评测、用量分析、成本分摊、批量推理及数据集管理等核心能力,提升运维自动化与智能化水平。 4.结合业务实际部署场景,基于sglang/vllm等开源推理引擎进行模型适配部署或二次开发 5.协同算法/业务团队,推动模型从实验到生产的全流程落地,持续跟进大模型与AIOps前沿技术,探索智能运维创新场景。
1. 负责将大模型(LLM)能力落地到实际业务场景,包括但不限于Prompt工程、智能对话、知识库建设、内容生成及业务流程自动化; 2. 设计并开发AI Agent系统及其框架,负责任务规划、多步推理(CoT)、工具调用(Function/Tool Calling)、记忆管理及多智能体协同等核心模块的实现; 3. 构建LLMOps全链路流程,包括大模型应用评测、监控告警、数据标注及RAG(检索增强生成)全链路优化(如切片算法、召回重排等); 4. 参与大模型业务应用平台的研发,推动MCP(模型控制协议)生态建设、工作流编排及代码生成等提效工具的开发,构建高可靠、高扩展的AI架构。