阿里巴巴AI Infra研发工程师-广告引擎
任职要求
我们期待这样的你 ● 本科及以上学历,计算机、软件工程、人工智能 等计算机相关专业。 ● 热爱编程,熟练掌握C/C++、Python 等编程语言,具备扎实的编程功底。掌握常用数据结构与算法,熟悉 网络编程、多线程编程。 ● 熟悉CUDA编程,了解Tensorflow、PyTorch等机器学习平台,熟悉XLA/TensorRT/TVM 等机器学习编译器。 ● 了解DN…
工作职责
我们在做什么 ● 在AI与广告技术融合的最前沿,我们正在打造世界领先的AI广告系统,用技术驱动千亿级商业决策。每一行代码都将释放巨大商业价值! 你将参与的核心项目 AI 训推 Infra 优化建设 ● 从稀疏传统广告模型 到 稠密计算大模型,从端到端训练 到 大模型微调,持续优化改造工业级模型训练框架。 ● 从GPU到PPU到AMD,针对高度复杂的异构计算资源和环境,优化构建万卡推理引擎,支持广告全链路大模型提效。 云原生架构赋能 ● 践行DevOps、ServiceMesh、Serverless-GaaS、落地AI运维、科学实验,为广告系统提供强大的基础设施。 ● 运用容器化、微服务构建弹性高可用的广告平台,管控海量广告引擎在离线资源 和 模型训推资源。 用 AI 重塑研发 ● 基于LLM和Agent构建高质量知识库,高效管理数据、代码、系统、文档知识,让AI成为你最靠谱的技术伙伴。 ● 从 需求理解、方案设计、代码编写、测试验证,到 生产发布、日常答疑、问题诊断,端到端实现AI研发赋能。 极致性能建模 ● 运用现代C++技术、CUDA等异构硬件编程技术,结合各种先进设施,构建毫秒级响应的分布式计算引擎。 ● 在训推之外, 探索GPU/PPU异构硬件在广告引擎各场景的优化落地,帮助业务提升RT/建模Scalingup空间。 业务赋能前沿 ● 参与广告产品 Agent重塑、AI·Targeting等 重大升级,帮助AIGA/AIGB/AIGC/LUM/MUSE 等算法落地,助力AI提升广告效果。 ● 从容应对海量流量峰值,大促日常化不是梦! 加入我们 这里有开放、创新、追求卓越的团队文化 和 发展土壤: ● 你将与行业顶尖工程师并肩作战, 共同成长 ● 用技术改变商业世界,让AI赋能每一个决策 期待与你一起,在阿里妈妈创造属于我们的技术传奇!
参与推荐系统 GPU 推理引擎的研发工作,支撑生成式推荐、排序、召回等业务场景的在线推理服务落地。参与 CUDA 算子开发与优化,包括算子融合、量化(INT8/FP8)、Tensor Core 使用、显存与访存优化等方向,持续提升单卡吞吐与推理延迟表现。参与推理图优化工作,基于 TensorRT / ONNX Runtime / TVM / Triton 等主流框架完成模型的图变换、算子替换、kernel 调优,协助推动模型高效上线。针对推荐模型的特点(稀疏 Embedding、变长序列、多塔结构等),协助完成定制化推理方案的开发与调优,解决 Host-Device 传输、KV Cache 管理等性能瓶颈。参与性能 profiling 与调优工作,熟练使用 Nsight、CUPTI 等工具完成性能分析,配合算法团队完成模型结构的性能评估。关注 GPU 推理、LLM Serving、推荐系统 Infra 的业界前沿进展(vLLM、SGLang、FlashAttention 等),积极学习并参与新技术在团队内的落地。
1.GPU机型性能评估: 主导不同GPU芯片(含国产芯片及英伟达等国外AI芯片)的性能对比与适配评估,深入理解芯片架构并搭建配套的基准评估工具链; 2.训推框架开发与优化:基于云平台和业界常见训推框架,开发加速方案,满足公有云客户对性能的极致需求; 3.支持主流GPU和异构AI芯片,优化大模型推理性能,打造极致性能成本优势; 4.应用优化:参与重点项目POC和现网问题保障,分析性能瓶颈,快速定位和解决重点问题; 5.前沿技术探索:跟踪学术动态,将最新研究成果转化为框架功能,提升产品竞争力。
为了更好地提升城市即时配送的效率与体验,2017年,美团启动了无人机配送服务的探索,通过科技创新推动履约工具变革,加快建设空地协同的本地即时配送网络。目前,美团已初步完成了自主飞行无人机、智能化调度系统及高效率运营体系的研发建设工作,由此打造了一个服务于多场景、多天候的城市低空物流解决方案。 在该岗位中您将负责: 1、推理框架研发:参与构建与优化高性能分布式 AI 推理引擎,支持大模型在多卡、多机环境下的高效分布式部署与高效通信; 2、分布式任务调度:参与设计与实现面向大模型推理的高效任务调度算法。针对 Prefill与 Decoding阶段的不同资源需求,协助研发 PD 分离架构下的请求流转与精细化调度; 3、全局负载均衡:协助构建多节点、多实例集群的负载均衡策略。基于请求长度预测、全局 KV Cache 缓存命中率以及运行时显存状态,实现智能流量分发,避免集群局部热点与雪崩; 4、弹性伸缩与容错:参与大规模分布式推理集群的健康度监控,协同开发故障自动检测与动态隔离机制,提升高并发在线服务(LLM-as-a-Service)的可用性(SLA); 5、性能剖析与调优:协助排查高并发场景下,由网络延迟、长尾请求(Tail Latency)、线程锁竞争或集合通信(NCCL)瓶颈导致的全局吞吐跌落; 6.主动探索并运用各类AI工具优化日常工作流程,积极推动AI在无人机业务中的落地实践。