腾讯AI Infra研发工程师-上海/北京/深圳
任职要求
1.熟悉主流的大模型推理框架及其加速技术,如vLLM、SGlang、TensorRT-LLM等,熟练分析单机及分布式情况下的性能热点和优化手段; 2.熟悉业界主流开源模型结构,例如DeepSeek、Qwen、Wan、Flux等; 3.熟悉主流的训练框架和分布式框架,包括Megatron-LM、DeepSpeed、verL、LLama-factory等,熟悉常见的分布式并行策略,了解显存、通信与计算相关性能瓶颈和优化手段; 4.熟悉自动驾驶相关算法者优先,例如BEV…
工作职责
1.GPU机型性能评估: 主导不同GPU芯片(含国产芯片及英伟达等国外AI芯片)的性能对比与适配评估,深入理解芯片架构并搭建配套的基准评估工具链; 2.训推框架开发与优化:基于云平台和业界常见训推框架,开发加速方案,满足公有云客户对性能的极致需求; 3.支持主流GPU和异构AI芯片,优化大模型推理性能,打造极致性能成本优势; 4.应用优化:参与重点项目POC和现网问题保障,分析性能瓶颈,快速定位和解决重点问题; 5.前沿技术探索:跟踪学术动态,将最新研究成果转化为框架功能,提升产品竞争力。
负责阿里集团、阿里云可观测数据处理基础设施建设,打造日增百PB级数据的实时数据分析平台。通过实时采集、索引、存储、压缩等技术,实时处理来自千万设备的海量日志数据,并针对AI应用场景进行特定优化,提供智能、自动化数据分析服务。 加入该岗位,您将有机会在国内超大规模的实时日志平台上,构建各种面向各类AI应用场景的数据存储和处理平台,打造新一代的AI基础设施。 1. 参与阿里云战略级产品SLS研发,参与面向AI应用场景的多模态数据采集、处理、检索分析等功能开发与设计。 2. 参与数据飞轮的建设,研发高质量数据集的清洗和存储、检索系统。 3. 参与Agent数据反馈回路建设,打磨Agent质量。 4. 参与建设Agent数据基座,研发稳定可靠的Agent运行时数据基础设施。
加入该岗位,你将参与构建面向 AI 时代的下一代可观测数据基础设施。 ● 打造国内超大规模的可观测基础设施:通过实时采集、索引、存储、压缩等技术,实时处理来自千万设备的海量日志数据,并针对 AI 应用场景进行特定优化,提供智能、自动化数据分析服务; ● 深度参与 AI Infra 核心能力建设:从数据采集到智能分析,构建面向 LLM、Agent、多模态等前沿 AI 场景的统一可观测底座; ● 开源引领行业标准:主导 LoongCollector 开源项目,推动云原生可观测采集器成为 AI 时代的新一代 OneAgent。 具体职责包括: 1. 参与阿里云战略级产品 SLS 研发,参与面向AI应用场景的数据采集、处理、查询分析等功能开发与设计; 2. 参与千万级实例、数百 PB 流量的云原生可观测采集器 LoongCollector/iLogtail 及管控系统开发,打造云上统一的 OneAgent 能力,服务于日志、指标、eBPF、主机监控、安全等多种场景; 3. 深度参与并打造高性能、高可靠的数据采集与管控系统,深入底层优化,提升网络、内存和 CPU 等关键资源的利用效率; 4. 面向 AI 应用构建高性能、安全的多模态数据处理与数据集管理平台,参与上下游 AI 生态建设。

负责AI平台、大模型平台及AI应用平台相关系统的设计与开发,聚焦智能Agent、RAG等前沿AI能力的工程化落地; 1. 涵盖机器学习系统模型训练、模型推理、资源管理、工作流、模型评估、数据处理、监控告警等功能模块开发; 2. 负责多种异构资源如GPU、CPU、RDMA等的最优化的编排调度,提升集群的整体资源利用率; 3. 解决开发过程中遇到的技术难题,确保项目按时交付; 4. 与算法团队密切合作,负责机器学习、深度学习算法模型的工程化、服务化以及产品化; 5. 负责平台的性能优化和稳定性保障,监控系统运行状态,及时发现和解决潜在的问题。 6. 大模型推理性能优化。
参与推荐系统 GPU 推理引擎的研发工作,支撑生成式推荐、排序、召回等业务场景的在线推理服务落地。参与 CUDA 算子开发与优化,包括算子融合、量化(INT8/FP8)、Tensor Core 使用、显存与访存优化等方向,持续提升单卡吞吐与推理延迟表现。参与推理图优化工作,基于 TensorRT / ONNX Runtime / TVM / Triton 等主流框架完成模型的图变换、算子替换、kernel 调优,协助推动模型高效上线。针对推荐模型的特点(稀疏 Embedding、变长序列、多塔结构等),协助完成定制化推理方案的开发与调优,解决 Host-Device 传输、KV Cache 管理等性能瓶颈。参与性能 profiling 与调优工作,熟练使用 Nsight、CUPTI 等工具完成性能分析,配合算法团队完成模型结构的性能评估。关注 GPU 推理、LLM Serving、推荐系统 Infra 的业界前沿进展(vLLM、SGLang、FlashAttention 等),积极学习并参与新技术在团队内的落地。