
Momenta训练推理优化工程师(Mstar)
任职要求
学历背景: 计算机相关专业硕士及以上学历,具备扎实的理论基础和强大的动手能力; 编程能力: - 熟悉 Python/C++/CUDA/CUTLASS/Triton编程,熟悉PyTorch框架及其底层实现; - 熟悉分布式系统开发与调试,熟悉分布式通信开发NCCL/RDMA/IB/RoCE,有多进程调度与并行算法优化经验者优先; 训练与推理经验: - 熟…
工作职责
负责Momenta自动驾驶大模型、世界模型的分布式训练推理框架研发,主要包括: 1、参与设计、研发、维护团队内部的模型分布式训练框架,擅长分析并深度优化训练各个阶段的性能瓶颈,包括计算效率、通信延迟、显存占用等; 2、结合不断迭代的模型算法逻辑,设计并实现针对性的高效分布式并行训练策略; 3、深入研究 CUDA、NCCL、RDMA 等编程范式和通信库,针对团队内部的GPU和集群拓扑约束,开发高性能算子 并 优化分布式通信效率,达到行业SOTA水平; 4、深入研究低精度混合精度训练策略,在保证模型精度满足预期的情况下,探索低精度(FP8、FP4)训练的性能极限; 5、配合算法需求,开发RL训练框架、迭代RL训练算法逻辑,优化在线Rollout推理性能,深度优化分布式On-Policy/异步RL训练效率。
1、负责 CTR 模型在 GPU 上的训练推理性能优化,支撑高并发、低延迟场景下的线上业务稳定落地; 2、结合大模型技术,推动 CTR 模型升级的工程优化,提升推理效率与资源利用率。
THE ROLE We are looking for a hands‑on Engineer to design, implement, and optimize AI model training and inference solutions for AMD platforms. The role focuses on end‑to‑end performance and accuracy improvements at the framework, model, and operator levels, with strong emphasis on low‑bitwidth quantization, model compression, and real‑world deployment. You will work closely with AMD hardware and software teams, support customers, and contribute to open‑source projects and inference/training frameworks. KEY RESPONSIBILITIES * Design, implement, and optimize inference and training pipelines for AMD GPUs/accelerators at the framework, model, and operator levels. * Lead research and development of model optimization algorithms: low‑bitwidth quantization, pruning/sparsity, compression, efficient attention mechanisms, and lightweight architectures. * Implement and tune CUDA/ROCm/Triton kernels for critical operators; profile and eliminate performance bottlenecks. * Integrate and optimize models for PyTorch/JAX and common distributed training/inference stacks (Torchtitan, Megatron, DeepSpeed, HF Transformers, etc.). * Reduce latency and increase throughput for large‑model inference (e.g., batching strategies, caching, speculative decoding). * Contribute to and/or maintain open‑source inference/training tools, ensuring production readiness and community adoption. * Provide technical support and guidance to customers and internal teams to achieve target accuracy and performance on AMD platforms. TECHNICAL
ByteIntern:面向2027届毕业生(2026年9月-2027年8月期间毕业),为符合岗位要求的同学提供转正机会。 团队介绍:架构与工程团队负责为中国交易与广告产品和业务打造大规模、可扩展、高效和稳定的工程架构支撑。团队职责包括抖音、今日头条、番茄视频等各APP端的广告架构和工程、抖音商城架构、广告创意平台等。 加入我们,可以直面超大流量规模、复杂的业务逻辑,不断探索产品和技术的演进前沿,实现新技术趋势下的业务和架构转型。期待你来,一起打造高效、智能、可信赖、可持续发展的交易与广告产品,实现用户、客户和平台共赢! 1、完成LLM训练/推理技术在广告大模型场景的研发、落地和调优,解决广告/推荐场景的大模型工程问题; 2、针对PyTorch、TensorFlow等框架提供高自动化、极致性能的模型优化方案; 3、推动基于大模型开源组件构建,设计和实现新一代推荐系统架构,支持推荐大模型在业务落地; 4、与算法团队Co-Design,推动端到端生成式推荐技术创新的预研和落地。
ByteIntern:面向2027届毕业生(2026年9月-2027年8月期间毕业),为符合岗位要求的同学提供转正机会。 团队介绍:推荐架构团队支撑字节跳动旗下多款APP产品,如抖音、今日头条、番茄小说、西瓜视频、剪映等推荐系统架构的设计和开发,保障系统的稳定和高可用,致力于抽象系统通用组件和服务,建设推荐中台、数据中台;关于在线服务,在这里你有机会参与大规模机器学习在线预估框架的研发与优化,也有机会参与模型训练与调度等相关问题的研究与突破,解决系统瓶颈,降低成本开销;如你对大数据感兴趣,在这里也有机会参与通用实时计算系统的开发、构建统一的推荐特征中台,为推荐业务实现先进的消重、计数、特征服务等;我们期待热爱技术的你加入,一起创造更多可能。 1、完成LLM训练/推理技术在推荐大模型场景的研发、落地和调优,解决推荐场景的大模型工程问题; 2、针对PyTorch、TensorFlow等框架提供高自动化、极致性能的模型优化方案; 3、推动基于大模型开源组件构建,设计和实现新一代推荐系统架构,支持推荐大模型在业务落地; 4、与算法团队Co-Design,推动端到端生成式推荐技术创新的预研和落地。