字节跳动AI基础设施架构师/高级AI基础设施研究员-基础架构

社招全职5年以上A501172025-05-29地点：北京状态：招聘

扫码手机上打开

任职要求

1、计算机科学、工程或相关技术领域的硕士及以上学位；
2、5年以上基础设施或系统工程工作经验，至少…

登录查看完整任职要求

微信扫码，1秒登录

工作职责

1、领导可扩展、可靠的AI基础设施（AI加速器、计算集群、存储、网络）的端到端设计，用于Training和Inference大模型工作负载；
2、定义并实现面向服务的容器化架构（Kubernetes、VM框架、Unikernels），优化ML性能和安全性；
3、分析和优化ML堆栈的每一层ML编译器、GPU/TPU调度、NCCL/RDMA网络、数据预处理和训练/推理框架，开发低开销Metrics和基准测试框架，以识别和消除分布式训练和Inference中的瓶颈；
4、构建和运营跨多个数据中心（本地和云）自动扩展的大规模部署和编排调度系统，通过智能资源管理和工作负载放置来支持容错、高可用性和成本效益；
5、为PB级大模型数据集量身定制强大的ETL和数据摄取管道（Spark/Beam/Dask/Flume），集成实验管理和工作流编排工具（Airflow、Kubeflow、Metaflow）以简化研究到生产的过程；
6、与机器学习研究人员合作，将原型需求转化为生产级系统，指导工程师在性能调整、系统设计和可靠性工程方面的最佳实践。

📮 投递简历 ✨AI模拟面试

难度：

包括英文材料

学历+

Python+

还有更多 •••

登录查看完整学习资料

相关职位

阿里云智能-AI基础设施产品专家/高级专家（训推加速平台方向）-北京/杭州

社招5年以上产品类-平台型

1. 负责百炼专属版大模型AI Infra产品定义、设计及商业化落地； 2. 制定产品策略以及商业策略，以业务成功为导向，协同研发工程师，售前架构师，产品运营等多角色共同努力达成业务目标； 3. 深刻理解客户业务和场景需求，追踪行业发展趋势及技术发展动态，规划产品演进路径及迭代，保持具有持续产品力竞争优势； 4. 追踪标杆客户，确保技术可行性，以及对产品演进的持续反馈，沉淀最佳实践，标杆项目案例； 5. 收集客户需求，结合技术理解和研判，推动产品功能升级迭代，提升产品市场竞争力和市场占有率。

更新于 2025-06-27北京|杭州

AI平台高级研发工程师（大模型专项）

社招3-5年大模型

我们是小红书中台大模型 Infra 团队，专注打造领先易用的「AI 大模型全链路基础设施」！团队深耕大模型「数-训-压-推-评」技术闭环，在大模型训练加速、模型压缩、推理优化、部署提效等方向积累了深厚的技术优势，基于 RedAccel 训练引擎、RedSlim 压缩工具、RedServing 推理部署引擎、DirectLLM 大模型 API 服务、QuickSilver 大模型生产部署平台等核心产品，持续赋能社区、商业、交易、安全、数平、研效等多个核心业务，实现 AI 技术高效落地！ 1、负责大模型平台的架构设计和核心功能研发，构建云原生架构，设计高可用、高性能的微服务体系； 2、负责构建面向大模型全流程的DevOps，与下游云原生平台深度融合，支撑大模型在公司内各业务生产链路稳定高效地落地； 3、负责万卡规模GPU集群效能分析及优化，通过调度策略优化、在离线混部、GPU虚拟化、存储&网络加速等手段，提升GPU集群使用效率； 4、将平台和框架结合，通过任务调度、弹性容灾、性能优化等措施端到端提升AI生产效率，涉及k8s/kubeflow、网络通信、分布式训练等； 5、优化各AI平台性能，提升系统稳定性和可扩展性，保障大规模并发场景下的服务质量与用户体验； 6、持续研究分析业内创新AI平台产品，优化技术方案，改进产品功能，提升创新能力与产品体验。

更新于 2025-10-23北京|上海|杭州

AI Business-AI 应用高级开发工程师/专家-杭州

社招3年以上技术类-开发

团队介绍：阿里国际以AI技术驱动，助力全球数字贸易及电商生态的发展。AlBusiness是阿里国际内部集大模型研究及智能化前沿产品研发于一体的AI部门，自研面向跨境商贸增强的多语言大模型-Marco和多模态大模型 -Ovis，依托全球化的AI基础设施和算力资源，帮助 AliExpress、Lazada、Alibaba国际站、Trendyol、 Daraz等平台全面革新跨境电商全链路的经营体验和商业效率。基于先进的大模型与工程技术，我们正在打造新一代的智能体（Agent）和智能引擎（Deep Search）产品，持续致力于让全球商业没有语言障碍，用智能帮助跨境贸易更加简单。职位描述 1. AI平台建设：负责AI应用平台的能力建设、架构设计和开发工作，推动平台技术的不断创新和优化。 2. RAG&多模态搜索能力：负责RAG、搜索工程架构相关平台能力建设 3. 大模型AI应用开发：深入电商业务及各职能场景，面向AI native范式，重构业务流程、产品能力和工作模式，显著提升业务效果和工作效率。

更新于 2025-12-29杭州

AI平台高级研发工程师（大模型平台方向）

社招3-5年后端开发

工作职责： 1、负责大模型平台的架构设计和核心功能研发，构建云原生架构，设计高可用、高性能的微服务体系； 2、负责构建面向大模型全流程的DevOps，与下游云原生平台深度融合，支撑大模型在公司内各业务生产链路稳定高效地落地； 3、负责万卡规模GPU集群效能分析及优化，通过调度策略优化、在离线混部、GPU虚拟化、存储&网络加速等手段，提升GPU集群使用效率； 4、将平台和框架结合，通过任务调度、弹性容灾、性能优化等措施端到端提升AI生产效率，涉及k8s/kubeflow、网络通信、分布式训练等； 5、优化各AI平台性能，提升系统稳定性和可扩展性，保障大规模并发场景下的服务质量与用户体验； 6、持续研究分析业内创新AI平台产品，优化技术方案，改进产品功能，提升创新能力与产品体验。

更新于 2025-11-07北京|上海|杭州