logo of tongyi

通义Token Foundry-大模型训练Infra工程师-容器Infra方向

社招全职1年以上技术类-开发地点:北京 | 深圳 | 上海状态:招聘

任职要求


1. 计算机、软件工程等相关专业本科及以上学历,2 年以上容器、云原生或大规模基础设施研发经验。
2. 熟练掌握 Go 语言,具备扎实的 Linux 系统基础(网络栈、文件系统、cgroups、进程管理),有复杂分布式系统的调试与问题定位能力。
3. 对 Kubernetes 架构有深入理解,熟悉 Controller / Operator / Scheduler 扩展开发与 CRD / API 扩展机制,有自定义调度器或控制器研发经验;了解容器 Runtime(containerd / CRI)原理。
4. 具备以下至少一个方向的深度实践经验:
	a. 大规模 GPU 调度与资源效率(拓扑感知…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1. 基于开源 Kubernetes 构建面向大模型训练的容器化基础设施增强能力,研发 GPU 拓扑感知调度、Gang 调度、资源碎片治理与利用率提升,保障千卡 / 万卡级作业的快速拉起与高吞吐运行。
2. 研发面向训练作业的任务编排与作业管理能力(作业生命周期管理、作业全链路追踪等自定义控制器),支撑预训练、RL、评测多场景任务的可靠调度与快速恢复。
3. 建设训练算力的资源效率体系,负责容量规划、资源配额预分配与预检、按水位的动态分配 / 变更 / 释放,治理任务间资源争抢,并解决跨集群 Checkpoint 迁移等人工低效问题。
4. 建设训练镜像加速(镜像构建、分层与压缩、按需加载、P2P、Region 级缓存与预热)与容器存储 / 网络优化能力,缩短作业启动与数据加载时延。
5. 负责多集群、多算力池的接入与弹性对接(AI 算力池对接、GPU 多地域弹性),建设环境工程(跨域网络、环境交付、可用性巡检),沉淀可复用平台能力与自动化运维。
包括英文材料
学历+
Go+
Linux+
分布式系统+
还有更多 •••
相关职位

logo of tongyi
社招1年以上技术类-开发

1. 建设超大规模训练的稳定性治理体系,围绕有效训练时长(ETTR)与 Goodput 做端到端度量与优化,量化并持续压缩因故障、回滚、启动带来的无效算力(Badput)。 2. 构建覆盖软硬件异常的故障可观测能力,完善日志、指标、事件的采集与关联分析;研发智能诊断能力,实现训练 slow / hang / OOM / 通信异常等故障的快速定界与根因追溯,沉淀故障模式库与自动诊断规则。 3. 研发自动容错与快速恢复机制,支持断点续训、Pod 级快速重启、节点自动自愈、动态降级与局部重试;优化 failover、本地盘 / 缓存与 Checkpoint 恢复链路,缩短故障恢复时延。 4. 建设节点健康度评估与主动巡检体系,覆盖 GPU、网络、存储等软硬件健康,实现故障节点的快速隔离与自愈;支持 Ray 等分布式框架下的作业级故障感知与处理。 5. 与算法及框架团队协同保障训练全生命周期稳定交付,沉淀可复用的稳定性平台能力,推动变更灰度与自动化运维。

更新于 2026-08-04北京|深圳|杭州
logo of tongyi
社招3年以上技术类-开发

● 负责主流深度学习框架在Token Foundry大模型场景下的工程优化,包括但不局限于MoE模型大规模训练框架、多模态训练框架、RLHF训练框架等,参与包括基模型Pretrain、SFT等多个阶段的训练任务优化; ● 致力于提升不同阶段模型训练负载的极限吞吐,能够针对不同模型负载系统化的分析不同阶段耗时并提供相应的优化手段,优化手段包括但不局限于算子优化、通信优化、分布式策略优化等; ● 负责超大规模训练任务的稳定性的设计,通过各种手段来提升训练任务的有效吞吐,构建更可靠的故障检测系统和自愈系统,提供超大规模训练任务的丝滑体验。

更新于 2026-07-31北京|杭州|上海
logo of aligenie
社招1年以上技术类-算法

千问(Qwen)是由阿里巴巴研发的超大规模语言模型,具备跨语言、跨任务的理解与生成能力。Qwen系列模型,涵盖参数量从几百 M 到 T 级的基座大语言模型,并相继推出Qwen-VL、Qwen-Audio、Qwen-Omni、Qwen-Coder、Qwen-Image等系列模型。从多轮对话到代码生成,从逻辑推理到内容创作,从单一多模态到全模态统一理解生成,Qwen 正在打造全球领先的全模态模型技术体系,推动AI在企业服务、开发者生态、个人用户等领域的深度应用,引领下一代人工智能的发展。 我们期望打造世界一流的预训练 LLM 基座,开发涵盖参数量从几百M到T级的基座模型,并将作为 Qwen / QwenVL / Qwen-Omni / Qwen-Coder 等系列模型的基座。我们追求将现有的预训练技术做到极致,并积极探索下一代的预训练技术。 工作职责: 1. 预训练数据:大规模预训练数据合成技术探索、STEM & reasoning 优化、长尾知识优化、精品数据挖掘过滤、自然数据 scaling、长文本优化、面向 test-time scaling 的数据优化。 2. 预训练策略:新型预训练损失函数探索、遗忘对抗与持续学习、optimizer 优化、lr scheduler 优化、课程学习、scaling law 预测、超参优化。 3. 模型结构:新型模型结构探索、模型可解释性、MoE 优化、参数扩展与裁剪蒸馏、线性注意力、动态稀疏注意力、draft model 优化、动态计算优化、KV cache压缩、长序列优化、decoding 加速等。

更新于 2026-06-18北京|杭州|上海
logo of tongyi
社招5年以上

1. 深度参与或主导沙箱平台的整体技术架构设计, 定义系统分层、模块边界和核心接口规范,构建支撑大模型后训练与 AI Agent 两大场景的统一沙箱基础设施,牵引团队技术方向。 2. 深度参与或主导大规模资源调度与弹性架构设计, 规划万级并发沙箱实例的调度策略、资源池化方案和容量模型,在极端突发场景下保障系统稳定性与资源利用率。 3. 推动训练侧与推理侧沙箱的架构统一与平台化, 抽象共性能力,降低各业务方的接入成本。 4. 深度参与跨团队技术协同, 与大模型训练框架、推理引擎、算法、安全等团队对齐需求和技术方案,从基础设施视角定义沙箱的 SLA 和能力边界。 5. 建立技术前瞻性, 持续跟踪业界安全容器、轻量虚拟化、Agent 执行框架等领域的技术趋势,主导关键技术选型和架构迭代。

更新于 2026-06-22北京|深圳|杭州