深度求索超算集群研发工程师
任职要求
1.扎实的计算机体系结构基础:深刻理解计算机组成、操作系统、计算机网络等核心原理。你需要从硬件微架构、访存子系统到片上和网络互联架构,从数理逻辑到进程指令再到操作系统执行,能够系统性地思考和定位计算规模大幅提升后带来的性能优化与复杂性问题。 2.熟悉 C / C++ / Rust / Python 之一,具备优秀的设计能力、极强的动手和工程能力以及代码质量意识。 3.对分布式系统有深刻理解与实践经验,如熟悉分布式任务调度与资源编排,或能设计高性能、高可用的系统架构。 4.对性能优化有较高热情,发自内心地想要跑满所有计算资源,榨干每一份算力。 5.良好的中文沟通能力和团队协作能力。 【加分项】 以下为加分项,不强制要求,我们非常欢迎有扎实系统基础和强烈学习意愿的同学加入: 1.熟悉容器运行时(cgroup、namespace 等)与容器编排系统(Kubernetes 等)的底层实现原理,理解资源隔离、调度(sched_ext)与 QoS 等机制。 2.精通 RDMA 编程及 RoCEv2 / InfiniBand 网络架构,深入理解拥塞控制、多路径、自适应路由等机制,具备大规模 RDMA 网络排障与调优…
工作职责
【团队使命】 在 AI 时代,超算集群就是把电力转换为智能的引擎。它是通向 AGI 的坚实底座。 从万卡集群去往数十万卡的路上,丛生着系统复杂度的荆棘。我们的目标,是跑满所有计算资源,榨干每一份算力。这牵涉着异构算力的调度权衡、全系统栈的性能调优、超大规模网络的互联承载,以此探索下一代集群的更优架构。 每一层设计都需要我们从第一性原理出发,重新审视,重新思考。让每一瓦电力都尽可能多地转换为有效算力,让每一次模型训练和推理都扎根于极致高效的算力底座之上。 【岗位类别】:实习/全职 你将根据团队目标和个人专长,参与以下关键领域中的一个或多个方向的架构设计与工程实现: 1.设计并实现大规模异构计算资源的调度系统,解决 CPU/GPU/NPU 等计算资源的抽象、池化与拓扑感知调度。持续优化调度算法,在任务吞吐、排队延迟和资源利用率之间取得均衡。 2.开发集群管理系统,覆盖任务和节点生命周期管理、日志采集和召回、关键性能数据收集与可视化、故障发现与自动容灾,以及新硬件、新软件栈的导入与适配。 3.从集群视角进行端到端系统性能调优,覆盖 CPU/GPU/NPU 计算任务优化、Linux 内核、I/O 和网络协议栈等,构建集群可观测性体系,主导大规模训练下的故障诊断、性能回归和全链路排障。分析大规模并行系统中的性能抖动、长尾延迟以及性能不均等系统性瓶颈,支撑所有同事更高效地使用集群。 4.AI 超算集群网络的拓扑设计、路由策略、多路径负载均衡和拥塞控制,深入研究 RDMA(RoCEv2 / InfiniBand)协议栈,与通信算子、存储团队配合,提供来自高性能网络的最优底层支撑。 5.参与新一代超算集群的架构规划与建设,探索和评估 GPU、国产 AI 加速器、网卡、以及新兴硬件,与 IDC 数据中心团队配合,以集群架构需求驱动数据中心的规划、建设与交付。
1. 负责AI超算集群中前沿服务器、加速卡等基础设施的日常运维工作,包括巡检、维修、故障定位与生命周期管理,缩短平均故障恢复时间(MTTR),保障集群持续稳定运行。 2. 负责新一代计算资源的快速交付与上线,完成节点的基线检查与性能验证工作,确保资源能够高质量高性能投入生产。 3. 负责建设和优化面向AI超算集群的监控、告警与可观测性体系,实现集群健康状态的实时感知。 4. 构建自动化运维工具链,提升故障自愈率与运维效率,降低人工干预成本。

岗位亮点: • 参与万卡超算集群、多云、多集群环境的 AI 平台研发,支持大规模模型训练与推理任务。 • 接触前沿技术:GPU/AI 加速、分布式训练、云原生调度、容器化、分布式存储。 • 学习机会丰富,可快速成长为训练/推理、调度或资产管理方向的核心研发工程师。 • 参与超算平台核心模块研发与优化,包括训练、推理、作业调度及 AI 资产管理。 • 学习并实践高性能计算、分布式系统和大规模数据处理技术。 • 支持平台稳定运行,协助性能调优和多集群资源管理。 • 与团队紧密协作,快速迭代产品和技术方案。

岗位亮点: • 参与万卡超算集群、多云、多集群环境下大规模 AI 模型训练与推理性能优化。 • 聚焦 PyTorch 框架性能优化,包括算子加速、DataLoader 异步加载、混合精度训练和端到端训练流水线调优。 • 快速成长为深度学习训练性能优化、分布式训练和高性能计算方向的核心人才。 • 优化 PyTorch 模型训练与推理性能,包括算子级优化、GPU/CPU 调度、内存和 I/O 管理。 • 分析训练/推理流程中的性能瓶颈,提出优化方案并实现,提升吞吐量和资源利用率。 • 支持多云、多集群环境下大规模训练任务,保证平台高性能和高可用性。 • 与训练平台研发团队和算法团队协作,优化端到端训练/推理流水线。
1.负责LLM RL、Agentic RL强化学习训练框架的设计、开发与性能优化,支撑大规模 RL算法(如 PPO、DQN、GRPO等)的高效落地; 2.构建分布式训练体系,优化训推异步、partial rollout、数据并行、模型并行、Replay Buffer分布式存储与调度策略,提升GPU 利用率与训练吞吐; 3.设计并实现 RL 训练全流程工具链:包括环境封装、数据预处理、模型版本管理、训练日志监控、指标可视化(TensorBoard/Weights & Biases)等; 4.解决 RL 训练中的工程瓶颈:如样本传输延迟、GPU 显存溢出、训练稳定性(梯度爆炸/消失)等问题,提供工程化解决方案; 5.与 RL 算法团队紧密协作,理解算法需求,迭代基础设施,适配多场景的训练需求; 6.跟进强化学习与分布式训练领域的前沿技术(如 VERL、rllm、Agentlightning、Ray、Megatron-LM等),并落地到实际系统中。