深度求索IT 基础设施团队
任职要求
1.扎实的技术功底,在硬件架构(CPU/GPU/ 存储 / 网络互联)或网络技术(路由协议、RDMA、数通)中至少一个方向有深入理解或有强烈兴趣,能从实现细节角度分析和解决问题。 2.熟悉 Python 或 Go,能独立开发压测、配置管理、自动化运维等工具;具备数据建模能力。 3.强烈的好奇心与求知欲,主动跟踪技术前沿,对每一个细节都有打破砂锅的冲劲。 4.良好的沟通协调能力,能在多团队协作、高压环境下稳定决策与执行。 【加分项】(不强制,欢迎有热情的白纸同学) 1.有大规模 GPU 集群(NVIDIA/Ascend)运维或压测经验。 2.熟悉 Redfish/IPMI;有 Rust 开发经验。 3.了解硬件底层规范与实现,包括 ACPI、OpenBMC、BIOS/UEFI、PCIe、I2C/I3C 等,能从固件或总线层面分析和定位问题。 4.有跨地域容灾与 DCI 项目经验,熟悉双活、灾备切换等关键设计。 5.有 RDMA 生产环境调优经验,或网络自动化平台开发经验…
工作职责
【团队使命】 大模型训练能不能跑满带宽,取决于我们的网络配置;GPU 集群能不能发挥出纸面性能,取决于我们的固件和压测基线;新员工第一天能不能顺畅开工,取决于我们的流程有没有提前打通。 我们不写模型,但我们决定模型能跑多快。我们不写业务代码,但我们决定代码能不能顺利部署。基础设施不是背景板 —— 它是上限。 从单块 GPU 的固件参数,到跨地域万卡集群的网络拓扑;从数据中心的 RDMA 链路,到每个工位的网络接入和设备交付 —— 我们负责让每一层硬件、网络和办公环境在真实负载下稳定运行。 我们不满足于 "能用"。硬件方向,我们追求接近物理极限的性能与可靠性,每一个配置参数都要有理由,每一次变更都要有基线对比;桌面方向,我们追求零摩擦的使用体验,让每一个人都能在第一时间拿到可用的工具,专注于本职工作。 两个方向,同一个标准:每一层都不成为瓶颈。 招聘方向【实习/全职】:系统硬件&网络方向、IT 桌面&信息化方向 系统硬件 & 网络方向 硬件方向 1.探索业界最新硬件(GPU、CPU、SSD、网卡、服务器等),深入研究其实现细节,从技术第一性原理出发为选型和技术路线提供决策支持。 2.建立硬件配置管理体系(品牌→型号→固件→参数),开发配置比对与自动下发工具,实现异构硬件的统一纳管。 3.设计并维护通用硬件基准压测框架(覆盖 GPU、NVMe、内存、网络等),集成 fio、iperf3、gpu-burn 等工具或自研引擎,输出标准化性能报告;在上架、固件升级等变更后自动执行压测并与基线对比。 4.快速响应集群故障,实施应急处置,保障 AI 训练与推理任务的连续性。 网络方向 1.精通 OSPF、BGP、VXLAN、VPN 等核心数通技术,独立设计、优化和排障大规模路由域,降低故障爆炸半径。 2.负责跨地域、多数据中心互联架构的设计与运维,落地主备切换、双活、流量牵引与故障隔离方案。 3.深入 InfiniBand、RoCE v2 等 RDMA 技术,负责超算网络的全生命周期运维与持续优化。 4.建设覆盖物理层到 RDMA 层的全栈监控与可观测性体系,推动网络自动化运维(配置管理、变更校验、故障自愈)。
职位概述: 我们正在寻找一位对系统稳定性和高可用性有着极致追求的高级运维工程师。您将成为我们电商及资讯平台基础设施的“守护者”,核心职责是确保生产环境7x24小时高可用,并高效管理从故障发现到恢复的全生命周期。您需要具备深厚的技术功底、冷静的应急心态和强大的复盘能力,通过自动化、流程化和系统化的方法,不断提升我们系统的韧性与可观测性,为亿万用户的顺畅体验保驾护航。 核心职责: 1. 系统高可用性保障: o 负责公司核心业务(电商、资讯)生产环境及基础设施(服务器、网络、数据库、中间件等)的稳定运行,确保服务SLA达到或超过既定目标(如99.99%)。 o 设计、实施和维护高可用和容灾架构,包括同城双活、异地灾备等方案的落地与演练。 2. 监控与应急响应: o 主导建设和优化集中式监控、日志分析与告警系统(如Prometheus/Grafana, ELK, Zabbix, Datadog等),确保能提前预警、快速发现问题。 o 作为主要事故处理指挥官(Incident Commander),负责7x24小时应急响应,领导并协调相关团队对线上事故进行快速定位、止损和恢复,最大限度降低影响。 3. 事故全生命周期管理: o 严格遵循ITIL等最佳实践,管理事故(Incident)和处理工单(Ticket)。 o 主导重大事故复盘(Post-mortem),编写详尽的复盘报告,深入分析根因,并推动落实改进措施(如代码修复、流程优化、架构调整等),避免同类问题重复发生。 4. 运维自动化与效率提升: o 通过编写脚本(Shell/Python/Go等)和利用自动化工具(Ansible/Terraform等),自动化日常运维操作和故障处理流程,提升效率,减少人为失误。 o 践行SRE(Site Reliability Engineering)理念,通过代码管理基础设施(IaC)。 5. 容量规划与性能优化: o 定期进行系统容量评估和规划,确保系统有能力应对业务增长和突发流量(如大促活动)。 o 分析系统性能瓶颈,协同开发团队进行调优,提升系统效率和资源利用率。 6. 系统组件的安全升级及维护: o 常规维护能力:具备使用安全扫描工具进行安全漏洞扫描额能力。 能全程跟进系统组件安全管理,做好版本监控、漏洞扫描与风险评估,按计划升级部署补丁、更新配置,快速应对突发安全事件,降低业务受影响程度。 o 借助工具强化能力:熟练使用安全卫士等工具,将其融入维护流程。实现自动化漏洞检测与修复建议输出,实时监控异常与潜在威胁并预警阻断,利用日志分析优化安全策略,构建闭环安全管理体系。
1. 承担公司大规模算力集群的建设与交付,负责 GPU/XPU 等高性能加速卡资源的统一管理,支持大模型训练、在线推理、搜索、推荐等核心业务的稳定运行; 2. 熟悉主流 GPU 训练平台及分布式训练框架,了解 PyTorch、DeepSpeed、Megatron-LM 等在大规模集群中的训练特性,同时熟悉公有云上的云原生 GPU 训练平台(如 AWS、Azure、GCP、阿里云、火山引擎等)的调度、资源管理与训练流程; 3. 能够监控大规模 GPU 资源的使用情况,建立使用基线与性能指标体系,持续分析利用率、稳定性与异常模式,为资源规划、调度优化和容量管理提供依据; 4. 参与算力平台及相关服务的整体架构设计与生命周期管理,从规划、评审到部署上线,推动生产集群向更高稳定性与可持续性演进。

一、核心使命 以技术为核心驱动力,制定并落地公司 IT 中长期战略,统筹 IT 架构、运维、安全、数据、数字化项目等全领域工作,保障 IT 系统稳定高效运行,推动技术与业务深度融合,提升组织运营效率与核心竞争力。 二、工作职责 IT 战略与规划 结合公司发展战略,制定 IT 中长期规划(3-5 年)与年度计划,明确技术路线图、资源投入预算及落地里程碑; 主导技术架构顶层设计,统筹云原生、大数据、人工智能等新技术选型与应用,搭建灵活可扩展的企业级 IT 架构; 评估技术趋势与行业标杆实践,推动技术创新与场景落地(如数字化转型、业务流程自动化等),为业务增长提供技术支撑。 全链路 IT 管理 统筹 IT 基础设施(服务器、网络、存储、云资源等)的规划、部署、运维与优化,保障核心业务系统稳定运行; 主导信息安全体系建设,制定数据安全、网络安全、合规管理等制度与流程,防范网络攻击、数据泄露等风险,确保符合行业监管要求(如等保、GDPR 等); 统筹数字化项目全生命周期管理(需求调研、立项、开发、测试、上线、迭代),协调跨部门资源,确保项目按时、按质、按预算交付; 负责 IT 资产(硬件、软件、授权)全生命周期管理,优化 IT 资源分配,控制 IT 运营成本,提升投入产出比。 团队与组织建设 搭建 IT 团队组织架构,负责核心人才招聘、培养、激励与梯队建设,提升团队技术能力与执行力; 建立 IT 部门绩效考核、工作流程与协作机制,推动跨部门(业务、财务、人力等)技术协同,提升组织运营效率; 塑造技术驱动、创新进取的团队文化,推动知识沉淀与技术分享。 风险与合规管控 建立 IT 风险预警与应急响应机制,制定灾备方案并定期演练,快速处置系统故障、安全事件等突发问题; 统筹 IT 合规管理,确保 IT 系统、数据处理、技术采购等符合国家法律法规及公司内部制度要求; 定期向管理层汇报 IT 工作进展、风险状况及优化建议,为决策提供数据支撑。
• 全周期项目管理:全面负责海外数据中心IT基础设施的部署工作,对项目的进度、成本与质量负责。 • 战略协同与资源整合:作为关键枢纽,与容量规划、网络、工程、运营、采购、供应链及财务等多团队伙伴紧密合作,确保项目顺利交付。 • 供应商与风险管控:管理多家供应商,全程跟踪项目进展,精准识别风险并有效解决问题。 • 流程优化与效率提升:主导全球化项目管理流程的标准化倡议,改进部署方法论以优化项目周期,并通过推动软件自动化等手段,识别并消除流程中的缺陷与冗余。 职位亮点: • 全球视野,核心项目:主导阿里云海外数据中心IT基础设施的从0到1部署,打造全球领先的云计算基石。 • 跨界协作,驱动创新:与规划、网络、工程、供应链、财务等多部门紧密协同,整合资源确保项目成功交付。 • 挑战自我,卓越成长:负责制定和优化全球项目管理的标准化流程,通过技术创新提升效率,应对快节奏、高要求的挑战。