阿里云阿里云智能-服务器研发业务解决方案专家-深圳/杭州
社招全职5年以上云智能集团地点:深圳 | 杭州状态:招聘
任职要求
1. 熟悉服务器产品系统级应用和解决方案以及周边关键部件和产品能力,对数据敏感,具备良好的数据的量化和分析能力。5年以上硬件架构设计、产品管理、软件架构设计、系统测试等相关领域工作经验。 2. 对于问题的识别、优先级分配见解有影响力,…
登录查看完整任职要求
微信扫码,1秒登录
工作职责
1. 技术规划和落地:负责硬件产品技术规划,主导包括系统方案/架构/配置及工业化设计、硬件核心技术创新,并深入到供应商的研发端,审核、监督设计过程,提前管理设计的需求匹配性及质量风险;持续跟踪软硬件相关领域的技术发展趋势,深入业务场景规划和推动新技术的规划和落地。 2. 架构与解决方案设计:针对阿里大规模服务器或网络应用场景的需求分析,负责端到端的服务器软硬件架构规划、网络软硬件架构规划及整体产品解决方案(包含但不限于芯片,存储,计算,网络等),输出市场需求书MRD,产品需求书PRD,产品规格书等关键文档。制定合理的产品生命周期规划,做从需求分析到EOL的全生命周期管理。及时跟踪业界动态,针对性进行相关竞品分析和信息收集,保障解决方案的先进性。 3. 持续优化:分析业务整体逻辑/业务软件实现等,结合系统软硬件能力提出针对性的解决方案/研发项目。对业务软件进行性能分析,结合系统软硬件适配调优,优化业务性能瓶颈。
包括英文材料
系统设计+
https://roadmap.sh/system-design
Everything you need to know about designing large scale systems.
https://www.youtube.com/watch?v=F2FmTdLtb_4
This complete system design tutorial covers scalability, reliability, data handling, and high-level architecture with clear explanations, real-world examples, and practical strategies.
相关职位
社招3-5年引擎
1. 参与下一代高性能参数服务器(Parameter Server)的架构设计、核心模块开发与持续迭代,以满足大规模稀疏模型在线推理的超低延迟、高吞吐需求。 2. 深入优化参数服务器的通信框架(如BRPC、RDMA)、存储引擎(HBM、MEM、SSD分层存储)、并发模型和负载均衡策略,解决海量参数同步中的瓶颈问题。 3. 与算法团队紧密合作,理解前沿模型(如大语言模型、推荐系统、多模态模型)对训推基础设施的需求,并将其转化为系统级的创新与优化; 4. 跟踪业界前沿技术,探索其在参数服务器中的落地场景,推动平台技术演进。
更新于 2026-07-09上海|北京
社招5年以上云智能集团
1、参与视觉生成/多模态模型(包括文本、图像、视频生成等)在 GPU、ASIC、FPGA 等异构硬件上的推理/后训练加速开发与软硬件结合的性能优化工作,包括但不限于模型量化、attention优化、显存优化、编译优化、计算与通信优化、内存管理以及多卡或多设备的并行推理方案等; 2、在主流深度学习框架(如 PyTorch)基础上,基于GPU/xPU硬件特点,对关键算子进行软硬件结合优化,提升模型运行效率; 3、与硬件以及算法工程师紧密配合,共同优化整体推理速度与资源占用; 4、跟踪学术界与工业界前沿技术(如扩散模型优化、VAE并行优化、AI编解码、面向机器的编解码等),推动软硬件协同创新。
更新于 2026-07-27北京|深圳
社招5年以上云智能集团
1. 负责智能网卡的网卡驱动和固件的研发交付以及问题定位; 2. 负责智能网卡在AI智算,存储等领域软硬件结合优化,创新研究; 3. 通过智能网卡的软硬件创新与优化,帮助阿里云智算基础设施持续提升技术竞争力。
更新于 2026-03-23深圳|杭州