
商汤大装置-GPU硬件服务工程师
任职要求
1. 本科及以上学历,计算机相关专业。
2. 熟悉 CPU 和 GPU 平台架构,熟悉 Nvidia 或国产 GPU/NPU 的软硬件生态;
3. 熟悉 GPU 服务器系统拓扑,熟悉 RoCE/IB/NVLink 等训练集群常见的通信协议以及网卡配置;
4. 对于硬件产品的交付以及结合项目做硬件设备清单和组网方案设计有系统性、完整性的经验;
5. 具备…工作职责
1. 负责 GPU 服务器的选型、准入测试和验收工作。 2. 分析 GPU 性能瓶颈并进行性能调优工作,定位并解决 GPU 和相关的硬件故障。 3. 负责构建稳定可靠的测试机制和测试系统,设计测试方案支撑上层业务系统。 4. 与产品研发团队协同配合,参与千卡/万卡集群互联的软硬件方案设计,解决新硬件和系统落地过程中的各类技术问题。 5. 持续跟进智算产业链的最新技术能力和硬件架构,设计出有竞争力的硬件解决方案,支持产品经理向客户输出硬件服务器的技术文档。 6. 结合 GPU 产品业务场景做成本和收益评估,确定技术方案以支撑算力迭代、资源折算、项目输出标准化方案制定等工作;

你将加入商汤科技大装置智能云事业群,协助交付项目经理推进 智能算力平台、云平台、私有化项目 的落地执行,参与企业级 AI 基础设施项目的全生命周期管理。 这是一个能够快速提升项目管理能力、了解云与智算行业、接触头部客户交付场景的实习机会。 岗位职责 1. 协助交付项目经理跟进项目进度:收集项目状态、整理任务列表、更新项目计划,推动事项闭环。 2. 参与交付流程文档工作:协助编写需求文档、实施方案、验收材料、会议纪要等交付文档。 3. 参与项目配置与交付准备工作:在项目经理指导下完成资源申请、环境准备、配置录入等基础交付操作。 4. 跨团队沟通支持:与研发、测试、售前、运维团队协作,推动信息同步与问题流转。 5. 项目运营与数据整理:协助收集并整理项目数据、风险清单、问题列表,为项目复盘提供输入。 6. 完成领导安排的其他交付支持相关工作。

系统设计与开发: 负责分布式系统的整体架构设计、模块划分及核心代码开发。 使用Go语言开发高质量、高可用的后台服务,确保系统性能、稳定性和可扩展性。 技术选型与实现: 根据项目需求进行技术选型,包括但不限于数据库(如MySQL、Redis、MongoDB等)、消息队列、缓存技术等。 实现系统间的接口对接和数据交互,确保数据一致性和系统间的高效协同。 性能优化与稳定性提升: 对系统进行性能分析,识别瓶颈并进行优化,提升系统处理能力和响应速度。 设计和实施高可用方案,确保系统在高并发、高负载情况下的稳定运行。 文档编写与代码维护: 编写详细的设计文档、开发文档和维护手册,确保团队成员能够理解和维护系统。 定期进行代码审查和重构,提升代码质量和可维护性。 团队协作与沟通: 与产品经理、前端工程师、测试工程师等团队成员紧密合作,确保项目按时交付。 参与技术分享和团队建设活动,提升团队整体技术水平。

你将参与构建和演进公司 MaaS 推理基础设施,支撑多模态大模型在多集群环境下的高效、稳定与低成本运行,具体包括: 1. 参与或主导 推理网关与核心服务 的设计与开发,支持多模态请求处理、流式推理、Micro-batch 调度等能力。 2. 参与 跨集群服务发现、健康检查与流量治理,提升推理系统的可用性与弹性。 3. 构建和优化 推理系统的可观测性能力,包括日志、指标、Tracing 以及基础成本与性能分析。 4. 针对 低延迟、高吞吐、高 GPU 利用率 等目标,参与系统性能优化与问题排查。 与算法、平台、硬件等团队协作,持续优化推理系统在性能、成本与稳定性上的整体表现。 5. 根据经验级别,逐步或直接承担 技术方案设计、系统演进决策、复盘与优化推动 等职责。 我们会根据候选人能力与经验,在具体职责深度和影响范围上进行匹配。