logo of sensetime

商汤大装置-IaaS开发工程师(计算/存储/网络)

社招全职1-5年后端开发地点:北京 | 上海状态:招聘

任职要求


1. 计算机、软件工程、通信或相关专业,本科及以上学历,1~5年相关开发经验;
2. 熟悉Linux系统内核机制,具备扎实的计算机基础(操作系统、网络、存储等);
3. 熟悉以下至少一个技术领域:
· 虚拟化或容器技术(KVM、DockerK8sOpenStack、VirtIO、CNI等);
· 分布式存储系统(CephHDFS、GlusterFS、NVMe-oF等);
· 网络编程与优化(TCP/IP、RDMA、DPDK、eBPF、SDN、VLAN、ACL、BGP、ECMP、端口聚合等…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


【我们提供】
1. 参与商汤自研智算云平台的底层核心研发,直接支撑大模型训练与AI基础设施建设;
2. 面对百亿参数级模型和超大规模集群的技术挑战,积累独特的工程经验;
3. 优秀的工程文化与导师机制,快速成长为系统架构师或平台负责人;
4. 行业内具竞争力的薪酬与晋升发展通道。

【岗位关键词】
IaaS / 云计算 / 分布式系统 / 存储 / 网络 / 容器 / Kubernetes / Ceph / SDN / RDMA / DPDK / eBPF / OpenStack / 智算云 / AI基础设施

【岗位职责】
作为商汤科技智算云核心基础设施团队成员,您将参与构建和优化支撑大规模AI训练与推理的IaaS底层平台,打造高性能、高可靠的云计算基础能力。主要工作包括:
一、计算方向:
1. 负责虚拟化/容器化计算资源调度系统的设计与开发(KVM、Docker、Kubernetes、OpenStack等)。
2. 优化GPU/CPU混合集群的资源利用率、任务调度和性能隔离机制。
二、存储方向:
1. 参与高性能分布式存储系统(Ceph、HDFS、NVMe over Fabrics等)的研发与优化。
2. 负责对象存储、块存储的性能调优与稳定性保障。
三、网络方向:
1. 设计并开发高性能虚拟网络系统,支持大规模AI训练与推理流量场景。
2. 参与SDN、RDMA、DPDK、eBPF 等前沿网络技术的研发与落地。
3. 在物理网络与 Fabric 层,通过工程化与自动化方式支撑云网络平台能力。
持续推进系统性能优化与架构演进,支撑智算中心规模化运营。
包括英文材料
学历+
Linux+
内核+
Docker+
Kubernetes+
OpenStack+
Ceph+
HDFS+
网络编程+
TCP/IP+
eBPF+
还有更多 •••
相关职位

logo of sensetime
社招测试开发

大装置智能云,支撑从云基础设施到大模型服务的完整产品体系。 欢迎加入测试开发团队,与我们一起打造下一代 AI 基础设施质量标准。 参与商汤大装置智能云核心产品的质量保障,包括: 1. 云平台方向(Cloud) · 云服务、容器平台(K8s)、网络/存储服务的功能与稳定性测试 · 自动化测试、接口测试、性能测试、系统级测试 2. 算力平台方向(Compute) · 多集群 GPU/NPU 算力池、调度平台的测试开发 · 压测、稳定性测试、异常场景验证 3. 大模型平台方向(AI Infra / MaaS) · 大模型推理、训练、评估平台的测试 · 模型性能测试、多模态模型验证、推理链路端到端自动化 4. 测试自动化,CI/CD 方向 · 测试框架、测试工具开发 · CI/CD 构建链路优化与集成 我们会根据你的能力与兴趣匹配到最合适的产品线。

更新于 2025-12-10北京|杭州|上海
logo of sensetime
校招技术开发类

大装置智能云,支撑从云基础设施到大模型服务的完整产品体系。 欢迎加入测试开发团队,与我们一起打造下一代 AI 基础设施质量标准。 参与商汤大装置智能云核心产品的质量保障,包括: 1. 云平台方向(Cloud) · 云服务、容器平台(K8s)、网络/存储服务的功能与稳定性测试 · 自动化测试、接口测试、性能测试、系统级测试 2. 算力平台方向(Compute) · 多集群 GPU/NPU 算力池、调度平台的测试开发 · 压测、稳定性测试、异常场景验证 3. 大模型平台方向(AI Infra / MaaS) · 大模型推理、训练、评估平台的测试 · 模型性能测试、多模态模型验证、推理链路端到端自动化 4. 测试自动化,CI/CD 方向 · 测试框架、测试工具开发 · CI/CD 构建链路优化与集成 我们会根据你的能力与兴趣匹配到最合适的产品线。

更新于 2025-12-10北京|杭州|上海
logo of sensetime
社招3年以上系统研究

1. 设计和实现多租户高性能 SDN 控制模块,基于 IB 网络和 RDMA 通信协议,以实现高效、稳定的大模型训练数据交换。 2. 提出合理的设备选型和组网架构方案,确保网络的稳定性和可靠性。对于网络故障,进行排查和解决,保证网络的正常运行。 3. 根据业务场景开发云网络功能模块,优化高速网络的数据传输效率、降低相应时间,并提升运维管理能力。 4. 深入了解 NVIDIA QUANTUM 和 SPECTRUM 交换机以及 ConnectX 网卡的主要特性和功能原理,以便能够充分利用其性能优势。 5. 编写相关文档和测试用例,确保产品的质量和稳定性。与团队成员和其他相关部门进行有效的沟通和协作,推动项目的进展并达成目标。

更新于 2025-08-15北京|上海|深圳
logo of sensetime
社招1年以上Web前端开发

1. 负责商汤科技 AI 云平台的前端开发; 2. 与产品、后端,设计师团队协作,深度参与 AI 云产品的功能迭代与体验优化; 3. 能独立完成前端应用开发,包括但不限于 PC 端,小程序等。

更新于 2025-07-16北京