logo of aligenie

智能互联基础设施与稳定性工程-高级基础平台研发专家-文件系统存储方向

社招全职8年以上技术类-开发地点:北京 | 杭州状态:招聘

任职要求


1. 熟悉大语言模型、生成式AI模型的训练、推理的I/O 特性及对存储系统的需求。
2. 熟悉大数据系统、机器学习系统领域内业界主流的持久化存储及缓存系统,…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1. 研发针对各AI训推业务的缓存加速系统,充分利用HBM、NVMe SSD等计算集群的高速存储介质及RDMA通信带宽,提高AI训推计算效率与性能,为集团AI业务的端到端的io性能、稳定性负责。
2. 在持久化存储基础上,利用计算集群的存储介质建设统一的日志文件系统。
3. 通过对文件存储层进行完善,强化文件系统存储能力,改善存储空间和数据读写速度,推动提高计算效率与性能。
包括英文材料
机器学习+
缓存+
还有更多 •••
相关职位

logo of alibaba
社招8年以上技术类-开发

1. 研发针对各AI训推业务的缓存加速系统,充分利用HBM、NVMe SSD等计算集群的高速存储介质及RDMA通信带宽,提高AI训推计算效率与性能,为集团AI业务的端到端的io性能、稳定性负责。 2. 在持久化存储基础上,利用计算集群的存储介质建设统一的日志文件系统。 3. 通过对文件存储层进行完善,强化文件系统存储能力,改善存储空间和数据读写速度,推动提高计算效率与性能。

更新于 2026-05-20北京|杭州
logo of alibaba
社招2年以上技术类-开发

建设面向阿里集团各类 AI Agent 提供 MCP、Skills、Rules 以及 API 等开放能力生态的 AI 开放平台 1. 负责 AI 开放平台核心模块的设计、开发与维护,包括 MCP /Skills/API 服务开放、托管、性能优化以及相关研发链路和流程的建设 2. 参与打造高质量 AI 能力开放市场,负责各类开放能力质量扫描和智能筛选等能力的建设,提升在 AI Agent 中消费大量开放能力的效率 3. 参与开放平台系统架构优化,提升平台稳定性、安全性和可观测性,提升开放平台服务可靠性 4. 负责面向集团内部开发者和用户对于 AI 开放平台的需求对接、任务拆解以及落地实施。

更新于 2026-05-25杭州
logo of alibaba
社招5年以上技术类-运维

1、稳定性保障与体系建设:负责大模型服务平台及人工智能产品的稳定性保障工作,通过指标建设、预案设计、容量规划、监控完善、建立SOP等手段提升业务可用性与可靠性。 2、高并发流量治理:主导大规模分布式系统及高并发场景下的流量治理方案设计与实施,包括弹性扩缩容以及熔断、限流、降级等容灾策略,确保业务连续性与鲁棒性。 3、新环境部署:在新环境上进行一整套推理系统及其上下游依赖的部署和运维,负责日常模型的上架、性能监测、中间件和底层基建性能监测等。 4、Oncall与应急响应:参与OnCall值班,快速定位并解决生产环境故障,主导重大事件应急响应与复盘;建立故障快速恢复机制,推动根因分析及长效改进措施落地。 5、运维自动化:优化现有部署、监控及维护流程,推动运维自动化与平台化建设,提升研发效率与系统可观测性。负责监控/日志/网络/存储等原生基础设施的保障和工具开发。

更新于 2026-07-07北京|杭州
logo of aligenie
社招5年以上技术类-运维

1、稳定性保障与体系建设:负责大模型服务平台及人工智能产品的稳定性保障工作,通过指标建设、预案设计、容量规划、监控完善、建立SOP等手段提升业务可用性与可靠性。 2、高并发流量治理:主导大规模分布式系统及高并发场景下的流量治理方案设计与实施,包括弹性扩缩容以及熔断、限流、降级等容灾策略,确保业务连续性与鲁棒性。 3、新环境部署:在新环境上进行一整套推理系统及其上下游依赖的部署和运维,负责日常模型的上架、性能监测、中间件和底层基建性能监测等。 4、Oncall与应急响应:参与OnCall值班,快速定位并解决生产环境故障,主导重大事件应急响应与复盘;建立故障快速恢复机制,推动根因分析及长效改进措施落地。 5、运维自动化:优化现有部署、监控及维护流程,推动运维自动化与平台化建设,提升研发效率与系统可观测性。负责监控/日志/网络/存储等原生基础设施的保障和工具开发。

更新于 2026-06-09北京|杭州