logo of kuaishou

快手容器调度&大模型推理AI-Infra研发工程师

社招全职3-5年J0012地点:北京 | 杭州状态:招聘

任职要求


1、本科及以上学历,计算机相关专业背景,具有快速学习的能力,愿意不断突破技术瓶颈,乐于探索未知领域;
2、具备扎实的数据结构和代码算法基本功,有强烈的责任心和创新意识,熟练掌握至少一门编程(Golang、…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1、负责快手容器云超大规模算力平台的架构设计与开发工作,包括但不限于资源调度、服务编排及容器引擎等多领域场景;
2、基于云原生技术完善海量异构资源的多集群联邦和统一调度能力,构建低成本、高弹性的计算、存储、网络算力基座,致力于持续提升资源效率;
3、参与完善服务微架构及性能瓶颈分析观测体系,深入支撑容器平台及快手各类业务的全链路稳定性问题,持续提升业务运行质量;
4、云原生及大模型推理场景AI-Infra领域前沿技术,提升大规模的推理场景GPU利用效率。
包括英文材料
学历+
数据结构+
算法+
还有更多 •••
相关职位

logo of xiaohongshu
社招3年以上后端开发

1.负责公司容器应用编排与调度平台的架构设计和核心功能开发,包括容器工作负载、资源管理、调度优化、弹性伸缩、GPU设备调度、任务调度等模块。 2.负责云原生工作负载编排能力的建设,包括大规模在线应用、分布式PD分离推理服务的分批发布、原地升级、批量灰度发布等能力;与集群联邦、调度器、公司内各个业务平台充分协同工作,确保在复杂场景下的工作负载编排调度策略具备高可用性和可扩展性。 3.设计和实现在线服务、离线应用、大数据任务的混部调度方案,优化集群资源的整体利用率,实现计算、存储和网络资源的高效调度。 4.针对不同业务场景,研究并改进 Kubernetes 调度算法,包括任务排队、优先级、抢占机制、节点选择等,提升集群的资源分配效率和稳定性。 5.跟踪云原生生态的最新发展趋势,研究并应用新技术以提升系统性能和调度灵活性。 6.支持系统的性能监控与故障诊断,参与系统优化和技术问题的快速解决,保障系统的高效稳定运行。

更新于 2026-07-19上海|北京|杭州
logo of futu
社招3年以上技术类

1. 负责容器环境(如 Kubernetes、Docker)的日常运维工作,包括安装、配置、升级、扩容、性能优化、基础镜像构建等 2. 负责容器平台的监控、应急响应,及时定位和解决常规故障,保障业务高可用 3. 建立并完善容器运维流程,包括上线、变更、回滚策略,定期组织应急演练,不断提升平台稳定性 4. 协助设计和落地容器化最佳实践,持续优化部署流程和资源使用效率

更新于 2026-03-27深圳
logo of ly
社招5年以上

1. 负责公司容器与云原生平台的整体技术规划与架构设计 主导 Kubernetes 平台的整体架构设计、演进路线和技术选型 构建稳定、高可用、可扩展的容器运行时与调度平台,支撑核心业务系统 2. 建设和优化容器基础设施能力 深度参与 Kubernetes 核心组件(Scheduler、Controller、CRI、CNI、CSI 等)的定制、调优与问题排查 设计并落地多集群、多可用区、混合云、多云架构 提升集群稳定性、资源利用率与调度效率(弹性伸缩、资源超卖、QoS、潮汐调度等) 3. 打造云原生平台化能力 建设容器平台的 PaaS / 内部平台能力(应用发布、灰度发布、弹性伸缩、服务治理等) 推动 GitOps、声明式交付、自动化运维体系建设 与 CI/CD、服务网格、可观测性体系(Metrics、Logs、Tracing)深度集成 4. 复杂问题处理与稳定性保障 负责容器平台重大故障的技术分析、定位与治理方案 建立平台级 SLO / SLA、容量规划、稳定性与风险评估体系 优化平台在大规模业务、高并发场景下的性能与可靠性 5. 技术影响力与团队建设 负责容器团队的技术方向把控、技术评审与技术债治理 指导和培养高级工程师,提升团队整体技术深度 推动云原生最佳实践在公司内部的落地与规范化

更新于 2026-01-06北京
logo of baidu
社招3年以上ACG

-负责云手机容器技术选型、调优和业务落地 -负责Linux内核研发 -负责Android虚拟化技术研发 -负责Linux/aosp系统性能优化

更新于 2026-01-09广州