千问千问C端事业群-AI调度系统专家-杭州
任职要求
1、熟练掌握 Linux 环境下的 Go/C++/Python 等1至2种以上语言 2、熟悉 Kubernetes 架构和生态,或熟悉 Docker/Containerd 等容器技术,有丰富的云原生开发经验 3、掌握分布式系统原理,参与过大规模分布式系统的设计、开发和维护 4、优秀的逻辑分析能力,能够对业务逻辑进行合理的抽象和拆分,底层系统问题…
工作职责
1、面向通算的弹性、混部、分布式作业调度等技术的设计和研发,满足客户不同 SLA 的资源调度;高效解决AI场景下资源协调、碎片化、隔离与干扰等技术难题。 2、面向大规模、分布式的智算场景,设计实现大模型推理服务的多角色分离式编排调度、及时准确的弹性伸缩等,实现AI模型部署优化等平台能力。 3、通过画像建设、机器学习等,为调度系统提供更加智能的决策;在保障不同类型工作负载 SLA 前提下,尽可能提升硬件利用率。 4、负责多地多中心联邦调度建设,为客户提供多种异构资源、环境需求等,保障集群合理的分布、负载。
1、面向通算的弹性、混部、分布式作业调度等技术的设计和研发,满足客户不同 SLA 的资源调度;高效解决AI场景下资源协调、碎片化、隔离与干扰等技术难题; 2、面向大规模、分布式的智算场景,设计实现大模型推理服务的多角色分离式编排调度、及时准确的弹性伸缩等,实现AI模型部署优化等平台能力; 3、通过画像建设、机器学习等,为调度系统提供更加智能的决策;在保障不同类型工作负载 SLA 前提下,尽可能提升硬件利用率; 4、负责多地多中心联邦调度建设,为客户提供多种异构资源、环境需求等,保障集群合理的分布、负载。

1、面向通算的弹性、混部、分布式作业调度等技术的设计和研发,满足客户不同 SLA 的资源调度;高效解决AI场景下资源协调、碎片化、隔离与干扰等技术难题; 2、面向大规模、分布式的智算场景,设计实现大模型推理服务的多角色分离式编排调度、及时准确的弹性伸缩等,实现AI模型部署优化等平台能力; 3、通过画像建设、机器学习等,为调度系统提供更加智能的决策;在保障不同类型工作负载 SLA 前提下,尽可能提升硬件利用率; 4、负责多地多中心联邦调度建设,为客户提供多种异构资源、环境需求等,保障集群合理的分布、负载。

1、负责实现NPU以及SoC的任务管理和调度方案(包含软件和硬件); 2、与NPU架构师共同协作,定义下一代芯片的任务管理、资源管理的软硬件实现方案; 3、 与编译器与底软团队合作,定义软硬件接口; 4、 能够根据自动驾驶场景的时效性等特殊需求,实现整芯片以及多芯片的任务调度,以及相关的资源管理。
面向阿里集团提供高稳定、低成本、易使用的容器服务,通过业务弹性编排、资源额度弹性管理、多等级资源调度和混合部署、运筹优化的全局资源规整和排布、异常检测和诊断自愈等,支持业务便捷、高效使用集团全局智算和通算资源,并保障不同等级不同场景的业务服务slo。 1. 负责智算和通算资源的统一管理和统一调度等集群管理、基础调度、容器与混部等相关技术和系统研发; 2. 负责交易导购类、搜推广引擎类、大模型AI类、大数据类、数据库类和中间件类等业务的应用编排和弹性调度托管; 3. 负责基础资源监控、基础资源数据、异常检测和诊断自愈、研发质量和稳定性等DevOps&AIOPS相关基础平台研发; 4. 负责计算、存储、网络、机房和业务布局等云原生基础设施规划演进,持续降低基础设施成本,并屏蔽底层基础设施差异。