logo of aliyun

阿里云阿里云智能-AI开发平台研发专家-数据工程方向

社招全职5年以上云智能集团地点:北京 | 杭州状态:招聘

任职要求


【必备项】
1、热爱编程,熟悉掌握但不限于JAVA/Python/GO等编程语言中的一种或几种,有良好的编程习惯;
2、熟悉网络编程多线程编程,对TCP/IP,HTTP等网络协议有一定的理解,并了解XML和HTML语言;
3、熟悉Unix/Linux/Win32环境下编程,熟练使用调试工具,熟悉K8S/Docker等云原生工具;
4、深入了解AI大数据引擎和数据基础…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


负责AIPlatform数据工程平台研发,包括:
1.参与PB级大规模非结构化数据管理系统的设计和实现。
2.参与面向多模态的CPU+GPU高性能分布式计算引擎的设计和实现。
3.参与高质量的数据处理算子研发,包括CPU+GPU算子的调优、迭代。
4.参与产品的开发和维护,完成从需求到设计、开发和上线等整个项目周期内的工作。
包括英文材料
Java+
Python+
Go+
编程规范+
网络编程+
多线程+
TCP/IP+
还有更多 •••
相关职位

logo of aliyun
社招5年以上云智能集团

负责AIPlatform数据工程平台研发,包括: 1.参与PB级大规模非结构化数据管理系统的设计和实现。 2.参与面向多模态的CPU+GPU高性能分布式计算引擎的设计和实现。 3.参与高质量的数据处理算子研发,包括CPU+GPU算子的调优、迭代。 4.参与产品的开发和维护,完成从需求到设计、开发和上线等整个项目周期内的工作。

更新于 2026-03-23北京|杭州
logo of aliyun
社招5年以上云智能集团

1、参与AI开发平台的功能规划、设计与研发,重点围绕模型训练领域,通过云原生的资源调度,提供任务建模、可视化建模、交互式建模相关的平台能力; 2、参与到模型的微调、量化、强化学习相关的平台能力建设,为客户提供高效的Post-Training能力; 3、面向大规模、分布式的模型训练场景,提供可观测能力和上下游故障诊断能力,通过检查点+弹性训练+智能调度的组合,将模型训练故障中断时间压缩到分钟级,保障模型训练过程的性能和稳定性。

更新于 2025-12-14北京|杭州
logo of aliyun
社招3年以上云智能集团

1. 参与大模型推理系统的架构设计与开发,包括推理网关、请求调度、流量路由等核心模块的建设 2. 负责推理引擎(vLLM/SGLang等)的深度优化与定制化开发,提升推理吞吐与延迟表现 3. 参与PD分离(Prefill-Decode)架构的设计与开发,优化Prefill与Decode阶段的资源分配与协同调度 4. 负责KV Cache存储与管理系统开发,包括KV Cache迁移、共享、淘汰策略的设计与实现 5. 参与模型分发系统开发,支持大模型在多节点间的高效分发与加载 6. 基于线上监控与用户反馈,持续优化推理链路的性能、稳定性与成本效率

更新于 2026-07-09北京|杭州
logo of sdo
社招3年以上软件开发

1、结合大模型(LLM)能力,探索并实现AI驱动的新一代数据开发治理平台(包括数据分析、数据开发、数据运维、数据治理等); 2、负责大模型智能Agent的架构设计、核心模块开发与迭代优化,支撑复杂业务场景下的自主决策与多步执行能力,推动大数据平台朝AI-ready&AI-Native方向演进; 3、设计并优化高并发、高可用的数据平台架构,涉及多任务类型开发、大规模任务调度、超大规模数据治理等 4、关注业界大数据开发工具和AI赋能技术的最新进展,推动相关技术在团队内的落地与实践。

更新于 2026-07-02上海