logo of alibaba

阿里巴巴数据技术及产品部-大模型数据平台研发工程师/专家-AIData

社招全职5年以上技术类-开发地点:北京 | 杭州状态:招聘

任职要求


1. 硕士及以上学历,计算机、人工智能等专业优先,优秀者条件可适当放宽。
2. 具备平台或大数据研发经验,精通JavaPython中至少一种,工程质量与系统设计能力扎实。
3. 具备分布式、微服务与存储/检索系统实践:熟悉ElasticSearch/Lucene或向量检索引擎(Faiss/Milvus/HNSW等),了解相关性调优、召回与排序;熟悉鉴权体系(OAuth/STS/RAM)、任务调度与API/SDK设计。
4. 熟悉数据湖与大数据栈:ODPS/MaxCompute、OSS、Hudi/Iceb…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1. 负责大模型数据平台的整体架构设计与演进,围绕数据的统一管理、检索发现、洞察分析与安全流通构建平台化能力,支撑大模型研发数据的高效、稳定供给。
2. 主导数据检索、预览与数据集组织等核心能力的产品化建设,把算法与业务的用数诉求抽象为通用、易用、自动化的平台服务,持续提升数据的可发现性与可用性。
3. 建设面向数据资产的洞察与追踪体系,实现数据底库、质量与全生命周期流转的可视化、可观测与可度量,为数据价值评估与决策提供支撑。
4. 推动平台与研发全链路的开放集成,通过标准化服务与接口对内对外赋能,提升团队整体的用数效率与协同水平。
包括英文材料
学历+
大数据+
Java+
Python+
系统设计+
微服务+
信息检索+
ElasticSearch+
Lucene+
Faiss+
Milvus+
还有更多 •••
相关职位

logo of alibaba
社招2年以上技术类-开发

1. 负责面向LLM、图片、视频、音频的全模态标注能力建设和 Coding/Agentic 领域标注能力完善。 2. 负责标注平台智能标注能力建设,如LLM、多模态自动标注等,并建设基于标注平台的agent框架以及相关标注agent的开发; 3. 负责面向领域专家的专家标注平台建设,同时把智能标注能力迁移至专家标注平台。

更新于 2026-06-10杭州
logo of alibaba
社招3年以上运营-商业伙伴运

1. 数据标注、模型评测、数据采集、数据生产的资源管理体系搭建与优化:构建并完善数据生态资源管理体系,统筹管理多种资源形态。通过精细化管理策略,提升资源交付的整体质量和效率,确保资源管理的标准化与规范化。 2. 供应商全生命周期管理:负责外部供应商的资源拓展、准入管理、资源调度、交付履约及结算等工作。对供应商在项目中出现的问题和事故进行及时干预与处理,确保项目顺利推进。建立完善的供应商绩效管理制度,通过科学的评估体系优化供应商合作,提升整体合作质量。 3. 多元化资源管理与高效调度机制构建:构建多元化的资源管理结构,整合多种用工类型与垂直领域专家资源。设计高效、合理的资源分配调度机制,精准匹配项目需求与资源供给,确保资源供给的及时性与有效性,提升资源利用效率。 4. 资源交付与运营效率提升:通过商务策略优化、流程再造及产品设计创新,不断提升资源交付及运营效率,降低整体业务交付成本。推动资源管理的智能化与自动化升级,助力公司在数据标注领域保持竞争优势,实现业务的可持续发展。

更新于 2026-06-08北京|杭州
logo of alibaba
社招5年以上技术类-数据

1.主导EB级海量全模态(文本/图像/视频/音频3D等)AI数据处理平台的规划,负责高性能、可扩展的数据处理架构设计; 2. 负责AI数据资产体系构建与AI数据资产规划,推动数据、算法、工程及产品等多团队协作,实现AI全模态数据标准化、流程化及资产化,加速AI数据在基模和AI应用之间效能转化; 3. 主导核心数据处理算子(清洗、加工、转换、融合)的研发与工程化落地,并构建高效的流程编排与执行引擎,支持百亿级数据在异构卡型上快速自动化处理; 4. 负责全域EB级检索引擎的架构设计与实现,包括多模态检索、内容检索与RAG(检索增强生成)等,并持续进行性能与效果优化; 5. 关注并引领AI数据处理领域的新技术、新架构、新工具,积极推动平台技术升级和平台开放,推动团队在AI数据处理能力提升和内部技术分享。

更新于 2026-05-22杭州
logo of alibaba
社招5年以上技术类-开发

1、负责多模态数据处理链路的推理优化,分析性能瓶颈,软硬件结合优化,实现包括语言识别、计算机视觉等多方向的推理优化,达到极致性能; 2、负责多模态数据处理链路的可观测性工具建设,包括数据处理、模型推理的监控、告警等; 3、负责异构资源(GPU、CPU等硬件)的调度优化,实现潮汐资源、混部资源、多云资源的最优化调度 4、负责集群和业务服务的稳定性治理、资源利用率提升,通过系统化方式提高GPU、CPU等硬件资源的使用效率。 5、参与设计高吞吐、低延迟的数据处理 pipeline。针对大模型数据处理场景(如LLM、多模态),优化数据清洗、预取、缓存及异步加载策略,确保数据大规模产出。

更新于 2026-07-13北京|杭州