阿里巴巴数据打标平台-研发实习生
任职要求
任职要求 1.计算机、软件工程或相关专业本科大三及以上 / 硕士在读,2027 届及之后毕业。 2.扎实的代码基础:掌握数据结构、算法、网络、操作系统等计算机基础知识;在 Java / Python / JS 等至少一种主流编程语言上有较深入的实践经验(课程作业、个人项目、开源贡献、实习经历、竞赛作品均可);了解常用中间件(缓存、消息队列、数据库等)的基本使用。 3.AI 使用能力(硬性要求):对 AI 工具有真实、日常的使用习惯,而非仅停留在概念层面——熟练使用大模型对话工具(通义 / ChatGPT / Claude 等)辅助学习、查资料、写代码、写文档;能用 Coding Agent(Qoder / Cursor / Claude Code 等)独立完成小工具、脚本、Web Demo 或个人项目…
工作职责
团队介绍 数据打标平台承载阿里语音智能多模态数据生产链路,面向多业务方收集 / 提供大模型语料、语音 / 文本 / 图像 / 视频等数据的标注、质检、交付与结算能力,对接专业标注供应商组织,覆盖二十余个语种与方言。团队规模精简、节奏明快,实习生会作为正式研发同学的搭档,参与真实业务模块的设计与落地,而非仅做辅助性工作。 岗位职责 1.参与数据打标平台核心链路(任务分发、数据标注、多轮验收、质量管控、数据投递、结算对账等)中若干模块的方案设计、编码与联调,独立 owning 一到两个可交付的子模块。 2.参与平台性能、稳定性、可观测性相关的排查与优化工作,协助日常线上问题定位与修复,逐步理解业务。 3.在日常研发中积极使用 Coding Agent、大模型对话工具等 AI 工具辅助编码、调试与文档撰写,并把好用的 Prompt、工作流沉淀为团队可复用的资产。

负责 Hadoop、Spark、Hive、HBase、Presto、Flink、ClickHouse 等大数据集群的规划、部署与算力调优,保障集群 7×24 小时稳定运行。 负责集群日常运维、性能调优、容量规划、故障排查与问题根治,保障服务达成 SLA 指标。 负责大数据开源组件二次封装、功能迭代与漏洞修复,搭建通用工具与服务,赋能数据平台建设。 为数据分析团队提供底层技术支撑,协助解决平台使用过程中各类复杂技术问题。算机、软件工程、数学等相关专业,本科及以上学历,拥有 3 年及以上大数据研发相关工作经验。 具备中大型集群(PB 级数据量或 50~100 节点规模)整体规划、搭建与优化实战经验。 有 Hadoop、Spark、Hive、Presto 等开源框架源码修改、二次开发经验者优先。 精通 Hadoop、Spark、Hive、HBase、Presto、Flink、ClickHouse 等主流大数据生态组件。 熟练使用 Java、Python、Shell 进行开发,精通 HiveSQL 性能调优。 可独立完成需求分析、技术选型,能够设计高可用、高可扩展的大数据解决方案。 具备钻研精神与自驱力,沟通表达良好,拥有较强的抗压能力及集群应急处置能力。 具备 AI 开发能力,熟练使用主流 AI 编程提效工具(如 Codex、CodeCopilot 等)。 拥有大数据场景下大模型 Agent 设计、开发及项目落地经验者优先。 了解或掌握机器学习算法底层原理者优先。 ## Key Responsibilities * Design, deploy, optimize, and maintain large-scale big data clusters based on technologies such as Hadoop, Spark, Hive, HBase, Presto, Flink, and ClickHouse. * Ensure 24×7 stability, reliability, and performance of production data platforms through proactive monitoring, capacity planning, and performance tuning. * Troubleshoot complex system issues, conduct root cause analysis, and implement long-term solutions to meet SLA requirements. * Develop and enhance internal platform capabilities through customization, secondary development, feature enhancements, and bug fixes of open-source big data components. * Build reusable tools, frameworks, and platform services to improve engineering efficiency and support data platform evolution. * Provide technical guidance and infrastructure support for data analysts, data engineers, and business teams, helping resolve complex platform-related challenges. * Participate in architecture design, technology evaluation, and best-practice establishment for enterprise-scale data platforms. ##
岗位职责: 1.使用各类数据挖掘技术及机器学习算法以及大模型等前沿技术,基于海量多模态行为数据,构建完整的用户画像与兴趣建模体系,精准刻画用户行为。 2.结合对业务理解,深入挖掘数据价值,将业务问题转化为可建模的算法问题并推动在业务场景下应用,拿到业务结果。 3.深入思考产品业务价值,参与制定及落实团队在技术、业务等多维度发展方向。 4.深入理解食杂零售餐饮供应链业务逻辑和运营模式,与业务、产品、工程、数据等团队紧密协同,完成从业务问题到算法问题的抽象与定义,设计指标体系,进行算法技术选型和方案设计实现,推动落地应用。
1、数据处理 (100) 1. 负责行业、市场、竞品及公司经营相关数据的搜集、清洗、整理与汇总,维护数据台账。 2. 协助完成日常数据统计、核对、复盘,输出标准化数据报表,排查数据异常问题。 3. 协助整理行业资讯、政策、案例资料,配合撰写、校对战略分析及部门各类报告。 4. 负责部门数据、文档资料的归档整理,配合完成战略专项项目辅助工作。