logo of pinduoduo

拼多多资深大数据离线存储方向研发工程师/专家

社招全职技术类地点:上海状态:招聘

任职要求


1. 扎实的计算机理论和编程基础,熟悉常见的分布式理论和系统,熟悉JVMLinux;
2. 对Hadoop生态组件熟悉,在大数据计算和存储相关领域有相关研发经验并有产品落地;
3. 具备…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


针对数据仓库、搜索、推荐、机器学习等场景,优化大数据分布式存储系统的性能和成本,提供跨地域可横向扩展的能力,构建元数据系统,提供业务自动化迁移能力。
1. 优化大数据分布式存储系统(HDFS, etc.)的效能,使用多层次存储、EC编码等手段降低运营成本,利用操作系统层缓存、内存、NVME等设备优化存储系统的读写性能,提高上层应用的效率;
2. 开发大数据分布式存储系统(HDFS, etc.)的跨地域方案,利用有限的带宽和资源实现对用户透明、一致性的使用体验,保障存储系统多地域的可横向扩展性;
3. 开发描述大数据分布式存储的元数据系统,建立全局统一的目录树结构,简化上层应用与底层存储的交互,实现可横向扩展的元数据系统,并提供业务透明的自动化迁移能力,降低运维成本。
包括英文材料
JVM+
Linux+
还有更多 •••
相关职位

logo of bilibili
社招5年以上技术类

一、离线计算方向(Spark / 向量化执行引擎) 1、跟踪 Spark / MapReduce / 向量化执行引擎(Gluten / Velox / Photon / DuckDB)的社区前沿,结合 bilibili 业务做选型和落地 2、主导 Spark 引擎在 PB 级日处理、千节点集群下的稳定性、性能优化,包括但不限于: (1)Catalyst 优化器改造 (2)Shuffle 优化(Remote Shuffle Service / Celeborn / Magnet) (3)AQE / Dynamic Allocation / Spec Execution 深度调优 3、推动 Spark 与向量化引擎(Gluten + Velox)的深度集成,降低 CPU 成本、提升查询性能 4、解决批处理任务的资源效率、SQL 兼容性、调度延迟等真实工程问题 5、与湖仓团队配合,做好 Spark on Iceberg / Paimon 的查询和写入优化 二、AI 赋能基础设施研发 1、熟练使用 Claude Code、Cursor、Copilot 等 AI 编程工具,将 AI 深度嵌入日常工作流 2、主导 AI 流程自动化建设,为团队赋能: (1)开发阶段:基于 AI 的代码生成、Code Review、单测生成、性能 profiling 自动化 (2)发布阶段:AI 辅助的变更影响分析、灰度策略推荐、回滚决策 (3)运维阶段:AI 驱动的告警归并、根因分析、故障自愈 (4)答疑阶段:基于内部知识库的 RAG 答疑机器人、SQL 助手、调优建议生成 3、沉淀 AI 工具链最佳实践,推广到全组并向外辐射

更新于 2026-07-01上海
logo of pinduoduo
社招技术类

1. 负责⼤数据资源调度系统YARN 的设计和研发⼯作,解决集群规模增⻓带来的技术挑战,提⾼集群稳定性、可扩展性,深度优化资源调度策略和性能,提升资源利⽤效率; 2. 负责 公司在离线混部系统 的设计和研发⼯作,解决混部场景下,在离线资源复⽤、协调、隔离等问题,保证业务稳定性,提升在离线集群的资源利⽤效率; 3. 深⼊理解系统软硬件特性,关注线上运⾏状态,分析和解决线上问题,推动业务需求的解决⽅案落地。

更新于 2026-06-16上海
logo of pinduoduo
社招技术类

1.负责大数据开发平台的设计与研发,包括开发IDE、任务调度、监控运维、元数据管理、adhoc查询等; 2.完善平台功能,优化用户使用体验; 3.负责线上问题的排查和解决,持续优化和提高系统能力。

更新于 2026-06-16上海
logo of pinduoduo
社招技术类

1. 负责大数据平台相关系统的运维保障,包括:HDFS/Yarn/Hive/Tez/Mapreduce/Kerberos/Ranger等开源系统; 2. 负责分布式业务平台的架构审核、应急响应、容量规划、性能优化等。

更新于 2026-06-16上海