影石数据平台开发实习生
任职要求
计算机、软件工程、数据科学、人工智能等相关专业 扎实的编程基础,熟悉 Python(必须) 了解数据湖 / 数仓 / 数据平台概念,接触过 Iceberg / Hive / Delta Lake / HDFS / S3 等 对 AI / 机器学习 / 深度学习训练流程有基本理解 熟悉 Linux 基本操作,具备良好的工程习惯 加分项: …
工作职责
你将参与 AI 训练相关的数据平台与工程体系建设,具体包括但不限于: 参与构建和维护 AI 训练数据集,包括设计与实现数据集的采集、清洗、版本管理、元数据管理,支持训练集 / 验证集 / 测试集的划分与追踪 参与基于数据湖的数据管理方案,编写 Spark / Python 任务进行数据 ETL、特征抽取、统计分析 参与训练日志、指标、数据漂移等基础监控能力的建设 协助构建训练 pipeline,与算法、标注、模型训练同学协作,提升整体训练效率
1、负责数据闭环核心链路建设,开发数据清洗、标注质检等工具,支撑算法团队快速定位模型错误案例; 2、构建大规模数据索引系统,打通模型评测与数据筛选链路,设计主动学习、影子模式数据回传机制,推动数据飞轮高效迭代; 3、负责数据采集、清洗、转换全链路性能优化,解决数据传输、内存等瓶颈,搭建高吞吐、低延迟分布式系统; 4、搭建企业级数据管理平台,实现数据版本控制、血缘追踪、快速检索等能力,服务全公司算法数据需求; 5、开发数据可视化分析工具,支撑数据分布分析与场景盲区识别,以数据驱动模型迭代。
1、协助大数据平台的开发与维护,包括数据采集、开发和任务调度; 2、参与数据迁移与验证,支持双跑校验与差异分析; 3、编写与优化 SQL 及 Java 作业,提升数据处理效率与质量; 4、协助日常运维,进行数据监控、排查和文档整理。

加入自动驾驶数据平台团队,聚焦模型训练性能优化、训练数据集管理、训练框架工程化,参与大规模自动驾驶 / 大模型训练链路建设,解决真实业务中的 IO 瓶颈、训练加速、数据管理等工程问题。 1.训练性能与链路优化 参与分布式训练调优,优化显存 / 内存占用、通信效率与数据流水线;攻坚数据解码、加载、增强等预处理环节性能,结合 CPU/GPU 异构计算提升整体训练吞吐。 2.大规模训练数据集管理 参与自动驾驶数据集版本管理、质量校验与分发;优化 Lance、WebDataset、LMDB 等数据读取链路,解决分布式训练 I/O 瓶颈,保障海量训练数据高效流转。 3.训练框架维护与自动化建设 协助内部训练框架迭代维护,保障训练稳定性;参与训练流程模块化、自动化改造,配合搭建训练任务 CI/CD、性能度量与数据监控体系。 4.系统问题排查与专项优化 协助定位训练过程 OOM、卡死、通信异常等问题,参与内存、性能 Profiling 等专项优化,提升框架可维护性。