滴滴自动驾驶-数据闭环工程师(J250626019)
任职要求
1)计算机科学,电子工程,自动化工程,软件工程等相关专业的本科或硕士学位获得者; 2)熟悉Linux开发环境,良好的系统编程、数据结构、算法基础、系统设计能力; 3)熟练掌握Python 和 C++,具备优秀的编码能力和扎实的软件工程基础(设计模式、代码重构、单元测试); 4)熟悉至少一种工作流编排与调度框架(如 Apache Airflow, Kubeflow Pipelines, MLflow Projects),能设计模块化、可监控、可…
工作职责
深入理解自动驾驶算法逻辑,负责数据闭环系统架构与开发,设计并实现高效可扩展的数据闭环平台,覆盖数据挖掘、数据标注、数据集管理、模型训练评估和部署全链路,以支持模型开发: 1)搭建面向自动驾驶大模型的数据生产系统,涵盖数据清洗、增强、合成与标注全流程; 2)构建数据版本管理与回溯系统,实现数据集迭代过程的可追踪性,满足模型训练合规要求; 3)负责自动化标注与数据流水线,构建与迭代自动化、半自动化标注工具链(如大模型预标注、人机协同标注),提升数据产出的效率与质量; 4)与算法工程师及AI基础架构团队紧密合作,建设相关平台工具,提升自动驾驶模型的迭代效率和效果。
职位描述: 1)设计并实现高并发、高可用的数据标注平台后端架构,支持图像、点云、视频等多模态自动驾驶数据的标注需求; 2)搭建标注数据存储与治理系统,保障大规模标注数据(PB级)的安全存储与高效检索; 3)搭建面向自动驾驶大模型的数据生产系统,涵盖数据清洗、增强、合成与标注全流程; 4)构建数据版本管理与回溯系统,实现数据集迭代过程的可追踪性,满足模型训练合规要求;
-负责自动驾驶数据全链路数据流构建,完成数据闭环下的AI Infra系统构建,包含挖掘相关框架、标注、数据管道、分布式训练、模型评测、推理和部署全链路的建设 -负责数据闭环系统稳定性和效率建设,对数据飞轮落地有想法和落地路径 -负责面向AI Infra 的数据存储系统建设,了解高吞吐下的Infra 框架设计 -负责面向大模型时代的工程架构优化工作,对各业务进行对接和合理化评估,针对现行系统中各种问题进行分析优化,给出设计优化方案并实现

1、数据闭环体系搭建与落地:负责自动驾驶全链路数据闭环体系设计与搭建,日均处理亿级传感器原始数据及标注数据,保障数据从采集、处理到模型训练的端到端流转,支撑感知、决策规划等端到端模型的高效训练; 2、数据闭环工具链研发: 2.1 云端数据处理 pipeline 开发: •针对标注数据、场景数据,设计并落地数据清洗(去噪、去重、异常过滤)、解析、切片、抽帧、送标(对接标注平台)的全流程自动化 pipeline; •优化 pipeline 吞吐量与延迟,目标支撑日均 10 万 + 场景数据处理,服务算法团队数据生产需求; •推动工具链部署落地,解决线上运行故障(如数据阻塞、接口兼容问题),保障工具链可用性。 2.2 高价值场景数据挖掘体系建设: •搭建 “规则 + 大模型” 双驱动的数据挖掘产线:针对规则挖掘,设计接入多种传感器、定位、感知、底盘、车身信号并优化规则策略;针对大模型挖掘任务,完成数据方案制定、模型微调、loss优化、模型评测等; •与算法团队协作迭代挖掘策略,提升 corner case 召回率(目标≥85%)。

1、核心引擎开发:使用 C++ 开发高性能、低延迟的实时数据筛选引擎; 2、ROS2 集成:基于 ROS2 框架,开发节点 (Node) 以订阅(Subscribe)来自不同传感器和自动驾驶模块的 Topic 数据流; 3、筛选规则设计:设计并实现灵活、可配置的筛选器规则系统,能够基于多源数据(如目标检测结果、车道线信息、车辆状态等)进行复杂逻辑判断; 4、低代码脚本桥接:负责 C++ 引擎与低代码脚本的无缝桥接,使算法工程师或数据科学家能够通过编写脚本来定义和动态加载筛选触发逻辑,实现 “代码即规则” 的灵活模式; 5、触发与录制:实现筛选器的触发机制,当满足预设规则时,精确触发并控制数据录制模块,只保存有价值的关键数据片段; 6、系统优化:持续优化系统性能,包括 CPU 占用率、内存使用和数据处理延迟,确保在嵌入式环境下稳定可靠运行; 7、调试与测试:进行单元测试、集成测试和现场调试,解决开发和部署过程中的技术问题; 8、文档编写:编写清晰、规范的技术设计文档、API 文档和用户手册。