
地平线智能驾驶数据平台开发工程师
任职要求
计算机相关专业本科及以上学历,3年以上后端或数据平台开发经验 精通Python/Golang/C++开发,有大型分布式系统实战经验 熟悉以下技术领域至少两个方向: 大数据处理:Spark/Flink/Kafka等组件的开发与调优 分布式存储:HDFS/HBase/对象存储等系统应用 微服务架构:高并发服务设计、容器化部署及运维 数据仓库:ETL开发、维度建…
工作职责
负责自动驾驶数据平台全链路开发,包括数据采集、存储计算、服务接口及后台系统建设 设计和开发高可用分布式数据服务,处理PB级自动驾驶数据,优化数据读写与计算性能 构建数据平台核心后台系统,开发任务调度、API服务、权限管理等基础模块 实现实时/离线数据处理管道,保障多源异构数据的高效流转与可靠存储 开发数据治理相关系统,包括数据质量监控、元数据管理、异常告警等功能 持续优化平台稳定性,设计容灾方案与自动化运维体系

加入自动驾驶数据平台团队,聚焦模型训练性能优化、训练数据集管理、训练框架工程化,参与大规模自动驾驶 / 大模型训练链路建设,解决真实业务中的 IO 瓶颈、训练加速、数据管理等工程问题。 1.训练性能与链路优化 参与分布式训练调优,优化显存 / 内存占用、通信效率与数据流水线;攻坚数据解码、加载、增强等预处理环节性能,结合 CPU/GPU 异构计算提升整体训练吞吐。 2.大规模训练数据集管理 参与自动驾驶数据集版本管理、质量校验与分发;优化 Lance、WebDataset、LMDB 等数据读取链路,解决分布式训练 I/O 瓶颈,保障海量训练数据高效流转。 3.训练框架维护与自动化建设 协助内部训练框架迭代维护,保障训练稳定性;参与训练流程模块化、自动化改造,配合搭建训练任务 CI/CD、性能度量与数据监控体系。 4.系统问题排查与专项优化 协助定位训练过程 OOM、卡死、通信异常等问题,参与内存、性能 Profiling 等专项优化,提升框架可维护性。

1、负责自动驾驶数据检索系统,研究进行图像打标、视频打标、近邻检索、语义检索等方式,能够快速对训练数据进行查询和匹配;2、负责自动化标注过程中的Dag设计,各任务模块所需的自动化标注算法设计,支撑包括不限于车道线、路面标志等静态要素,人车等动态要素的高效标注;3、与自动驾驶数据闭环系统中的其他环节紧密配合,提升挖掘及标注效率与质量,降低标注成本,加速数据闭环

1、实现仿真与实车数据处理脚本和分析pipeline,包括仿真评测报告解析、路测 MPI 报告解析等。 2、使用仿真可靠性评估方法和工具,输出版本差异和不一致问题的量化结果。 3、搭建和维护版本对比报表与一致性监控 dashboard,对安全/速度/居中/偏航等核心指标进行日常监控和异常检测。 4、进行常规的数据探索、可视化和报表制作,将复杂分析结果转化为 算法 / 仿真 / QA 容易理解的图表和结论。 5、协助数据科学家检查场景标签质量、数据分布,参与场景分类体系和指标体系的落地与验证。 6、参与优化仿真报告和路测报告的字段结构和统计口径,落实到脚本和报表规范中。

1、设计与构建自动驾驶系统的仿真与实车评估体系,建立可量化的性能、效率、安全、驾驶行为等核心指标。 2、基于真实道路数据与仿真数据,开发和优化评估指标(包括基于规则与基于模型的指标),确保能够准确衡量驾驶行为、合规性、舒适性和鲁棒性。 3、运用统计学方法(假设检验、敏感度分析、分布分析等)验证指标在大规模数据下的可靠性、稳定性与区分能力。 4、主导仿真与实车表现差异(仿真实车一致性)的分析工作,设计实验、构建对比框架,给出性能不一致时的根因判断与改进建议。 5、与感知、预测、规划控制、仿真、测试等跨团队合作,推动数据驱动的迭代与优化策略,提升整体系统性能评测能力。 6、开发高质量的数据分析工具、算法验证脚本与可复用的评估框架,将复杂评估过程自动化与工程化。 7、对仿真与实车的复杂驾驶日志进行深入分析,结合交通规则和驾驶行为理解,提出针对性的改进方向与评估方法。 8、参与构建并维护系统级的评测看板或指标监控体系,确保关键指标在版本更新中保持可控、可解释和可追踪。