小米数据闭环算法实习生
任职要求
1. 自然语言处理、计算机视觉、人工智能相关领域的硕士及以上学历; 2. 计算机基础扎实,熟悉数据结构与算法; 3. 有较强的学习能力、沟通能力、解决问题的能力; 4. 具有大语言模型、多模态大模型、生成式模型、世界模型等算法背景; 5. 具备扎实的研发功底,有在机器学…
工作职责
1.负责数据闭环相关业务的开发; 2.负责研发和微调云端大模型、用于实际的数据业务需求; 3.跟踪最新的自动驾驶、视觉语言大模型相关前沿技术,并进行技术调研;
1. 负责面向真机 Benchmark 和数据闭环的算法数据工程建设,承接端上设备、数据闭环平台、仿真引擎和评测系统回传的数据。 2. 负责多源数据接入、清洗转换、格式标准化、质量检查、元数据管理、样本加工和训练 / 评测数据组织。 3. 负责面向算法迭代的数据资产建设,包括样本挖掘、失败样本归因、Benchmark 数据集管理、指标统计和版本对比。 4. 负责将稳定的数据处理、样本构建、误差分析和问题归因能力封装为 Tools / API / Agent 可调用工具。
1. 负责面向真机 Benchmark 和数据闭环场景的 Agent 应用算法与工程落地,支撑问题诊断、评测判断、任务决策、工具调用和结果回流等关键场景。 2. 负责建设 Agent Harness,支撑工具调用、Context / Memory 管理、任务编排、多 Agent 协同、运行观测、人工复核和结果回流。 3. 负责构建 Agent / Harness 端到端评测能力,围绕 Grader、Advisor、工具调用正确率、多步任务成功率等指标持续优化 Agent 表现。 4. 负责或参与基于闭环运行数据、人工反馈和评测结果构建训练与评测数据,支持 Agent 相关模型的微调、强化学习、蒸馏、评测和推理优化。 5. 与平台、数据工具链、仿真引擎、算法和产品团队协同,推动模型能力、工具策略和 Harness 机制在实际闭环流程中协同优化。

1、数据闭环体系搭建与落地:负责自动驾驶全链路数据闭环体系设计与搭建,日均处理亿级传感器原始数据及标注数据,保障数据从采集、处理到模型训练的端到端流转,支撑感知、决策规划等端到端模型的高效训练; 2、数据闭环工具链研发: 2.1 云端数据处理 pipeline 开发: •针对标注数据、场景数据,设计并落地数据清洗(去噪、去重、异常过滤)、解析、切片、抽帧、送标(对接标注平台)的全流程自动化 pipeline; •优化 pipeline 吞吐量与延迟,目标支撑日均 10 万 + 场景数据处理,服务算法团队数据生产需求; •推动工具链部署落地,解决线上运行故障(如数据阻塞、接口兼容问题),保障工具链可用性。 2.2 高价值场景数据挖掘体系建设: •搭建 “规则 + 大模型” 双驱动的数据挖掘产线:针对规则挖掘,设计接入多种传感器、定位、感知、底盘、车身信号并优化规则策略;针对大模型挖掘任务,完成数据方案制定、模型微调、loss优化、模型评测等; •与算法团队协作迭代挖掘策略,提升 corner case 召回率(目标≥85%)。