logo of liauto

理想汽车【基座模型】场景认知算法工程师

校招全职算法地点:北京状态:招聘

任职要求


任职要求
基本要求
1. 计算机、人工智能、自动化、电子信息等相关专业本科/硕士/博士。
2. 具备扎实的深度学习计算机视觉基础,理解常见感知模型与训练方法。
3. 熟练使用 Python,熟悉 PyTorch,具备良好的代码实现能力。
4. 理解 Transformer / Vision Transformer 等主流模型结构,对时序建模、多帧融合有一定理解。
5. 具备较强的实验能力,能够独立完成模型训练、结果分析和问题排查。
6. 对自动驾驶、复杂路口场景理解、多模态/VLA 方向有浓厚兴趣。
加分项
1. 有自动驾驶感知、红绿灯、路口场景、视频理解、时序建模等项目经历。
2. 有多模…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


岗位介绍
你将参与红绿灯及特殊场景方向 VLA 模型的研发与落地,面向真实自动驾驶量产问题,参与从模型设计、训练迭代到端侧部署、数据闭环的完整研发流程。你的工作将直接服务于复杂路口和特殊场景下的认知理解能力建设。

---
岗位职责
1. 参与红绿灯及特殊场景相关 VLA 模型的设计、训练与优化,包括时序建模、多帧融合、结构迭代等。
2. 参与完整训练 pipeline 搭建,包括数据预处理、模型训练、评测分析、仿真回灌和问题定位。
3. 参与消融实验设计,分析不同模型结构、时序方案和 loss 设计对效果的影响。
4. 参与车端部署联调、推理结果分析及精度对齐工作。
5. 参与众包影子回传数据分析、问题归因、评测集建设和标注规范优化。
6. 与测试、工程、数据等团队协同,支持复杂路口与特殊场景问题的闭环优化。

---
包括英文材料
深度学习+
OpenCV+
Python+
PyTorch+
还有更多 •••
相关职位

logo of meituan
实习核心本地商业-基

简介:下一代智能体将彻底打破“键盘与屏幕”的束缚,语音将成为人类与AI协作最自然、最高效的入口。这要求模型不仅能“听懂”字面意思,还要能感知语气、情绪与环境音,并基于这些多维度的语音信息直接进行思考、规划与行动。本课题聚焦于构建端到端(End-to-End)的语音原生大模型,并将其深度融入Agentic工作流,打造“边听、边想、边说、边做”的新一代语音智能体,推动AI从传统的“级联式语音助手(ASR+LLM+TTS)”走向具备极低延迟、全双工交互与复杂任务执行能力的真实世界数字伙伴。 具体地,我们关注如下研究方向: 1、端到端语音-语言统一建模与理解: 摒弃传统的级联架构,探索将连续的音频流(包含语音、副语言特征、环境音)与离散的文本Token在统一的自回归/非自回归架构下进行联合建模。使Agent能够无损保留语音中的情绪、重音、语速等声学特征,并在极低延迟下实现跨模态的深度语义理解。 2、实时全双工流式交互与动态响应: 研究面向真实对话场景的流式输入输出机制,攻克语音智能体在自然对话中的“听觉注意力”问题。探索支持随时打断(Interruption)、智能插话(Backchanneling)、端点检测(VAD)与即时状态切换的底层模型架构,实现媲美真人的丝滑对话节奏。 3、语音驱动的Agent规划与工具调用(Voice-to-Action): 探索如何将模糊、口语化、包含冗余信息的自然语音指令,直接转化为精准的Agent意图与工具调用(Tool Use/API Call)序列。研究语音模态下的长上下文记忆、多轮语音交互中的意图追踪,以及“边对话边执行任务”的并行处理能力。 4、面向语音Agent的高效对齐与强化学习: 探索适用于语音大模型的训练范式与对齐策略。包括但不限于:基于人类偏好的语音强化学习(RLHF for Audio)、语音交互轨迹的大规模构建、针对“对话自然度”与“任务完成率”的多目标奖励建模,以及基于环境反馈的语音Agent自进化机制。

更新于 2026-04-03北京|上海|深圳
logo of xiaohongshu
校招内容理解

本课题旨在探索构建一套“理解-生成-决策”三位一体的多模态统一大模型基座及智能体应用。 在底层基座构建上,重点构建理解与生成统一的图文交错混合模型:输入端实现多体裁内容(笔记、直播、商品等)的统一融合理解,输出端兼顾高质量表征提取、文本与图像生成。通过底层世界知识共享,消除多领域知识间的壁垒,并利用理解任务促进生成能力的提升。同时探索基于Multi-Head与MoE的轻量化微调及融合推理技术,在保证多场景下的效果前提下,压低训练和推理成本,实现降本增效。 在上层应用落地上,面向内容发布场景打造多模态创作Agent能力,通过基座模型的Agentic能力提升(意图识别、规划与工具调用),将分散的图像处理与创作工具统一封装,用户仅需以多模态方式自然表达需求,Agent即可自动完成任务拆解与执行,大幅降低使用门槛,全面重塑内容创作体系。

更新于 2026-07-01北京|上海|杭州
logo of liauto
社招智能与信息技术

1、负责视觉大模型基座架构优化、视觉编码器CLIP性能优化和视觉编码器训练(图像编码器和视频编码器); 2、负责CLIP模型小型化优化,包含模型蒸馏效果优化、端侧轻量化模型架构设计、模型裁剪和稀疏训练(结构化稀疏和非结构化稀疏)、对比学习训练调优等; 3、参与视觉大模型实际训练和项目落地,主导高效视觉编码器的架构设计和端侧推理性能优化。 4、负责部分图文对数据集生产和构建、模型评测等任务

北京
logo of liauto
社招3年以上智能与信息技术

岗位职责: 负责所驻片区的测试路线规划与设计,覆盖城市道路、高速、山区、隧道等多场景 执行软件迭代版本的实车路测,识别功能改进与性能退化问题 管理片区内路测外包团队,制定每日测试计划与路线排期 编写测试日报/周报,与研发团队对接问题分析与复现 跟踪相关法规标准变化,确保测试合规

重庆