理想汽车智能体强化算法实习生
任职要求
1. 人工智能、机器学习、计算机科学、应用数学相关专业硕士及以上学历; 2. 在强化方向有深入研究: -强化方向熟悉 GRPO/GSPO/GDPO/Dr.GRPO等不同算法 -熟悉基座模型Qwen/GLM系列等,了解Dense/MoE架构在强化训练中的异同 -熟悉智能体架…
工作职责
面向智能化软件工程、研发智能体等高价值业务场景,预研和落地 AI4SE 核心技术,岗位职责包括但不限于: 1. 聚焦强化和智能体强化相关技术研究以及工程化落地,包括模型设计、智能体建模与训练、训练效率效果优化等; 2. 跟踪最新的 AI 技术发展趋势和行业动态,积极探索并引入新的 AI 工具和技术,为团队的技术创新提供思路与方案,持续提升团队的技术竞争力; 3. 跟踪学术界和工业界最新进展,快速应用到业务中,提出创新技术,发表高水平论文。
1. 基座增强:探索大模型垂直领域知识高效增强方法,包括数据策略、训练策略以及scaling law友好的训练方法,打造适配实际应用所需的基座能力; 2. 多模态端到端:实现语音与文本模态的深度融合与统一建模,打造高效、轻量的端到端多模态系统,从而有助于更全面、多维度地理解语音与文本,提供更强的智能以及更智能的交互模式; 3. 深度推理:突破大模型在复杂逻辑推理、因果推断、多步决策、沟通技巧等大模型基础通用能力,提升模型解决开放式问题的能力; 4. 结合大模型,研发对话交互场景的大模型Agent,支持智能客服、销售、数据分析、C端助理等项目,通过预训练、微调、强化学习等全链路的技术实践,实现类人的理解和执行能力,提升美团服务能力和效率; 5. 不断探索技术新领域,推动技术能力的沉淀和技术氛围的建设。
1.作为研究者,探索有效的 Agentic Workflow 和 Agentic Memory 设计来解决代码领域的问题; 2.主要关注比SFT泛化效果更好的强化学习;能结合实际用户需求、产生的用户数据、agent的实现细节,调整训练语料和训练目标; 3.能和agent开发高效沟通,设计memory存取逻辑,并且通过模型训练让模型适配自己设计的agent; 4.作为工程师,考虑到 LLM inference 对推理算力的高消耗,设计出合理的前后端交互,前端架构,后端架构,在有限的推理算力下,做出完整的 Agentic Workflow 解决方案。最好是探索一套通用可扩展的 Agentic Workflow 解决方案; 5.备注:base地可选深圳/北京/上海。
高级算法工程师(智能体强化学习方向) 岗位职责 深度参与 MindGPT 智能体后训练全流程,包括但不限于 MidTrain(中期训练)、SFT(监督微调)、推理侧 RL(Reasoning RL)及 Agent RL 的算法设计与大规模训练实现。 负责 DeepResearch Agent(深度研究助手)与 Code Agent(自主编程助手)等核心能力的迭代,提升模型在长上下文、多步骤推理及工具调用(Tool-use)上的成功率。