logo of liauto

理想汽车智能体强化算法实习生

实习兼职算法与软件地点:北京状态:招聘

任职要求


1. 人工智能、机器学习、计算机科学、应用数学相关专业硕士及以上学历;
2. 在强化方向有深入研究:
-强化方向熟悉 GRPO/GSPO/GDPO/Dr.GRPO等不同算法
-熟悉基座模型Qwen/GLM系列等,了解Dense/MoE架构在强化训练中的异同
-熟悉智能体架…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


面向智能化软件工程、研发智能体等高价值业务场景,预研和落地 AI4SE 核心技术,岗位职责包括但不限于:
1. 聚焦强化和智能体强化相关技术研究以及工程化落地,包括模型设计、智能体建模与训练、训练效率效果优化等;
2. 跟踪最新的 AI 技术发展趋势和行业动态,积极探索并引入新的 AI 工具和技术,为团队的技术创新提供思路与方案,持续提升团队的技术竞争力;
3. 跟踪学术界和工业界最新进展,快速应用到业务中,提出创新技术,发表高水平论文。
包括英文材料
机器学习+
学历+
还有更多 •••
相关职位

logo of meituan
实习核心本地商业-基

1. 基座增强:探索大模型垂直领域知识高效增强方法,包括数据策略、训练策略以及scaling law友好的训练方法,打造适配实际应用所需的基座能力; 2. 多模态端到端:实现语音与文本模态的深度融合与统一建模,打造高效、轻量的端到端多模态系统,从而有助于更全面、多维度地理解语音与文本,提供更强的智能以及更智能的交互模式; 3. 深度推理:突破大模型在复杂逻辑推理、因果推断、多步决策、沟通技巧等大模型基础通用能力,提升模型解决开放式问题的能力; 4. 结合大模型,研发对话交互场景的大模型Agent,支持智能客服、销售、数据分析、C端助理等项目,通过预训练、微调、强化学习等全链路的技术实践,实现类人的理解和执行能力,提升美团服务能力和效率; 5. 不断探索技术新领域,推动技术能力的沉淀和技术氛围的建设。

更新于 2026-03-23北京
logo of tencent
社招3年以上腾讯云-Code

1.作为研究者,探索有效的 Agentic Workflow 和 Agentic Memory 设计来解决代码领域的问题; 2.主要关注比SFT泛化效果更好的强化学习;能结合实际用户需求、产生的用户数据、agent的实现细节,调整训练语料和训练目标; 3.能和agent开发高效沟通,设计memory存取逻辑,并且通过模型训练让模型适配自己设计的agent; 4.作为工程师,考虑到 LLM inference 对推理算力的高消耗,设计出合理的前后端交互,前端架构,后端架构,在有限的推理算力下,做出完整的 Agentic Workflow 解决方案。最好是探索一套通用可扩展的 Agentic Workflow 解决方案; 5.备注:base地可选深圳/北京/上海。

更新于 2026-07-22深圳
logo of liauto
社招汽车研发

高级算法工程师(智能体强化学习方向) 岗位职责 深度参与 MindGPT 智能体后训练全流程,包括但不限于 MidTrain(中期训练)、SFT(监督微调)、推理侧 RL(Reasoning RL)及 Agent RL 的算法设计与大规模训练实现。 负责 DeepResearch Agent(深度研究助手)与 Code Agent(自主编程助手)等核心能力的迭代,提升模型在长上下文、多步骤推理及工具调用(Tool-use)上的成功率。

北京
logo of jd
校招机器学习方向

1.负责构建智能仓储、物流、制造业垂直领域的数据驱动仿真引擎(World Model):利用海量IoT数据、AGV运行轨迹数据、边缘PDA交互数据,训练高保真的时序预测模型。 2.开展基于大模型及代理式AI驱动提效的强化学习:搭建分布式RL框架,驱动全局调度Agent与边缘端交互Agent进行百万次并发训练与策略寻优。 3.解决人机协同场景的建模难题:量化并模拟一线作业员(通过PDA)的随机性与干预,纳入智能体训练闭环。 4.主导Sim-to-Real(虚实迁移)架构设计,确保虚拟策略安全落地至真实仓储与产线系统中。

更新于 2026-07-20北京