logo of mi

小米agent后训练算法实习生-2027届

实习兼职地点:北京状态:招聘

工作描述


任职要求
基本要求
- 计算机、人工智能、数学、统计等相关专业在读硕士/博士(优秀本科生亦可);
- 扎实的机器学习深度学习基础,深入理解 Transformer 架构与 LLM 训练/推理原理;
- 熟悉强化学习基础算法(PPO、DQN、Policy Gradient、Actor-Critic 等),了解 LLM 对齐算法RLHF、DPO、GRPO、KTO 等)的原理与实现细节;
- 熟练使用 Python 与 PyTorch,有实际的大模型训练/微调经验(SFT、LoRA、RLHF 任一);
- 了解分布式训练相关技术(数据并行、张量并行、流水线并行、ZeRO 等),具备多卡/多机训练实操经验;
- 数学功底扎实,能独立推导优化目标、分析 loss 设计与梯度行为。

工作职责
工作内容

1. Agent 后训练全流程建设: 负责基于大语言模型的通用 Agent 的后训练(Post-training)工作,覆盖 SFT、偏好对齐(DPO/ORPO/KTO 等)、RLHF/RLAIF、RLVR 等阶段,针…
登录查看完整工作描述
微信扫码,1秒登录

包括英文材料
机器学习+
深度学习+
Transformer+
大模型+
强化学习+
算法+
RLHF+
GRPO+
还有更多 •••
相关职位

logo of moonshot
实习算法类/AI

做什么(说点实际的!): 挖数据:自动化找模型 worse cases,定位问题,提升模型能力 调偏好:用RLHF做preference优化,提升模型对齐效果 搞基建:搭后训练数据 pipeline,

更新于 2025-12-23北京
logo of zhipuai
校招

岗位职责 构建面向量化研究、因子挖掘和策略开发的 Agent 环境、Harness、任务与评测体系; 探索 AutoResearch 范式,使 Agent 能够自主提出研究假设、编写代码、运行实验、完

更新于 2026-08-14北京
logo of zhipuai
社招

岗位职责 构建面向量化研究、因子挖掘和策略开发的 Agent 环境、Harness、任务与评测体系; 探索 AutoResearch 范式,使 Agent 能够自主提出研究假设、编写代码、运行实验、完

更新于 2026-07-28北京
logo of antgroup
社招5年以上技术类-算法

1. 学历背景 硕士/博士学位,计算机科学、人工智能、软件工程、数学、自动 化或相关专业优先。 2. 编程与工程能力 具备扎实的编程功底与软件工程素养,精通 Python,熟悉 C/C+

更新于 2026-07-08上海|杭州