小鹏汽车基座模型算法实习生
实习兼职地点:北京 | 上海状态:招聘
工作描述
任职要求 1、熟悉VLM核心模型的预训练、微调 (SFT/RLHF/DPO) 及性能优化,提升模型在指令遵循、推理、图文生成等任务的表现,有实际落地经验; 2、有探索并实现跨模…
登录查看完整工作描述
微信扫码,1秒登录
包括英文材料
SFT+
https://cameronrwolfe.substack.com/p/understanding-and-using-supervised
Understanding how SFT works from the idea to a working implementation...
RLHF+
[英文] What is RLHF?
https://aws.amazon.com/what-is/reinforcement-learning-from-human-feedback/
Reinforcement learning from human feedback (RLHF) is a machine learning (ML) technique that uses human feedback to optimize ML models to self-learn more efficiently.
https://www.ibm.com/think/topics/rlhf
Reinforcement learning from human feedback (RLHF) is a machine learning technique in which a “reward model” is trained with direct human feedback, then used to optimize the performance of an artificial intelligence agent through reinforcement learning.
还有更多 •••
相关职位
实习算法
1.在NeurlPS/ICLR/ACL/EMNLP/CVPR/ICCV等会议或期刊上发表过论文者优先。 2.获得过国际或国内重要赛事奖项者优先。 3.在大模型领域有主导过有影响力项目或者核心技术发布者
北京

实习算法
1、26届或之后毕业的硕士、博士,优秀本科生也可,要求同学有强自我驱动力; 2、论文阅读能力出众,对大模型、Agent、AIGC领域最新进展熟悉,有相关科研/项目经验优先; 3、熟悉常见 AI 编程工
更新于 2026-07-10北京|上海
实习核心本地商业-基
1. 熟悉大模型的原理,具备数据处理、精调、预训练、强化等方面的经验; 2. 熟悉自然语言处理常见算法与模型,具备深度学习技术在NLP领域的应用实践; 3. 具备良好的编程实现能力,熟悉C++、Py
更新于 2026-03-23北京