美团大模型算法实习生
实习兼职核心本地商业-基础研发平台地点:北京 | 上海状态:招聘
任职要求
1. 熟悉大模型的原理,具备强化学习、数据合成等方面的经验。 2. 熟悉自然语言处理常见算法与模型,具备深度学习技术在NLP领域的应用实践。 3. 具备良好的编程实现能力,熟悉C++、Python、Java等常用编程语言中至少一种。 4.…
登录查看完整任职要求
微信扫码,1秒登录
工作职责
1. 研发对话交互场景的大模型Agent,通过数据合成、偏好训练、多轮RL等方法提升大模型的指令遵循、推理规划、沟通情商、工具调用等能力。 2. 探索前沿技术的创新与领域适配,推动前沿技术在实际业务中的落地应用,同时将有价值的技术问题和方案总结发表。 3. 支持AIBD等项目,通过预训练、微调、强化学习等全链路的技术实践,实现类人的理解和执行能力,提升美团服务能力和效率。
包括英文材料
大模型+
https://www.youtube.com/watch?v=xZDB1naRUlk
You will build projects with LLMs that will enable you to create dynamic interfaces, interact with vast amounts of text data, and even empower LLMs with the capability to browse the internet for research papers.
https://www.youtube.com/watch?v=zjkBMFhNj_g
强化学习+
https://cloud.google.com/discover/what-is-reinforcement-learning?hl=en
Reinforcement learning (RL) is a type of machine learning where an "agent" learns optimal behavior through interaction with its environment.
https://huggingface.co/learn/deep-rl-course/unit0/introduction
This course will teach you about Deep Reinforcement Learning from beginner to expert. It’s completely free and open-source!
https://www.kaggle.com/learn/intro-to-game-ai-and-reinforcement-learning
Build your own video game bots, using classic and cutting-edge algorithms.
NLP+
https://www.youtube.com/watch?v=fNxaJsNG3-s&list=PLQY2H8rRoyvzDbLUZkbudP-MFQZwNmU4S
Welcome to Zero to Hero for Natural Language Processing using TensorFlow!
https://www.youtube.com/watch?v=R-AG4-qZs1A&list=PLeo1K3hjS3uuvuAXhYjV2lMEShq2UYSwX
Natural Language Processing tutorial for beginners series in Python.
https://www.youtube.com/watch?v=rmVRLeJRkl4&list=PLoROMvodv4rMFqRtEuo6SGjY4XbRIVRd4
The foundations of the effective modern methods for deep learning applied to NLP.
算法+
https://roadmap.sh/datastructures-and-algorithms
Step by step guide to learn Data Structures and Algorithms in 2025
https://www.hellointerview.com/learn/code
A visual guide to the most important patterns and approaches for the coding interview.
https://www.w3schools.com/dsa/
还有更多 •••
相关职位

实习研发
1、参与 Deep Learning Planning 算法设计、模型训练、评测构建等相关工作; 2、运用深度强化/机器学习等技术,优化模型结构,提高模型对复杂驾驶场景的理解和应对能力; 3、针对业务需求和实车Bad Case,设计并验证优化方案,完成算法的持续迭代; 4、负责收集、标注和处理自动驾驶相关数据,构建高质量的数据集,为模型训练提供有力支持;
更新于 2025-08-27北京
实习核心本地商业-基
1. 后训练研究:深入参与模型对齐工作,重点研究多种后训练算法;探索结果奖励和过程奖励模型的构建,提升模型在复杂逻辑下的推理能力。 2. Agentic RL优化:针对复杂业务场景,优化 Agent 的任务规划、反思与执行能力;提升模型在长链路任务中的稳定性和成功率。 3. 前沿技术落地:跟踪业界前沿技术路线,负责相关算法的复现、调优及在业务场景中的工程化落地。
更新于 2026-07-20北京
社招1-3年
1、负责利用自然语言处理和机器学习算法,实现客服、销售、收派、运营、办公职能等业务板块大模型的应用落地,支持业务目标的提升; 2、负责大模型的继续预训练、SFT、 RLHF与推理等工作,能够根据场景需求设计高效的训练方案,并解决训练中出现的问题,如过拟合、知识遗忘、上下文漂移等; 3、紧跟大模型技术的最新进展,面向集团各类业务场景,沉淀共性能力,实现大模型技术的标准化与产品化。
更新于 2026-07-02深圳