字节跳动代码质量大模型算法工程师 - 开发者服务
校招全职A40412A地点:北京 | 上海 | 深圳 | 杭州状态:招聘♡ 收藏
工作描述
任职要求 1、2027届获得硕士及以上学位,计算机、软件工程、人工智能等相关专业; 2、熟悉NLP、CV、ML等相关的技术,深入理解大模型相关技术栈(如Reward Model、GRPO/PPO/DPO、SFT/RFT、CT、PE等); 3、在大模型领域,主导过有影响力的项目或顶会发表论文者优先; 4、具备良好的问题识别、建模能力,能够根据实际问题提供合理的算法模型,具备持续优化的能力; 5、责任心强,积极主动,有良好的沟通能力和团队合作能力。 工作职责…
登录查看完整工作描述
微信扫码,1秒登录
包括英文材料
学历+
NLP+
https://www.youtube.com/watch?v=fNxaJsNG3-s&list=PLQY2H8rRoyvzDbLUZkbudP-MFQZwNmU4S
Welcome to Zero to Hero for Natural Language Processing using TensorFlow!
https://www.youtube.com/watch?v=R-AG4-qZs1A&list=PLeo1K3hjS3uuvuAXhYjV2lMEShq2UYSwX
Natural Language Processing tutorial for beginners series in Python.
https://www.youtube.com/watch?v=rmVRLeJRkl4&list=PLoROMvodv4rMFqRtEuo6SGjY4XbRIVRd4
The foundations of the effective modern methods for deep learning applied to NLP.
大模型+
https://www.youtube.com/watch?v=xZDB1naRUlk
You will build projects with LLMs that will enable you to create dynamic interfaces, interact with vast amounts of text data, and even empower LLMs with the capability to browse the internet for research papers.
https://www.youtube.com/watch?v=zjkBMFhNj_g
GRPO+
https://cameronrwolfe.substack.com/p/grpo
Most early work on RL for LLMs used Proximal Policy Optimization (PPO) as the default RL optimizer, but recent reasoning research relies upon Group Relative Policy Optimization (GRPO).
还有更多 •••
相关职位
实习A196606A
1、2027届硕士及以上学位在读,计算机、软件工程、人工智能等相关专业; 2、熟悉NLP、CV、ML等相关的技术,深入理解大模型相关技术栈(如Reward Model、GRPO/PPO/DPO、SFT
更新于 2026-01-14上海
实习A253561
1、2027届硕士及以上学位在读,计算机、软件工程、人工智能等相关专业; 2、熟悉NLP、CV、ML等相关的技术,深入理解大模型相关技术栈(如Reward Model、GRPO/PPO/DPO、SFT
更新于 2026-01-14北京
校招多模态大模型与应
1、 获得本科及以上学历,计算机科学、软件工程、人工智能等相关专业; 2、 具备扎实的编程能力、数据结构与算法基础,熟悉Python、Java、JavaScript/TypeScript、Go等至少一
更新于 2026-06-16北京