荣耀Agent 强化学习算法技术专家
社招全职3年以上研发类地点:南京 | 上海状态:招聘
工作描述
任职要求 1、硕士及以上学历,计算机、自然语言处理、人工智能等相关专业,3 年及以上大模型 Agent 强化学习实战经验; 2、必备能力:拥有多轮交互 Agent 端到端 RL 完整优化实战经历,熟悉图文多模态大模型,熟悉主流前沿 RL 对齐算法,理解长序列决策优化逻辑; 3、优先加分: a、具备 DeepResearch 类长链路复杂任务优化经验; b、语音助手/GUI/Web/桌…
登录查看完整工作描述
微信扫码,1秒登录
包括英文材料
学历+
NLP+
https://www.youtube.com/watch?v=fNxaJsNG3-s&list=PLQY2H8rRoyvzDbLUZkbudP-MFQZwNmU4S
Welcome to Zero to Hero for Natural Language Processing using TensorFlow!
https://www.youtube.com/watch?v=R-AG4-qZs1A&list=PLeo1K3hjS3uuvuAXhYjV2lMEShq2UYSwX
Natural Language Processing tutorial for beginners series in Python.
https://www.youtube.com/watch?v=rmVRLeJRkl4&list=PLoROMvodv4rMFqRtEuo6SGjY4XbRIVRd4
The foundations of the effective modern methods for deep learning applied to NLP.
大模型+
https://www.youtube.com/watch?v=xZDB1naRUlk
You will build projects with LLMs that will enable you to create dynamic interfaces, interact with vast amounts of text data, and even empower LLMs with the capability to browse the internet for research papers.
https://www.youtube.com/watch?v=zjkBMFhNj_g
AI agent+
https://www.ibm.com/think/ai-agents
Your one-stop resource for gaining in-depth knowledge and hands-on applications of AI agents.
还有更多 •••
相关职位
社招3年以上
1、硕士研究生及以上学历,计算机、人工智能、软件、信息安全、统计和数学专业优先; 2、3年以上大模型/强化学习相关研发经验,深刻理解RLHF/Agent训练经验; 3、具备业务风控领域(作弊、欺诈、账
更新于 2026-07-14北京
实习阿里巴巴日常实习
● 计算机科学、人工智能、运筹学、自动化等相关方向博士 ● 扎实的强化学习理论功底,精通主流RL算法(Policy Gradient/PPO/GRPO及其变体),有实际实现与调优经验 ● 熟练Pyth
更新于 2026-06-01杭州
实习阿里巴巴2027
● 计算机科学、人工智能、运筹学、自动化等相关方向博士 ● 扎实的强化学习理论功底,精通主流RL算法(Policy Gradient/PPO/GRPO及其变体),有实际实现与调优经验 ● 熟练Pyth
更新于 2026-05-28杭州