阿里巴巴日常实习生-算法工程师-大语言模型 (Agent方向)
实习兼职阿里巴巴日常实习生地点:杭州状态:招聘
工作描述
任职要求 1. 理解 SFT、RLHF/RLVR 等训练范式的基本原理,具备大模型训练、评测或 Agent 开发的实践经验。 2. 具备良好的问题拆解能力与自驱力,能独立完成"设计—实现—分析—迭代"的实验闭环。 工作职责 1. 参与大语…
登录查看完整工作描述
微信扫码,1秒登录
包括英文材料
SFT+
https://cameronrwolfe.substack.com/p/understanding-and-using-supervised
Understanding how SFT works from the idea to a working implementation...
RLHF+
[英文] What is RLHF?
https://aws.amazon.com/what-is/reinforcement-learning-from-human-feedback/
Reinforcement learning from human feedback (RLHF) is a machine learning (ML) technique that uses human feedback to optimize ML models to self-learn more efficiently.
https://www.ibm.com/think/topics/rlhf
Reinforcement learning from human feedback (RLHF) is a machine learning technique in which a “reward model” is trained with direct human feedback, then used to optimize the performance of an artificial intelligence agent through reinforcement learning.
还有更多 •••
相关职位
实习阿里巴巴日常实习
1. 熟练掌握深度学习、机器学习、自然语言处理的基础知识,熟悉常用模型的原理、特点及应用,能够结合需要解决的问题选择适当的模型,并设计合理的技术方案; 2. 良好的科研能力,有成果发表在ICLR、A
更新于 2026-08-11北京
实习阿里巴巴日常实习
1. 自然语言处理、计算机视觉、语音、机器学习、跨模态表征学习等相关专业在读; 2. 综合素质优秀,对技术有热情,工程能力扎实,有NLP/CV/ML顶会发表经验者,有大规模模型训练工程经验的同学优先;
更新于 2026-08-11北京|杭州
实习阿里巴巴日常实习
1.硕士级以上学历,2026年11月1日以后毕业,计算机、软件工程、人工智能等相关专业,能连续实习3个月及以上; 2.熟悉常用机器学习算法,对模式识别、深度学习、强化学习等相关领域有极佳的工程实现能力
更新于 2026-03-26北京