千问千问事业部-llm/omni算法专家(全模态语音助手方向)-北京/杭州
社招全职1年以上技术类-算法地点:北京 | 杭州状态:招聘
工作描述
任职要求 1、计算机科学、人工智能、数学、电子信息工程或相关专业硕士及以上学历。 2、深入理解Transformer架构,熟悉SFT/RLHF/DPO/PPO/GRPO等算法原理及使用边界。 3、熟悉大模型训练与推理,熟悉至少一种主流训练框架:如Swift、Megatron、LlamaFactory、Trl等。 4、具备LLM/VLM/Omni等方向的研发经验,兼具扎实相关理论基础与实践能力。 工作职责 我们正在打造面向智能硬件和座舱场景的下一代语音 AI 助手,目标是实现低延迟、强理解、可规划…
登录查看完整工作描述
微信扫码,1秒登录
包括英文材料
学历+
Transformer+
https://huggingface.co/learn/llm-course/en/chapter1/4
Breaking down how Large Language Models work, visualizing how data flows through.
https://poloclub.github.io/transformer-explainer/
An interactive visualization tool showing you how transformer models work in large language models (LLM) like GPT.
https://www.youtube.com/watch?v=wjZofJX0v4M
Breaking down how Large Language Models work, visualizing how data flows through.
SFT+
https://cameronrwolfe.substack.com/p/understanding-and-using-supervised
Understanding how SFT works from the idea to a working implementation...
RLHF+
[英文] What is RLHF?
https://aws.amazon.com/what-is/reinforcement-learning-from-human-feedback/
Reinforcement learning from human feedback (RLHF) is a machine learning (ML) technique that uses human feedback to optimize ML models to self-learn more efficiently.
https://www.ibm.com/think/topics/rlhf
Reinforcement learning from human feedback (RLHF) is a machine learning technique in which a “reward model” is trained with direct human feedback, then used to optimize the performance of an artificial intelligence agent through reinforcement learning.
还有更多 •••
相关职位
实习阿里巴巴研究型实
1. Agent方向:深入理解Transformer架构、掌握预训练(Pretrain)、监督微调(SFT)等基础算法,并深入应用 RLHF、RLAIF、DPO/GRPO 等对齐技术; 2. LLM方
更新于 2026-03-20杭州
实习阿里巴巴2027
1、计算机科学、人工智能、机器学习或相关领域硕士或博士学位; 2、具备 LLM 训练或后训练(fine-tuning / post-training)经验; 3、在 NeurIPS、ICML、ICLR
更新于 2026-04-08杭州|森尼韦尔
实习阿里巴巴2027
1、计算机科学、人工智能、机器学习或相关领域硕士或博士学位; 2、具备 LLM 训练或后训练(fine-tuning / post-training)经验; 3、在 NeurIPS、ICML、ICLR
更新于 2026-04-08杭州