logo of alibaba

阿里巴巴日常实习生-后训练合版/OPD方向-千问Qwen

实习兼职阿里巴巴日常实习生地点:北京 | 杭州 | 上海状态:招聘

任职要求


1. 计算机科学、机器学习、人工智能相关专业背景,硕士以上学历。
2. 熟悉 LLM 后训练、合版、OPD/RL 训练流程与算法,有大规模模型交付和迭代流程经验的优先。
3. 具备优秀的工程能力,熟悉 Megatron、FSDP 等训练框架和 SGLang、vLLM …
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1. 合版算法研究:探究以 SFT 和 On-Policy Distillation(OPD)为核心的合版策略,持续优化合版训练效果,改善专项冲突问题,提升合版流程的稳定性与合版结果的可预测性。
2. 合版反馈链路建设:分析合版训练监控指标,定位冲突专项与原因,为专项模型的数据迭代和 SFT、RL 训练流程提供反馈,帮助专项在改进性能的同时减小合版冲突风险。
3. 合版训练框架建设:参与 OPD 等合版训练框架的迭代,与 infra 和工程团队协作,探究、开发面向多专项、超长程任务的合版算法与框架,提升合版训练框架的效率与稳定性。
4. 合版前沿技术追踪:持续追踪前沿的合版技术,在内部模型研发中快速测试与验证。
包括英文材料
机器学习+
学历+
大模型+
算法+
Megatron+
还有更多 •••
相关职位

logo of alibaba
实习阿里巴巴日常实习

岗位面向行为风控这一高度复杂且动态对抗的业务场景,支持反爬、作弊、欺诈、账号安全、恶意行为等核心风控业务,聚焦大模型后训练与Agentic等前沿技术,探索下一代智能风控基座和行为域基模解决方案。 1、参与行为域数据体系建设:面向行为风控场景中的结构化、序列化、图表化等数据,参与数据处理、任务构建和评测方案设计;探索面向结构化数据的大模型后训练方法,参与行为特色“世界模型”的研究与验证。 2、参与强化学习方案设计:围绕行为风控中的复杂任务,参与Reward System、RL后训练、复杂决策、自我博弈等方向的研究与实验;协助推进全链路情报分析与风险决策能力的建模和优化。 3、参与Agent训练环境和方案构建:面向行为分析、识别、挖掘、链路还原、路径推演等场景,参与可扩展Agent训练环境的设计、搭建与迭代;支持复杂任务下Agent能力评测、训练数据构造和效果分析。 4、参与技术探索与效果分析:跟进大模型后训练、RLHF、Agent、世界模型等方向的前沿研究;结合业务场景,参与实验设计、结果分析和方案迭代,推动研究成果向真实业务问题靠近。

更新于 2026-06-30北京
logo of youku
实习虎鲸文娱实习生招

1、图形方向:参与实时路径追踪渲染器、UE5图形算法改进、UE引擎模块优化等方面的研发,包括但不限于渲染管线、图形算法、物理仿真(布料、软体肌肉)等,以及关联DCC软件的生产效率工具链研发 2、AI方向:参与AI与CG结合的前沿技术研发,包括但不局限于神经渲染、超分、降噪、AI物理仿真模拟等领域,探索机器学习、深度学习等数据驱动方法在动画电影、游戏、影视拍摄中的应用

更新于 2026-05-07北京|杭州
logo of youku
实习虎鲸文娱实习生招

1、研究和探索可控的视觉内容生成技术,负责视觉内容生成模型等相关算法的研发和落地,结合公司业务场景进行相关策略迭代 2、探索时空内容可控生成技术,包括图片/视频风格迁移、镜头控制、空间一致性控制等 3、持续跟踪图像和视频生成领域的最新技术动态,评估并实施前沿技术,推动技术在公司产品中的应用与创新

更新于 2026-03-11北京
logo of alibaba
实习阿里巴巴日常实习

你要做什么 借助 AIGC 工具,高效产出各类风格的音乐 demo 对成品做音乐性把关,输出清晰、可执行的优化反馈 配合团队,把内容趋势转化为具体的选题方向和制作方案 跟踪 B 站 / 抖音 / 小红书 / 网易云的音乐二创热点,沉淀热门曲目与改编方向的选题库

更新于 2026-06-29北京|杭州