快手语言大模型算法工程师(coding/agent方向)
任职要求
1、在大规模预训练、模型对齐、强化学习、RAG、Agent、对话系统、大模型应用等至少其中一个方向有深厚的项目经验和洞察力; 2、对大模型、NLP、多模态、深度学习等AI领域至少其中一个领域有丰富的知识…
工作职责
1、负责语言大模型(Large Language Model)的技术研究,包括但不限于Pretrain、SFT、RL等技术相关的算法研发、数据策略和合成、Infra策略优化等,以及相关的基础技术探索和创新等; 2、负责基础Pretrain模型、Instruct模型、推理模型等系列大模型的技术研发; 3、持续跟进并深入调研大模型前沿技术、开源方案,跟踪业内语言模型领域的最新进展并推进相关研究,打造业界影响力。
1. 多模态Pre-training:开展研究及进行实验。研究内容包括:数据清洗与筛选、数据配比优化、课程学习、视觉语言模型结构设计与优化、训练策略优化、预训练数据合成、scaling law预测、词表优化、模型蒸馏与压缩、长上下文能力优化等。 2. 多模态Post-training:迭代Post-training训练策略(SFT/RLHF),专项能力数据迭代,参与模型能力评测及评测数据和评估标准的迭代。 3. 多模态推理和通用Agent:通过强化学习(RL)持续提升多模态模型推理能力和执行任务能力,打造多模态的Test Scaling Laws,并推动模型对网络和虚拟世界的交互和任务完成能力。 4. 统一理解生成:构建视觉统一理解生成大模型,推进多模态统一生成与理解的推理和交互新范式。

通义千问(Qwen)是由通义实验室自主研发的超大规模语言模型,具备跨语言、跨任务的理解与生成能力。Qwen系列模型,涵盖参数量从几百 M 到 T 级的基座大语言模型,并相继推出Qwen-VL、Qwen-Audio、Qwen-Omni、Qwen-Coder等系列模型。从多轮对话到代码生成,从逻辑推理到内容创作,从单一多模态到全模态统一理解生成,Qwen 正在打造全球领先的全模态模型技术体系,推动AI在企业服务、开发者生态、个人用户等领域的深度应用,引领下一代人工智能的发展。 视觉语言理解能力是Qwen最重要的能力之一,围绕 LLM 建设出具有视觉深度理解与推理能力的基座模型是团队的必经之路。结合视觉理解和推理能力的基础模型,将拓展到视频理解,GUI Agent,以及VLA 和机器人等场景中。团队负责:1)多模态基础模型的研发,包括融合视觉语言的跨模态理解模型设计,提升视觉基础模型在图像/视频中的视觉知识、空间感知、Omni Parsing等核心能力,并优化多模态大模型AI infra;2)探索多模态Agent和推理能力,构建支持网络世界(PC/Mobile/Web/游戏)交互的通用智能体;3)研究生成与理解统一的模型架构,实现跨模态生成与推理的协同优化。 工作职责 1. 多模态Pre-training:开展研究及进行实验。研究内容包括:数据清洗与筛选、数据配比优化、课程学习、视觉语言模型结构设计与优化、训练策略优化、预训练数据合成、scaling law预测、词表优化、模型蒸馏与压缩、长上下文能力优化等。 2. 多模态Post-training:迭代Post-training训练策略(SFT/RLHF),专项能力数据迭代,参与模型能力评测及评测数据和评估标准的迭代。 3. 多模态推理和通用Agent:通过强化学习(RL)持续提升多模态模型推理能力和执行任务能力,打造多模态的Test Scaling Laws,并推动模型对网络和虚拟世界的交互和任务完成能力。 4. 统一理解生成:构建视觉统一理解生成大模型,推进多模态统一生成与理解的推理和交互新范式。
Seed 大模型人才校招,是字节跳动 Seed 面向高校人才推出的招聘项目。我们始终相信,真正重要的技术进步来自对高难度问题的持续挑战。面对 AI 时代的巨大机遇,Seed 团队并不止步于模型迭代,而是选择进入技术深水区,推进下一代 AI 范式突破,不断探索智能的边界与上限。 团队介绍:字节跳动 Seed 团队成立于 2023 年,致力于寻找通用智能的新方法,追求智能上限,为科技和社会发展作出贡献。 Seed 团队在 AI 领域拥有长期愿景与决心,团队研究方向涵盖 MLLM、GenMedia、AI for Science、机器人等,在中国、新加坡、美国等地设有实验室和岗位。目前,团队已推出业界领先的通用大模型以及前沿的多模态能力,支持豆包、即梦、TRAE 等超过 50 个应用场景,并通过火山引擎开放给企业客户。第三方数据显示,豆包 App 用户量在中国市场排名第一,豆包大模型日均 Token 调用量行业领先。 1、擅长发现优化大模型的简单、普适的想法,并应用到各个规模的模型中提升效果; 2、探索超大规模模型边界,并进行极致系统优化,提升模型性能和效率; 3、推进数据建设、指令微调、偏好对齐、模型优化方面的工作,提高模型质量和适应性; 4、相关应用落地,包括生成创作、逻辑推理、代码生成等; 5、深入研究和探索模型在未来生活中的更多使用场景,拓展模型的应用范围。
岗位亮点 1. 真实产业场景:深度参与顺丰物流全链路业务,用大模型与 Agent 技术解决真实世界的复杂决策问题,技术价值可直接落地验证 2. 全链路技术实践:覆盖垂域大模型训练、Agent 系统建设、国产化算力适配、评测体系搭建全流程,接触最前沿的大模型工程与研究方向 3. 学术产业结合:支持技术成果沉淀,鼓励顶会论文发表与专利申请,兼顾工程落地能力与学术影响力提升 4. 核心成长空间:核心技术团队从 0 到 1 搭建物流场景大模型技术体系,个人成长与业务发展深度绑定 岗位职责 1. 搭建面向物流复杂业务场景的 Agent 仿真运行环境,设计多维度场景化任务集,沉淀高质量交互数据与标准化工具链,支撑决策型 Agent 的模型迭代与效果验证 2. 负责物流垂域大模型的全链路训练工作,涵盖高质量训练数据构造、预训练 / 后训练算法优化、训练效率与效果提升; 3. 主导国产化训练框架与核心算子的适配调优,保障模型在国产算力平台的稳定高效运行 4. 搭建大模型与 Agent 系统的全维度评测体系,建设标准化测试集与自动化评测平台,通过量化分析定位模型能力短板,输出可落地的迭代优化方案 5. 跟踪大模型与 Agent 领域的前沿技术进展,开展创新性研究,沉淀技术成果,共同推进顶会论文发表与技术专利申请