百度多模态大模型算法研发工程师(J96245)
任职要求
-熟悉常见的大语言模型(Llama/Qwen)、多模态大模型(Llava/Qwen-vl)、模型架构(Dense/MOE) -熟悉大模型微调(全参微调/指令微调/PEFT等),了解训练优…
工作职责
-参与智能数据基础设施平台建设,聚焦多模态大模型研发,提升模型在跨模态理解、生成、语义对齐等关键任务上的性能 -参与平台高质量多模态算子开发和高质量工作流构建,支持文档、图片、视频、音频等多种模态数据的高效处理 -参与大语言模型和多模态大模型微调、模型服务搭建、落地项目以及自动化评测体系构建 -参与垂类领域多模态大模型效果优化,从模型结构、训练策略、训练数据等多角度对模型进行优化,打造业界SOTA级模型
ByteIntern:面向2027届毕业生(2026年9月-2027年8月期间毕业),为符合岗位要求的同学提供转正机会。 团队介绍:抖音研发部门负责多款大型产品的研发,包括但不限于抖音、西瓜视频、汽水音乐。加入我们,你将有机会参与亿级用户场景的开发与架构工作,使用前沿的技术助力业务一起不断成长。 1、参与构建新一代多模态大模型评测体系,覆盖3D生成、动态3D(4D)、数字人、世界模型等AIGC方向,驱动模型效果持续优化与业务规模增长; 2、基于计算机视觉(CV)、音频理解、多模态大模型(MLLM)、多模态Agent、强化学习(RLVR)等技术,构建Score Model、Reward Model等自动化评测能力,将人类感知与偏好有效建模,并融入评测闭环,提升生成模型评估与优化效率; 3、参与构建行业领先的多模态评测体系,融合元评估等方法,持续迭代评测标准与数据集构建范式,提升评测结果的可靠性、细粒度与可解释性,系统刻画模型能力边界; 4、作为算法角色,与工程和质量团队协作,将评测能力落地到实际业务场景,支撑模型训练、调优与上线决策。
1、围绕行业AI应用快速落地,研发端到端智能体核心技术,方向包括但不限于:Agent RL强化学习方法、全模态数据解析与私域知识加工、自规划和自主进化的多智能体等技术,提升智能体在复杂业务流中的效果与适应性。 2、攻坚突破大模型产品在行业应用落地和交付过程中的技术难题,与业界先进技术进行持续对比,并保持优势。 3、具备良好的产品化思维,驱动产品迭代,与产品和工程团队紧密合作,将算法技术应用于实际产品,带来产品商业化增量和竞争力。 4、深入研究大模型和智能体技术,持续关注和探索大模型和智能体方向的前沿动向和技术趋势,打造产品业界影响力。
近年来,以大模型为核心的生成式人工智能技术在语言理解、内容生成、多模态建模与跨模态交互等领域取得了突破性进展,展现出前所未有的技术潜力与广泛的应用前景。 我们致力于通用人工智能(AGI)方向的前沿探索与产业落地创新。一方面,在迈向AGI的长期路径中,随着大语言模型能力的持续进化,多模态感知、融合与推理等关键问题日益凸显,成为构建通用智能系统的核心挑战;另一方面,围绕典型行业场景(如智能交互、高质量内容生成、跨模态检索与理解等),如何将现有大模型能力有效转化为可落地、可扩展、可持续的解决方案,也成为当前研究与工程实践的重点方向。 如果你对生成式AI、通用人工智能(AGI/ASI)前沿探索、多模态建模与智能交互系统有浓厚兴趣,并渴望深入参与下一代多模态通用模型的研发与演进,欢迎加入我们,共同定义未来AI的能力边界,牵引千行百业在智能时代的深度变革。 1. 多模态大模型算法创新:定义下一代多模态通用大模型技术范式,实现文本、语音、视觉模态的联合建模,探寻和解决多模态对齐、推理、Agentic等方面的核心挑战,不断追寻多模态通用大模型的效果上限。 2. 场景驱动的算法创新:结合业务场景(如智能交互、内容生成、跨模态检索等),设计并优化大模型架构,提升效果、效率与鲁棒性。 3. 端到端技术闭环:从数据构建、模型训练、评测到部署,主导技术方案落地,通过AB实验、调用量、用户反馈验证价值。 4. 前沿应用技术探索:紧跟并能驱动LLM、Diffusion Models、强化学习等技术相关进展,定义技术新范式,快速实验并迭代创新方案,拉升相关模型SOTA。