百度大模型算法工程师(VLM 方向)(J98540)
任职要求
-计算机、人工智能、数学或相关专业本科及以上学历,Python 编程能力扎实,深入理解 Transformer 及主流多模态模型架构原理 -具备 VLA 或 GUI Agent 多模态模型的实际训练、微调与上线经验,QwenVL 系列…
工作职责
-负责 GUI Agent 专用 VLA 模型的训练与微调,包括基于 Qwen-VL、Qianfan-VL 等多模态模型的架构设计与实验迭代 -主导后训练全流程(SFT → RM → RL)的算法设计与落地,具备 RLHF / DPO 等对齐方法的工程实践经验 -设计并落地 GUI 操作轨迹数据的自动化采集、清洗与标注 Pipeline,推动数据飞轮闭环,驱动模型持续进化 -主导模型推理加速与生产部署,熟悉 vLLM、TensorRT-LLM 等推理框架及量化技术,持续优化端到端时延与吞吐量 -研究并落地适用于 GUI Agent 场景的高阶推理机制(多步规划、自我反思、动作验证等),持续跟踪前沿进展
1、针对物流领域场景进行深入的视觉算法研发,包括但不限于图像理解、视频理解等; 2、负责垂域多模态大模型的继续预训练、SFT、RFT等工作,积极跟进大模型业内应用趋势,包括但不限于MoE、Agent等方向。
1、负责多模态大模型在检索与推荐场景下的算法设计和模型开发,包括多源数据(文本、图像、音频等)的特征融合与相关性建模; 2、研究并实现多模态内容的智能检索与个性化推荐,参与召回、排序等系统模块的研发,推动多模态大模型在实际业务中的应用。
1. 前沿算法研发:负责探索和研发最前沿的视觉语言大模型(VLM)算法,跟进并掌握领域内的最新技术动态(如InternVL Qwen-VL等)。 2. 模型训练与优化:参与或主导公司VLM模型的训练,包括但不限于数据处理、CPT、指令微调(SFT)、以及基于人类反馈的强化学习(RLHF)等全流程算法的研发与优化。 3. 多模态能力融合:致力于提升模型在图像、视频等多种视觉模态上的理解、推理和生成能力,实现视觉信息与语言能力的深度融合。 4. 应用场景落地:推动VLM技术在公司具体业务场的应用落地,解决实际业务中的挑战。 性能优化与部署:负责模型的性能优化,包括模型剪枝、量化、蒸馏等,并配合工程团队将模型高效部署到云端或嵌入式设备,实现低延迟、高吞吐的推理服务。
1. 面向Agentic OS,参与端侧大模型架构设计与训练、训推一体的端侧大模型新架构探索落地与跨场景执行能力的系统级Agent算法体系建设;目标为通过算法与硬件的协同设计,在极小的功耗和内存预算下,实现极致的模型性能。 2. 负责大语言模型、多模态大模型在端侧场景下的继续预训练(CPT)、后训练(SFT, OPD, RL等)及持续学习,构建从数据清洗到模型落地的全链路训练pipeline。 3. 针对端侧芯片和内存特性,设计新型模型结构,探索参数共享与稀疏化方案。 4. 主导量化感知训练(QAT),实施低比特量化(如INT4/INT8),在保证精度的前提下压缩模型体积与显存占用。 5. 运用知识蒸馏(Knowledge Distillation),将云端大模型(Teacher)的能力迁移至端侧小模型(Student),攻克“大改小”的能力衰减难题。 6. 建立端侧模型评测体系,不仅关注准确率,更关注首字延迟(Prefill)、生成速度(Decoding)、功耗峰值等硬性指标。 7. 前沿技术探索与成果产出,建立Agentic OS的算法创新壁垒,推动顶级会议论文与核心专利产出。