logo of baidu

百度大模型算法工程师(VLM 方向)(J98540)

社招全职ACG地点:北京状态:招聘

任职要求


-计算机、人工智能、数学或相关专业本科及以上学历Python 编程能力扎实,深入理解 Transformer 及主流多模态模型架构原理
-具备 VLA 或 GUI Agent 多模态模型的实际训练、微调与上线经验,QwenVL 系列…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


-负责 GUI Agent 专用 VLA 模型的训练与微调,包括基于 Qwen-VL、Qianfan-VL 等多模态模型的架构设计与实验迭代
-主导后训练全流程(SFT → RM → RL)的算法设计与落地,具备 RLHF / DPO 等对齐方法的工程实践经验
-设计并落地 GUI 操作轨迹数据的自动化采集、清洗与标注 Pipeline,推动数据飞轮闭环,驱动模型持续进化
-主导模型推理加速与生产部署,熟悉 vLLM、TensorRT-LLM 等推理框架及量化技术,持续优化端到端时延与吞吐量
-研究并落地适用于 GUI Agent 场景的高阶推理机制(多步规划、自我反思、动作验证等),持续跟踪前沿进展
包括英文材料
学历+
Python+
还有更多 •••
相关职位

logo of sf
校招研发类

1、针对物流领域场景进行深入的视觉算法研发,包括但不限于图像理解、视频理解等; 2、负责垂域多模态大模型的继续预训练、SFT、RFT等工作,积极跟进大模型业内应用趋势,包括但不限于MoE、Agent等方向。

更新于 2026-03-05深圳
logo of netease
校招人工智能

1、负责多模态大模型在检索与推荐场景下的算法设计和模型开发,包括多源数据(文本、图像、音频等)的特征融合与相关性建模; 2、研究并实现多模态内容的智能检索与个性化推荐,参与召回、排序等系统模块的研发,推动多模态大模型在实际业务中的应用。

杭州
logo of tcl
社招研发技术类

1. 前沿算法研发:负责探索和研发最前沿的视觉语言大模型(VLM)算法,跟进并掌握领域内的最新技术动态(如InternVL Qwen-VL等)。 2. 模型训练与优化:参与或主导公司VLM模型的训练,包括但不限于数据处理、CPT、指令微调(SFT)、以及基于人类反馈的强化学习(RLHF)等全流程算法的研发与优化。 3. 多模态能力融合:致力于提升模型在图像、视频等多种视觉模态上的理解、推理和生成能力,实现视觉信息与语言能力的深度融合。 4. 应用场景落地:推动VLM技术在公司具体业务场的应用落地,解决实际业务中的挑战。 性能优化与部署:负责模型的性能优化,包括模型剪枝、量化、蒸馏等,并配合工程团队将模型高效部署到云端或嵌入式设备,实现低延迟、高吞吐的推理服务。

更新于 2025-12-01上海
logo of mi
社招A188131

1. 面向Agentic OS,参与端侧大模型架构设计与训练、训推一体的端侧大模型新架构探索落地与跨场景执行能力的系统级Agent算法体系建设;目标为通过算法与硬件的协同设计,在极小的功耗和内存预算下,实现极致的模型性能。 2. 负责大语言模型、多模态大模型在端侧场景下的继续预训练(CPT)、后训练(SFT, OPD, RL等)及持续学习,构建从数据清洗到模型落地的全链路训练pipeline。 3. 针对端侧芯片和内存特性,设计新型模型结构,探索参数共享与稀疏化方案。 4. 主导量化感知训练(QAT),实施低比特量化(如INT4/INT8),在保证精度的前提下压缩模型体积与显存占用。 5. 运用知识蒸馏(Knowledge Distillation),将云端大模型(Teacher)的能力迁移至端侧小模型(Student),攻克“大改小”的能力衰减难题。 6. 建立端侧模型评测体系,不仅关注准确率,更关注首字延迟(Prefill)、生成速度(Decoding)、功耗峰值等硬性指标。 7. 前沿技术探索与成果产出,建立Agentic OS的算法创新壁垒,推动顶级会议论文与核心专利产出。

更新于 2026-06-23深圳