
商汤VLM算法工程师
任职要求
1.本科及以上学历,计算机科学、自动化、人工智能、机器人等相关专业,2年以上算法研发经验; 2.扎实的编程能力(Python/C++),精通PyTorch框架; 3. 具备自动驾驶数据(图像/视频/文本/点云)的处理经验,熟悉自动驾驶数据集(如Waymo、nuScenes)以及自动驾驶业务; …
工作职责
1、研发基于VLM/多模态大模型的数据挖掘算法,精准识别自动驾驶长尾场景(如极端天气、复杂交通参与行为、罕见障碍物等); 2、构建高效的自动化数据挖掘Pipeline,提升数据标签质量并降低标注成本; 3、结合点云、图像、文本等多模态数据,设计多模态特征,支持数据的跨模态检索;
1. 前沿算法研发:负责探索和研发最前沿的视觉语言大模型(VLM)算法,跟进并掌握领域内的最新技术动态(如InternVL Qwen-VL等)。 2. 模型训练与优化:参与或主导公司VLM模型的训练,包括但不限于数据处理、CPT、指令微调(SFT)、以及基于人类反馈的强化学习(RLHF)等全流程算法的研发与优化。 3. 多模态能力融合:致力于提升模型在图像、视频等多种视觉模态上的理解、推理和生成能力,实现视觉信息与语言能力的深度融合。 4. 应用场景落地:推动VLM技术在公司具体业务场的应用落地,解决实际业务中的挑战。 性能优化与部署:负责模型的性能优化,包括模型剪枝、量化、蒸馏等,并配合工程团队将模型高效部署到云端或嵌入式设备,实现低延迟、高吞吐的推理服务。
1. 设计并实现文本、图像、视频等多模态对齐与融合的长程训练策略,操控万卡级 GPU 集群,协同 Pretrain / CPT / SFT / RLVR / RLHF 全链路,对超大参数基座模型进行高效分布式优化; 2. 深入探索 MoE 稀疏化、训练算法与对齐范式创新、可解释性与质量监控、多模态推理、mRAG、百万 Token 级长文处理、Agent&工具链机制等底层原理与技术; 3. 与系统团队共建张量并行、流水并行、混合精度等高性能训练框架,持续提升训练吞吐与稳定性; 4. 学术与行业影响力打造:快速跟踪 NeurIPS / CVPR / ACL 等顶会成果及开源项目,输出专利与论文,树立行业技术标杆。
岗位定位: 本岗位侧重于构建大模型的“视觉与感知”能力。小红书拥有业界最独特的图文与短视频 UGC 数据生态,你将负责 VLM 的 Post-training,让模型深度理解,支撑小红书所有业务场景,包括且不限于搜索、广告、推荐、电商、客服及智能发布等核心场景。 你的工作内容: 负责 VLM 的 SFT/RL/Post-training 流程,提升图文、视频与文本之间的语义对齐和指令遵循能力; 构建视觉 Reasoning 能力,提升模型在复杂图文理解、视频时序理解、多图推理、空间关系推理等任务上的表现; 研发多模态 Agent 能力,使模型能够进行任务分解、计划生成、工具调用、结果验证和自我修正; 建设 VLM Tool-use 能力,支持搜索、知识库、商品库、OCR、ASR、视频分析、审核规则等内部工具调用; 优化长视频理解和多帧推理能力,提升模型对视频内容、事件、时序关系和深层语义的理解效率; 面向小红书搜索、推荐、广告、电商、审核和内容创作等业务场景,构建数据、训练、评测和上线闭环。