京东算法工程师-多模态大模型
任职要求
1. 2026年10月1日至2027年9月30日期间毕业,统招本科及以上学历; 2. 拥有但不限于计算机、信息工程、模式识别、人工智能、自动化、软件工程、数学等相关专业学习背景,熟悉计算机视觉、机器学习、图像/视频分析与处理等相关领域的技术知识,有一定实践经验更优; 3. 至少熟悉Java、C、C++、Python中的一门语言,有较强的编程能力,了解常用机器学习/深度学习框架,如:TensorFlow、Pytorch、Caffe等; 4.…
工作职责
1. 与各业务、产品、工程团队配合,在京东亿量级的数据与丰富的业务应用场景中不断进行深入的计算机视觉研发,包括但不限于图像/视频的分析、诊断、合成、搜索等方面的研究及系统、产品开发; 2. 参与到京东计算机视觉的相关技术应用场景中,包括但不限于图像检测、图像分类、图像分割、视频语义分析、图像/视频搜索、人脸识别与分析、物体检测、工业与医学诊断、车辆与人员的检测识别与跟踪、OCR等内容; 3. 与京东的技术团队及科学家们一同参与深度学习、机器学习的前沿研究,开发算法和模型来解决真实计算机视觉问题,助力业务提升效率,实现京东技术愿景和战略; 4. AI应用探索:积极跟踪计算机视觉领域AI最新进展,熟练运用深度学习框架及AI工具链提升模型开发、训练与部署效率,探索前沿技术落地应用。
T-Star计划是阿里巴巴淘天集团顶尖人才招聘和培养项目,继承“阿里星〞的使命与愿景,面向全球招募顶尖技术人才。期待你们在淘天,通过极具挑战的前沿课题与亿级规模的海量数据、应用场景,探索和实践最前沿的Al技术,在有价值的业务场景落地技术成果。 工作内容: 1. 研发多模态大模型(MLLM),提升模型对图像/视频内容的深度语义理解、描述(Captioning)及问答能力。 2. 负责基于 Qwen-image-edit / Flux等架构的图像生成算法优化,提升生成质量、多样性和可控性。研发针对特定风格、人物或场景的 包括但不限于LoRA / ControlNet / IP-Adapter 等微调与控制技术。探索图像高清化(Upscaling)、局部重绘(Inpainting)及属性编辑等落地场景。 3. 负责文生视频(T2V)、图生视频(I2V)前沿算法的跟踪与实现(如 Sora,, Veo-3 类似架构)。优化视频生成的时空一致性、动作流畅度及长视频生成能力,探索视频风格迁移、数字人驱动及视频编辑相关技术。 T-Star实习可以带给你什么? ꔷ ①加入前沿技术探索队伍,参与顶级课题研究,有机会实现工业界项目落地。②跟企业大牛导师/学术界名导一起做有价值的课题。③丰富的技术资源、海量的数据与优秀的团队助力发paper ④有机会提前获得秋招直通T-Star的正式Offer。
1、业务介绍: 聚焦物流供应链,基于文本/图像/视频多模态数据,构建垂域多模态大模型,创新PT-SFT-RLHF方法论,赋能安全检测、违规巡检,降本增效。 2、岗位内容: 负责垂域多模态模型继续预训练,视频理解等能力的攻坚。 3、研究内容: (1)基于物流供应链领域文本/图像/视频数据,探索构建垂域多模态大模型,创新提炼垂域适配的PT-SFT-RLHF各阶段数据构建、模型训练与评测方法论; (2)探索垂域多模态大模型前沿应用方向,提升垂域多模态基础能力,包括目标检测,视频分类,视频问答,视频描述等任务,赋能安全检测、违规巡检等业务,实现降本增效。
1、负责多模态大模型在检索与推荐场景下的算法设计和模型开发,包括多源数据(文本、图像、音频等)的特征融合与相关性建模; 2、研究并实现多模态内容的智能检索与个性化推荐,参与召回、排序等系统模块的研发,推动多模态大模型在实际业务中的应用。
部门介绍 图像与多模态实验室致力于构建涵盖语言、视觉、语音等多种模态的基础模型,支持多模态感知、理解、推理、生成与编辑等核心任务。我们的目标是为模型应用提供世界一流的基础模型保障,推动从纯语言任务到多模态任务的拓展,并实现从数字世界到物理世界的深度融合。 岗位职责及目标 1、探索大规模/超大规模多模态视觉大模型,并进行极致系统优化,数据建设、指令微调、偏好对齐、模型优化; 2、探索统一的多模态大模型架构,打通理解与生成之间的壁垒,研究如何在单一模型框架下实现对多模态信息的深度理解与高质量生成; 3、探索多模态推理模型(Reasoning)架构、提升多模态在学科、通用视觉任务上的思考和推理能力; 4、探索多模态视觉大模型后训练方法,探索指令微调、强化学习等后训练策略,提升模型的性能;