logo of meituan

美团AIGC-视频生成算法专家

社招全职3年以上核心本地商业-基础研发平台地点:北京状态:招聘

任职要求


1. 熟练掌握模式识别计算机视觉领域的基础理论和方法,在一个或多个领域有深入研究:扩散模型、视频生成、视频编辑、跨模态理解与生成、大规模数据处理与训练等。…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1. 负责AIGC视频生成模型与应用的研发工作,包括但不限于:视频生成模型结构设计、模型训练、模型加速和推理、训练数据处理等。 
2. 根据业务和研发需求,实现模型训练、算法开发和应用的落地。 
3. 完成相关专利申请或论文撰写。
包括英文材料
模式识别+
OpenCV+
还有更多 •••
相关职位

logo of alibaba
实习淘天集团T-St

如果你,期望在阿里巴巴生态的广阔场景中,借助海量用户数据和先进的技术能力,打造千人千面的个性化数字人形象生产系统,为亿级用户提供高度定制化的虚拟形象服务; 如果你,期望攻克高保真语音驱动(Speech-to-Video)的核心难题,研发业界领先的唇形同步、情绪化面部表情及肢体动作生成算法,实现从音频到视频的端到端极致还原,赋予数字人如同真人般的自然表达力与情感共鸣; 如果你,期望挑战实时流式生成的技术难题,探索扩散模型与自回归模型的极速推理优化,实现低延迟、高吞吐的视频流实时产出,打破离线渲染的局限,支撑起百万级并发的实时交互直播场景; 如果你,期望突破数字人与物理世界的边界,深耕复杂物体交互(Human-Object Interaction)技术,解决数字人在手持商品、展示道具等动态交互过程中的物理规律约束、空间一致性及遮挡还原难题,让数字人在导购、演播等场景中具备真实的物体操控能力; 如果你,期望深入探索多模态统一大模型的应用,将视觉、语音、文本与动作序列深度融合,构建具备精细环境感知与逻辑理解能力的数字人系统,在复杂的电商实景中实现人-物-场的高度协同与自然对答。 加入我们,你的成果将直接应用于电商领域的核心场景——AI实时直播、智能客服、交互式数字导购,影响数以亿计的用户。在这里,你不仅是在写代码,更是在通过流式架构与交互算法,重新定义未来数字人的无限可能! 研究背景:在 AIGC 浪潮下,数字人已从早期的录像进化为动态实时生成。然而,业界仍面临三大核心挑战: 交互的自然度: 如何让数字人的肢体、表情与复杂的语音情感高度对齐,消除“恐怖谷”效应。 物理规律的缺失: 在电商直播等场景中,数字人需要手持商品、展示道具,如何解决手部交互(HOI)中的遮挡、形变及空间一致性是当前的技术深水区。 实时性的瓶颈: 扩散模型效果虽好但推理慢,如何实现低延迟的流式视频生成,是数字人从视频工具走向实时互动的必经之路。 研究课题: 基于扩散模型的高保真流式视频生成架构研究; 复杂场景下的人与物体交互(HOI)视频生成; 多模态情感驱动的全身动作与表情协同生成; 成长资源: 1、算力自由: 远离“算力焦虑”,专注于算法创新。 2、海量高质数据: 拥有业界独有的、极其丰富的多模态商业场景数据,未视频生成,HOI等前沿课题提供土壤。 3、鼓励顶会产出: 团队在保持业务领先的同时,高度重视学术沉淀。鼓励将研究成果总结并发表至CVPR、SIGGRAP、HNeurIPS 等顶会,支持参加国际学术会议,提升行业影响力。 4、工业界顶级专家的 1v1 指导: 团队由来自国内外顶尖院校的博士和工业界资深专家组成,实行“师兄制”,从学术论文投稿到工程落地全过程深度带教。

更新于 2026-01-21北京|杭州
logo of antgroup
社招3年以上技术类-算法

1. 负责深度学习、生成式模型在图像与视频生成领域的研发与优化,包括文本生成图像(text-to-image)、文本生成视频(text-to-video)、图像/视频编辑等。 2. 研究并实现前沿的生成模型架构(如 Diffusion Models、GAN、Transformer、NeRF 等)以及多模态融合技术(文本、音频、视频、图像)。 3. 结合业务需求,设计和训练高质量的生成模型,提升生成结果的真实感、美学质量、语义一致性和可控性。 4. 建立数据采集与清洗流程,构建高质量的训练、微调和评估数据集(涵盖图像、视频、多模态)。 5. 设计、实现并维护模型推理服务,包括模型部署、性能优化、成本控制和稳定性保障。 6. 对生成模型的评测指标进行研究和完善,包括自动化评分、用户反馈收集、强化学习奖励函数等。 7. 跟进计算机视觉、生成式AI、多模态领域业界及学术新技术,并快速验证和落地。

更新于 2026-04-01北京|杭州
logo of tencent
社招5年以上腾讯视频技术

1.负责针对影视任务(如影视后期编辑、ai视效、ai短剧等)视频生成与编辑领域核心算法的研究与开发,涵盖 Text-to-Video、Image-to-Video、Video Editing、视频理解生成统一模型、image/video relighting、3D生成等技术方向; 2.针对影视工业的高标准需求,攻克生成视频的"AI感"、时序细节一致性、画质细节等关键问题; 3.探索并落地生成内容的精细化控制方案,提升模型输出的艺术表现力与商业可用性; 4.紧跟学术界与工业界最新研究进展,快速复现并评估 SOTA 算法,结合影视业务场景进行创新性改进,推动前沿技术向生产力转化; 5.与产品、工程、内容创作团队紧密协作,将算法能力转化为实际产品功能。

更新于 2026-02-13北京
logo of alibaba
实习阿里巴巴日常实习

岗位课题: 1.电商视频生成模型研发 2.多个视频应用模型研发 3.原生支持中文的图像生成模型研发 4.有语义泛化性的图像编辑模型研发 课题背景: AIGC 生成已成为广告创意制作的主流制作形式,基于AIGC 图像和视频生成模型提供了丰富的素材并持续提升创意制作的美观度和多样性。同时视频和图像生成模型也是各科技公司在AI 领域争夺的中心领域之一。 阿里妈妈在过去两年从业务需求出发,持续研发电商领域的多模态生成模型,推出了淘宝星辰视频生成模型、图生视频模型、短视频模型、服饰模特生图模型、图文海报制作等多个原创能力,并成功落地万相营造、万相台无界版、千牛、光合平台、生意管家等多个工具平台和展示、搜索、外投等多个投放场景的创意制作。 岗位职责: 你将有机会参与核心多模态大模型研究工作,深入到数据准备 |  Caption | 训练系统搭建 |  Encoder | Pretraining | Continuous training |  SFT |  Post training  等多模态生成的方方面面, 亲手解决大模型研发的问题,并最终交付电商场景领先的生成模型,以及有机会提前获得校招T-Star的正式Offer。

更新于 2026-03-20北京|杭州