快手AIGC数字人算法工程师-【商业化】
任职要求
1、具备数字人训练相关的算法背景,在此领域拥有丰富的实践经验,对业界前沿技术有深刻的认知与独到见解; 2、三年以上相关工作经验,精通 Python,并熟悉 Java/Go 语言;具备良好的编码规范和文档撰写习惯,以及优秀的面向对象设计能力; 3、拥有出色的问题抽象能力和系统架构设计能力…
工作职责
1、负责数字人生产管理端的核心架构设计与实现,高效管理直播口型同步与视频合成结果,并持续迭代数字人形象的自动化训练服务; 2、主导数字人形象的自动化训练流程,包括视频素材的上传、训练任务的智能调度、形象资产的存储与管理,以及最终的线上部署; 3、负责A2E (Audio-to-Expression) / E2V (Expression-to-Video) 实例的调度与状态维护,支持任务排队管理及短视频生产服务的实例调度。
如果你,期望在阿里巴巴生态的广阔场景中,借助海量用户数据和先进的技术能力,打造千人千面的个性化数字人形象生产系统,为亿级用户提供高度定制化的虚拟形象服务; 如果你,期望攻克高保真语音驱动(Speech-to-Video)的核心难题,研发业界领先的唇形同步、情绪化面部表情及肢体动作生成算法,实现从音频到视频的端到端极致还原,赋予数字人如同真人般的自然表达力与情感共鸣; 如果你,期望挑战实时流式生成的技术难题,探索扩散模型与自回归模型的极速推理优化,实现低延迟、高吞吐的视频流实时产出,打破离线渲染的局限,支撑起百万级并发的实时交互直播场景; 如果你,期望突破数字人与物理世界的边界,深耕复杂物体交互(Human-Object Interaction)技术,解决数字人在手持商品、展示道具等动态交互过程中的物理规律约束、空间一致性及遮挡还原难题,让数字人在导购、演播等场景中具备真实的物体操控能力; 如果你,期望深入探索多模态统一大模型的应用,将视觉、语音、文本与动作序列深度融合,构建具备精细环境感知与逻辑理解能力的数字人系统,在复杂的电商实景中实现人-物-场的高度协同与自然对答。 加入我们,你的成果将直接应用于电商领域的核心场景——AI实时直播、智能客服、交互式数字导购,影响数以亿计的用户。在这里,你不仅是在写代码,更是在通过流式架构与交互算法,重新定义未来数字人的无限可能! 研究背景:在 AIGC 浪潮下,数字人已从早期的录像进化为动态实时生成。然而,业界仍面临三大核心挑战: 交互的自然度: 如何让数字人的肢体、表情与复杂的语音情感高度对齐,消除“恐怖谷”效应。 物理规律的缺失: 在电商直播等场景中,数字人需要手持商品、展示道具,如何解决手部交互(HOI)中的遮挡、形变及空间一致性是当前的技术深水区。 实时性的瓶颈: 扩散模型效果虽好但推理慢,如何实现低延迟的流式视频生成,是数字人从视频工具走向实时互动的必经之路。 研究课题: 基于扩散模型的高保真流式视频生成架构研究; 复杂场景下的人与物体交互(HOI)视频生成; 多模态情感驱动的全身动作与表情协同生成; 成长资源: 1、算力自由: 远离“算力焦虑”,专注于算法创新。 2、海量高质数据: 拥有业界独有的、极其丰富的多模态商业场景数据,未视频生成,HOI等前沿课题提供土壤。 3、鼓励顶会产出: 团队在保持业务领先的同时,高度重视学术沉淀。鼓励将研究成果总结并发表至CVPR、SIGGRAP、HNeurIPS 等顶会,支持参加国际学术会议,提升行业影响力。 4、工业界顶级专家的 1v1 指导: 团队由来自国内外顶尖院校的博士和工业界资深专家组成,实行“师兄制”,从学术论文投稿到工程落地全过程深度带教。
1、负责应用侧的流量接入、排队管理、状态管理等核心模块的设计与研发; 2、负责数字人直播中的脚本解析、TTS语音合成、商品展示、缓存策略等关键能力的设计与研发; 3、负责处理直播与视频生产指令,实现直播间的实时图层合成、视频转码、高效渲染与稳定推流; 4、基于大语言模型(LLM)对直播间实时评论进行分析,生成互动回复内容,并以口播形式无缝合入直播流; 5、应用前沿的多模态实时互动技术,支持并实现数字人在线连麦等创新互动功能。
1. 负责商业化广告创意大模型能力建设,基于 LLM / MLLM / Agent 技术,构建文案生成、笔记改写、卖点提炼、风格仿写、爆款内容解析等核心能力,提升创意生产效率与投放效果。 2. 研发面向广告场景的创意 Agent,围绕广告主诉求理解、行业知识注入、素材理解、创意路径规划、可控生成、多轮交互、质量评测等环节,构建自动化创意生产闭环。 3. 探索并落地大模型后训练与生成控制技术,包括 SFT、指令调优、偏好对齐、强化学习、Reward Model、RAG、文风建模等,提升生成内容的稳定性、相关性和投放竞争力。 4. 深入广告业务,结合行业特征、用户兴趣、搜索词、投放数据和历史优质素材,持续优化文案质量、点击转化效果、素材覆盖率和客户使用体验。 5. 建设生成内容评测与治理体系,包括幻觉检测、广告合规、文案质量评估、badcase 分析和负反馈治理,保障大模型能力在真实投放场景中稳定规模化应用。
ByteIntern:面向2027届毕业生(2026年9月-2027年8月期间毕业),为符合岗位要求的同学提供转正机会。 团队介绍:火山方舟是火山引擎推出的一站式大模型服务平台,是中国大模型市场产品和份额领跑者。平台提供模型推理、评测、精调等全流程服务。方舟搭载了豆包及业界主流大模型,提供丰富的插件生态和AI应用开发服务,并通过稳定可靠的安全互信方案、专业的算法技术服务,全方位保障企业级AI应用落地。 1、优化Seedream系列模型,为模型的通用能力提升相关技术负责,包含图像理解、图像生成、图像编辑等前沿技术; 2、推动技术在内容创作/特效/素材生成/辅助设计等领域的应用; 3、参与技术规划制定,把握图像生成技术最新发展趋势。