阿里巴巴业务技术-视觉AIGC实习生
任职要求
【必备项】 1、本科及以上学历,计算机、人工智能、电子与通信等相关专业; 2、熟悉计算机视觉、机器学习、图像分析与处理等相关领域技术和应用,有图文多模或者AIGC图像生成编辑相关经验者优先; 3、具备较强的工程实现能力,熟练掌握Python,熟悉pytorch开发; 4、学习能力强,对新事…
工作职责
● 前沿技术研发与落地负责扩散模型(Diffusion Models)的微调与优化工作,融合图文多模态技术(Vision-Language Models, MLLM)、生成式AI(AIGC)等前沿技术,打造下一代通用图像理解与编辑工具。涵盖但不限于以下方向: ● 通用图像生成编辑:构建智能化的通用图像编辑生成能力,支持多样化场景下的自动化编辑需求, 实现类似GPT4O的基于文本的通用图像编辑能力; ● 多信息注入生成:探索基于多条件约束的高质量图像生成技术,实现精准可控的内容创作; ● 虚拟试穿(Virtual Try-On):研发高效、逼真的虚拟试穿解决方案,推动时尚与零售行业的数字化转型; ● 视频生成与编辑:突破静态图像限制,开发动态内容生成与编辑能力,赋能多媒体创作生态; ● 技术创新与业务赋能密切跟踪AIGC(AI-Generated Content)领域的最新研究成果与技术趋势,深入解析顶级会议论文(如NeurIPS、ICLR、CVPR等),并快速将前沿理论转化为实际业务应用。通过技术创新驱动产品升级,为公司打造领先的AI内容生成能力。 关键亮点: ● 技术成长与学习机会:通过参与扩散模型、多模态技术和 AIGC 等前沿领域的研发,快速提升你的技术能力;接触到行业最热门的技术方向(如虚拟试穿、视频生成等),积累宝贵的实战经验; ● 顶尖资源支持:依托淘天集团海量的数据资源和强大的计算能力,为你的研发工作提供坚实保障; ● 开放协作的团队文化:加入一个聪明、包容且乐于分享的团队,在跨领域合作中拓宽视野、提升沟通能力;在团队中获得导师指导,帮助你快速适应工作节奏并实现个人成长。
团队介绍:广告业务原为商业产品与技术部门,为抖音集团的商业变现提供广告产品与技术,负责端到端大型广告系统建设,覆盖抖音、今日头条、西瓜视频、番茄小说、穿山甲等产品矩阵,践行"激发生意新可能"理念,致力于让营销更省心、更高效、更美好,推动商业的可持续增长,让不分体量、地域的企业及个体,都能通过数字化技术激发创造、驱动生意。连接广告主、用户及生态伙伴、成为开放共赢的全球最佳智能营销平台之一。在这里,你将投身建设面向未来的数字营销能力,接触到全球先进的商业产品架构、模型和算法,在互联网广告行业始终创新。 课题介绍: 1、核心技术架构: 1)下一代广告技术栈: 模型算法层:搭建基于强化学习的智能出价与流量预估系统,攻克深层转化场景下的数据稀疏、多源异构数据融合(延迟数据/埋点噪声/跨平台行为)等行业难题; 系统工程层:构建支持基于长序列特征的实时预估框架,研发支持动态创意组合的自动化投放引擎; AIGC融合层:建立文/图/视频多模态生成技术中台,实现从IP素材生成到智能投放的全链路闭环; 2)行业首创的AIGC解决方案: 正在搭建全球领先的"小说→漫剧"智能生产线,攻克三大技术堡垒: 多模态叙事引擎:研发支持角色一致性保持(Character-aware Diffusion)、分镜自动生成(Storyboard LLM)、动态运镜控制(Camera ControlNet)的复合型生成框架; 工业化工作流:构建支持分布式渲染、多版本AB测试、合规性审核的智能生产管线,实现日均千级素材产能; 投放增效系统:开发生成质量量化评估模型(QAGAN),建立素材生成-投放效果的反哺优化机制; 2、岗位挑战: 你将主导: 构建支持沿模型的混合推理框架,优化多卡并行下的生成效率; 设计跨模态对齐算法,提升文字指令到视觉元素的可控生成精度; 研发基于用户行为分析的智能素材变异系统,实现CTR提升30%+的个性化内容生成; 打造从内容生产到实时竞价的全自动化广告引擎; 3、我们期待这样的开拓者: 精通Diffusion Models技术栈,具有LoRA/ControlNet/T2I-Adapter等微调框架的实战调优经验; 熟悉多模态大模型(如VideoPoet、Sora等视频生成技术原理),具备跨模态表征学习研究背景; 拥有广告算法背景者优先,熟悉CVR预估、智能出价等核心模块与生成式AI的结合点; 出色的工程化能力,主导过至少一个完整AIGC项目的端到端落地(从模型训练到服务部署)。
1、负责通过基于大语言模型及多模态大模型的微调、prompts调优、指令构建及演化技术,将大模型的生成、理解、交互能力在公司核心业务场景应用落地,包括但不限于AIGC创意生成、视频处理、智能化特效、智能对话、代码生成、音视频传输、电商场景内容理解等; 2、负责LLM及多模态大模型的应用中台及相关技术模块搭建,包括但不限于Agents 、RAG、 function call、system prompts等,探索大模型应用前沿及新兴应用场景; 3、跟踪行业及大模型技术发展,结合业界前沿技术和业务需求,打造大模型应用的最佳实践; 4、了解业务,与公司各技术团队密切配合,能与产品、运营等角色高效沟通需求和目标,发挥自己的主观能动性,设计技术解决方案,培养自己的良好的业务sense和综合素质。
1、协助支持海外广告投放与优化的数据整理和收集,媒体平台不限于Google Ads、Facebook Ads、TikTok等;参与AI产品海外投放业务各个环节的日常数据监控与洞察,维系多维度的投放表格;通过数据追踪和分析,支持广告效果最大化; 2、针对海外达人进行内容审核,评稿,达人筛选工作;对接但不限于TT,INS渠道代理,把控达人质量和推广内容的优质度。为效果负责,支持累计和分心达人转化数据和后端效果; 3、针对投放素材进行创意收集和英文本地化审核,有一定的视觉广告sense,能够支持素材批量产出,分析不同创意、文案、投放时间等对广告效果的影响;协助海外投放调研工作,分析各国广告市场投放趋势和素材收集、竞品投放策略和用户行为,为投放策略调整提供数据支持; 4、支持日常部门协同和对接,沟通商店业务和技术部门,协助把控投数据的对接和同步。
1、负责通过基于大语言模型及多模态大模型的微调、prompts调优、指令构建及演化技术,将大模型的生成、理解、交互能力在公司核心业务场景应用落地,包括但不限于AIGC创意生成、视频处理、智能化特效、智能对话、代码生成、音视频传输、电商场景内容理解等; 2、负责LLM及多模态大模型的应用中台及相关技术模块搭建,包括但不限于Agents 、RAG、 function call、system prompts等,探索大模型应用前沿及新兴应用场景; 3、跟踪行业及大模型技术发展,结合业界前沿技术和业务需求,打造大模型应用的最佳实践; 4、了解业务,与公司各技术团队密切配合,能与产品、运营等角色高效沟通需求和目标,发挥自己的主观能动性,设计技术解决方案,培养自己的良好的业务sense和综合素质。