千问算法实习生-多模态生成方向
任职要求
1、计算机科学、人工智能、机器学习或相关专业,硕士及以上学历优先;具备扎实的数理基础(线性代数、概率统计、最优化理论)及算法设计能力; 2、精通Python等编程语言,熟悉Linux开发环境,有良好编程习惯和较…
工作职责
1、参与图像和视频生成相关Agent的核心算法架构设计、开发与性能优化,完成模型训练、数据流水线构建及算法工程化部署,推动实际业务场景落地; 2、参与建设后训练技术如SFT、RLHF等在Agent实际场景中落地; 3、参与Agent链路中的Reward model模型建设,加速业务演进。
1. 主导或参与图像/视频生成大模型的核心算法研发,聚焦扩散模型及VAE的前沿架构创新优化,完成大规模分布式训练、数据流水线构建及算法工程化部署; 2. 推动视觉生成技术在夸克多产品线的场景化落地,解决实际工程问题,实现从算法原型到工业级系统的端到端优化; 3. 开展前沿算法研究,探索多模态后训练、可控生成及推理加速等方向,保持算法的领先性。
1. 参与图像生成、图像编辑和文档理解其中一个方向的工作,围绕效果和速度,通过算法创新持续提升业务天花板; 2. 围绕扩散模型、生成加速、融合模型等方向,不断探索前沿算法,保持方案领先性,助力业务取得效果突破; 3. 围绕数据构建、vae、dit、moe、训练策略等环节,挖掘突破口,持续改进提升。

1. 算法研发:聚焦自动驾驶、车载或机器人领域的算法和模型研发,不限于世界模型、视频生成模型、多模态大模型和VLA模型。 2. 业务落地:负责车载和自动驾驶业务的研究、设计、开发和优化工作。参与项目的需求分析、设计评审和代码评审。跟踪和研究领域的前沿技术和趋势,为项目提供技术支持。
我们是小红书应用算法部/内容理解算法组,目前专注于内容理解场景的技术落地和产品预研。我们希望寻求优秀在读硕士生/博士生共同突破多模态/视觉大模型理解和生成算法在多模态内容理解行业落地的技术挑战,作为实习生,你将有机会与产品、工程紧密合作,将研究算法应用到实际问题中,并解决有难度有价值的问题,促进领域前沿技术的发展。欢迎投递简历。该岗位的核心研究方向包括但不限于: 1. 计算机视觉:解决视觉理解中指代关系特征归一化和识别研究; 2. 多模态表征:多源数据中多模态表征技术,包括局部/全局匹配、视频表征、多模态表征、对抗性和泛化性等问题。 3. 通用多模态大模型:通用多模态大模型在安全领域理解相关研究,包括强化微调、逻辑推理、多模态理解、幻觉消除及评价机制等。 我们希望在一个和多个方向做出有意义的、创新性的工作。