logo of kuaishou

快手【留用实习】音频/音乐AIGC算法工程师

实习兼职J1010地点:北京状态:招聘

任职要求


1、硕士及以上学历机器学习模式识别、信号处理等计算机相关专业优先;
2、有较丰富的语音/音频/音乐生成大模型相关领域经验;
3、熟练掌握C/C++Python,有较强的代码实现能力;
4、具有独立解决问题的能力,良好的表达能力、沟通能力和团队合作意识。

加分项:
1、有T2A、V2A、TTS和音乐生成大模型技术研发经验者优先;
2、相关顶会或期刊上发表论文者优先(ICASSP,Interspeech,ISMIR,ICML,AAAI,NIPS等)。

工作职责


1、负责AI音频/音乐生成大模型关键算法研发和优化,包含但不局限于T2A、V2A和AI歌曲生成等方向;
2、负责跟进行业前沿技术发展趋势,跟踪国际最新技术发展方向;
3、推动音频/音乐AIGC技术在快手各业务场景中的落地,探索音频/音乐生成技术在业务中的新玩法和业务创新。
包括英文材料
学历+
机器学习+
模式识别+
大模型+
C+
C+++
Python+
ICML+
NeurIPS+
相关职位

logo of kuaishou
实习J1016

1、负责直播连麦音频SDK相关功能的开发和问题调试; 2、负责音频算法在iOS和Android端的集成和问题调试; 3、负责持续优化音频SDK性能和用户体验。

更新于 2025-03-07
logo of kuaishou
实习J1001

1、研究多模态数据(如音频、视频、自然语言、用户交互)的分析、处理和生成算法,实现多种模态间的融合、转化和交互; 2、探索新颖的多模态交互与生成的应用场景,推进多模态信息处理在不同业务场景下的落地。

更新于 2025-05-08
logo of kuaishou
实习gamePlan

1、游戏世界的“创世者”,负责游戏内人设、怪物设定,与其他同事合作搭建令人感动投入的虚拟世界; 2、游戏世界的“绝对编剧”,负责主线、支线故事剧本的写作与实现,讲述游戏角色的生死喜乐; 3、协同美术音频等其他职能同学完善游戏世界,铺设世界细节。

更新于 2025-06-19
logo of kuaishou
实习J1007

1、打造最适合短视频、直播、搜索推荐、电商、创作者玩法的多模态大模型,为快手的各项业务提供基座模型技术支持。多模态技术是通向AGI的重要方法和里程碑,期待和更多对多模态技术感兴趣的同学一起打造真正带来价值的模型算法技术; 2、深度探索多模态大模型的多阶段预训练、监督微调和RLHF等技术,打造业界第一梯队的多模态大模型,赶超GPT-4o、Gemini Pro等闭源模型的实际使用效果; 3、图片、语音、音频和视频多种模态信号的高效处理方式探索,提供对各类信号最精准的理解能力; 4、混合专家、蒸馏剪枝等兼顾模型性能和效果的技术探索。

更新于 2025-05-14