腾讯腾讯游戏-游戏AI算法研究员-语音处理
任职要求
1.具有语音合成工作经验,具备情感控制或多说话人、多风格语音合成相关项目经验优先; 2.深刻理解TTS原理相关技术,参与过情感语音合成或风格迁移等前沿算法研发和实际项目落地优先; 3.熟练使用python,至少精通pytorch或者tensorflow其中之一的…
工作职责
1.负责游戏领域语音合成算法研发与落地,包括不限于情绪表达控制编辑和多样化语音合成; 2.推动语音合成技术在游戏场景中的应用,实现自然且富有情绪的语音输出,为游戏端内外提供更智能化的能力; 3.研究和探索情感建模、多说话人风格迁移、情感迁移等前沿技术,储备并应用新技术能力; 4.追踪业界前沿的语音合成及相关技术,并探索应用落地。
1.负责腾讯游戏场景内3D生成相关模型研发,包括但不限于数字人相关技术(如高表现力的动作生成,表情驱动,语音驱动手势),3D游戏素材生成(场景、物体、游戏形象生成); 2.推动相关成果在游戏生产和消费场景的工业化部署和产品落地。
1.负责AI Lab语音技术团队语音技术,包括TTS、语音压缩编码、语音前端处理等,尤其是基于AIGC算法的基础研究和应用落地。 ; 2.侧重于研发语音合成、语音转换、few-shot / zero-shot TTS、音频和音乐生成等先进算法尤其是生成类算法,并且可以融合语音识别、音频分析、语音增强、语音分离等更广泛的语音/音频任务。将有关算法成果应用于语音 / 音乐 / 音效/音频生成、语音翻译(S2TT、S2ST)、虚拟人等众多场景中。 ; 3.通过跟踪和创新,确保算法方面的行业领先,通过打造语音技术PAAS平台服务于腾讯内部各个业务场景包括游戏、社交、内容服务、广告、金融、车载助手、企业服务(如腾讯会议、企业微信、企点客服、商通、数智人)等等,帮助业务产生实际价值和打造业界领先的语音应用产品。; 4.持续关注学术界和行业的最新研究动态,参与国际会议、研讨会,与全球顶级团队进行交流合作。。

工作职责【岗位职责】 你将有机会参与以下一个或多个前沿方向的研究与开发: 多模态统一模型: 参与多模态大模型(文本、语音、图像等)的前沿研究,探索生成与理解任务的统一框架,以及高效的多模态联合学习方法。 个性化对话系统: 设计并实现更具“人性”的对话系统,重点攻克长期记忆、持续学习和情境感知等关键技术,让AI能够记住与你的每一次互动。 强化学习与交互策略: 将强化学习(RL)算法创新性地应用于语音/音频相关的多模态任务中,通过与环境或用户的交互,自主优化AI的决策与沟通策略。 语音智能体(Voice Agent): 参与构建具备主动交互与复杂任务规划能力的语音Agent,使其不仅能“听懂”,更能“思考”和“行动”,完成多轮、跨领域的复杂指令。 前沿技术探索: 跟踪NeurIPS, ICML, ICLR, ACL等顶会的前沿进展,快速复现、验证并改进相关算法,推动技术落地
团队介绍:字节跳动豆包大模型团队成立于 2023 年,致力于开发业界最先进的 AI 大模型技术,成为世界一流的研究团队,为科技和社会发展作出贡献。 豆包大模型团队在AI领域拥有长期愿景与决心,研究方向涵盖NLP、CV、语音等,在中国、新加坡、美国等地设有实验室和研究岗位。团队依托平台充足的数据、计算等资源,在相关领域持续投入,已推出自研通用大模型,提供多模态能力,下游支持豆包、扣子、即梦等50+业务,并通过火山引擎开放给企业客户。目前,豆包APP已成为中国市场用户量最大的AIGC应用。 1、探索研究多模态理解、生成式、机器学习、强化学习、AIGC、计算机视觉、人工智能等前沿技术; 2、探索大规模/超大规模多模态理解与生成交织的基础模型,并进行极致系统优化;数据建设、指令微调、偏好对齐、模型优化;提升数据合成、Scalable Oversight、模型推理、规划能力,构建全面客观准确的评测体系,探索提升大模型能力; 3、探索突破包括而不限于多模态RAG,视觉COT与Agent等在内的多模态模型、世界模型进阶能力,构建GUI/游戏等虚拟世界的通用多模态Agent; 4、利用预训练、仿真等技术对虚拟/现实世界的各类环境进行建模,提供多模态交互探索的基本能力,推动应用落地,研发以人工智能技术为核心的新技术、新产品。