logo of antgroup

蚂蚁金服研究型实习生-高真人感语音合成大模型的研究与应用落地

实习兼职研究型实习生地点:杭州 | 深圳状态:招聘

任职要求


研究领域:
-目前正在攻读计算机科学/电子信息等相关专业的学士,硕士或博士学位
-围绕前沿的语音算法技术,方向包括但不限于语音识别、语音合成、语音克隆等;
-具有上述研究领域的相关经验,包括行业经验或作为参与实验室研究
优先录用:
-熟练掌握Pytorch/TF等深度学习框架,并有一定的AI算法研发和落地经验者优先;
-对语音方向有浓厚兴趣,熟悉语音领域的前沿技术,有Zero-Shot TTS算法韵律/真人度调优经验者优先;
-语音合成/语音克隆等相关学术背景及研发经验,在相关领域期刊/会议(如ICASSP、InterSpeech等)发表过文章者优先。
-至少6个月的全职工作

工作职责


研究领域:
  多媒体
项目简介:
  在AGI产品日益普及的当下,语音作为用户与智能系统之间的重要交互方式,正被广泛接受和应用。为了提供更为自然流畅的语音交流体验,我们需要聚焦以下关键问题:
1. 语言特性:包括韵律、情感等语音习惯的模拟,使得合成语音更接近于真实人类的表达,确保对话的流畅性和可控性。
2. 实时响应:力求在极短的响应时间内(毫秒级)生成语音,以满足用户对于实时互动的需求。
因此,本项目旨在研发高可信度的语音合成方案,并将其成功应用于支小宝等业务场景中。研究方向涵盖但不限于情感可控合成、副语言合成、韵律控制、流式生成等多个技术领域。
包括英文材料
学历+
算法+
语音识别+
PyTorch+
深度学习+
相关职位

logo of alibaba
实习淘天集团研究型实

欢迎加入阿里巴巴数字人团队! 如果你对以下领域感兴趣,并希望在实际项目中积累经验,欢迎加入我们! 你将参与的工作: 个性化数字人形象生成系统 在海量用户数据和先进技术支持下,协助开发能够生成千人千面个性化虚拟形象的系统。 学习并应用基础的图像处理和生成模型,帮助提升系统的定制化能力。 高表现力肢体表情驱动技术研发 参与研发基于动作捕捉、表情合成和实时渲染技术的数字人表情和肢体动作驱动系统。 协助优化现有技术,使数字人的表情和动作更加自然流畅,增强情感表达能力。 核心技术难题攻克 在导师指导下,学习和探索基于扩散模型的高质量数字人生成技术。 多模态统一大模型的应用 了解并参与多模态信息融合的研究,结合图像、文本、音频等多种信息,构建具备理解能力和生成能力的数字人系统。 协助解决业界尚未突破的技术瓶颈,推动技术创新。 相关研究课题细分方向: 数字人形象定制与风格化迁移 协助开发和优化数字人形象定制生成能力,适配不同的实时互动场景。 学习并应用基本的图像处理和生成算法,提升系统的灵活性和适应性。 数字人表情与肢体动作驱动 在导师指导下,参与数字人表情和肢体动作驱动技术的研发。 协助测试和优化现有系统,使其表现力更接近真人水平。 数字人多模态理解感知能力 参与构建数字人与用户的实时交互系统,提升其理解和响应能力。 协助进行多模态信息融合实验,增强数字人的个性化服务能力。 我们期待你是: 计算机科学、软件工程、人工智能等相关专业的在校学生(本科或研究生)。 对数字人技术有浓厚兴趣,愿意在实践中学习和成长。 具备一定的编程基础(如Python、C++),熟悉常用的数据处理和机器学习框架(如PyTorch、TensorFlow)者优先。 良好的团队合作精神和沟通能力。 加入我们,你将获得: 丰富的实战经验和前沿技术的学习机会。 导师一对一指导,助力你的职业发展。 参与影响亿级用户的大规模项目,感受技术带来的巨大价值。 开放包容的工作环境和充满活力的团队氛围。 让我们一起定义未来数字人的无限可能,期待你的加入!

更新于 2025-10-17
logo of amap
实习高德研究型实习生

业务丰富,技术领先 高德打车算法团队深度赋能打车业务全链路,涵盖 用户增长、风控、服务管控、路线与上下车点推荐、ETA 预估、智能客服 等核心场景。多样化的业务挑战为算法创新提供了广阔的发挥空间,团队已在 AI 顶级会议发表成果。 精英阵容,国际视野 团队成员来自泰晤士世界大学排名 Top 10 的高校,以及美国常青藤、清华、北大等顶尖院校,兼具国际化背景与一流技术视野。 持续成长,共享共进 团队每周固定进行技术分享,氛围开放、互助友好;除了解答算法与工程难题,资深同事还会分享项目经验,并传授业务理解与问题解决的方法论,助你快速成长。 我们正在寻找相关专业的优秀实习生,一同探索前沿大模型技术在共享出行领域的深度应用,共同攻克业界难题,优化产品体验。 在这里,你将运用大模型、强化学习、深度学习等先进技术处理海量数据,推动用户体验优化与平台效率提升,主要包括: 1. 行程问题智能处理:构建并优化模型,识别司乘纠纷、费用异常、服务质量波动、安全风险、客诉等多类行程问题,并实现自动化处理方案。 2. 前沿技术落地:将多模态大模型及相关技术(PE、SFT、DPO、RAG、AI Agent、Agentic RL、AIGC 等)应用于业务场景,显著提升算法效果与业务指标。 3. 问题建模与解决:将业务场景中的复杂问题抽象为数据建模或科学研究课题,提出可行解决方案并高质量落地。 在这里,你的算法将直接服务全国数亿级用户,带来真实而深远的影响;你能接触到前沿大模型、多模态、强化学习等核心技术,并与顶尖同事共创,在开放包容的创新氛围下,发挥AI创造力。

更新于 2025-09-25
logo of amap
实习高德研究型实习生

业务丰富,技术领先 高德打车算法团队深度赋能打车业务全链路,涵盖 用户增长、风控、服务管控、路线与上下车点推荐、ETA 预估、智能客服 等核心场景。多样化的业务挑战为算法创新提供了广阔的发挥空间,团队已在 AI 顶级会议发表成果。 精英阵容,国际视野 团队成员来自泰晤士世界大学排名 Top 10 的高校,以及美国常青藤、清华、北大等顶尖院校,兼具国际化背景与一流技术视野。 持续成长,共享共进 团队每周固定进行技术分享,氛围开放、互助友好;除了解答算法与工程难题,资深同事还会分享项目经验,并传授业务理解与问题解决的方法论,助你快速成长。 高德打车算法团队致力于用前沿AI技术重塑每一次打车体验。我们不是在做“推荐路线”,而是在理解用户为什么这样出行——他们偏爱哪条路?为何总在某个路口取消订单?哪些投诉背后藏着未被听见的需求? 我们正在寻找对用户行为洞察和大模型落地充满热情的实习生,与我们一起,用AI读懂出行的“潜台词”,让平台更懂你。 在这里,你将: • 构建用户出行偏好画像 基于海量行程数据,利用大模型(LLM)挖掘用户在路线选择、上下车点偏好、出行时段等方面的隐性行为模式,构建个性化出行画像,驱动个性化推荐与服务预判。 • 挖掘路线与上下车点的“隐藏特性” 分析亿级路线片段与上下车点的时空特征,通过大模型语义理解与多源信息融合,提炼可量化、可解释的“路段 / POI 质量标签”,优化点线相关推荐服务的质量。 • 提升投诉反馈的智能响应与信息透出能力 构建基于大模型的客诉理解与归因系统,自动识别投诉核心诉求(如“绕路”“司机态度”“等太久”),关联具体路线/上下车点/时段,生成结构化反馈报告,推动产品优化与客服话术升级,实现“从听抱怨到改体验”的闭环。 • 推动大模型技术在真实场景中的闭环落地 应用RAG、SFT、DPO、AI Agent等技术,构建可解释、可追踪、可迭代的智能系统,让模型不只是“跑得准”,更能“说得清、改得动、用得好”。 你的工作将直接服务全国数亿用户,每一次模型优化,都可能让一位用户少等5分钟、多一份安心、少一次投诉。你不是在写代码,你是在重塑人与出行之间的信任关系。

更新于 2025-09-25
logo of amap
实习高德研究型实习生

高德共享出行算法研发部,负责共享出行业务的算法模型构建和服务部署,包括用户增长、风控和派单等方向。利用高德地图丰富的人地交互数据,我们致力于将因果推断、搜索推荐、大模型和强化学习等最新算法技术应用于共享出行领域,在提升平台效率的同时,为用户提供更优质的出行体验。我们正在寻找相关专业的优秀实习生,一同探索最前沿的算法技术在共享出行用户增长方向的应用,共同攻克业界难题,优化产品体验。 职位内容: 1. 基于人地交互数据开发业界领先的机器学习算法; 2. 探索因果推断、推荐算法和大模型等技术在用户增长业务中的应用; 3. 撰写并发表国际顶级会议论文,以及申请专利等科研工作

更新于 2025-03-27