logo of mihoyo

米哈游【日常实习】AudioLLM 研究员

实习兼职程序&技术类地点:上海状态:招聘

任职要求


1. 计算机科学、人工智能、电子工程等相关博士学历
2. 具备大模型LLM 或多模态)训练经验,熟悉 Transformer 架构与大规模分布式训练
3. 深入掌握以下至少一方向
• 通用音频自监督表征,如 Best-RQ, CLAP, wav2vec bert2.0 等
• Omni模型架构和多模态RL
• 语音识别/情感识别/音乐信息检索算法
4. 精通 Pytorch,具备海量数据处理经验
5. 具备跨时区协作与良好沟通能力,结果导向,责任心强

加分项
1. 在 NeurIPS/ICML/ICASSP/ISMIR 等顶级会议发表论文
2. 负责过百万小时级多类型音频数据管理
3. 拥有音频文本跨模态对齐、指令微调或多任务学习实践
4. 在音频 AI 或音乐 AI 领域有开源贡献或技术影响力

工作职责


专注于AudioLLM通用音频理解模型的研究与开发,参与构建下一代音频基础模型和Omni多模态框架,探索语音、音乐、环境声音等多模态音频内容的统一理解建模方法,推动 audio AI 在理解、生成和交互场景中的技术突破。
 
核心职责:
1. 模型架构与训练:负责通用音频理解模型设计与分布式训练优化,实现语音识别、情感分析、音频问答、音乐理解、声音事件检测等多任务统一建模
2. 数据管线:设计并落地大规模多模态音频数据 pipeline,完成数据对齐、质量控制与自动标注
3. 跨模态融合:研究音频编码器与大语言模型融合技术,优化跨模态注意力与统一特征表示
包括英文材料
学历+
大模型+
Transformer+
语音识别+
信息检索+
算法+
PyTorch+
NeurIPS+
ICML+
相关职位

logo of youku
实习虎鲸文娱2026

1、负责动画剧集的前期开发与立项 2、保障项目的上线时间和品质,监制动画制作 3、大量阅读网络文学,熟悉男频玄幻品类,甄选分析有改编潜质的作品,作为IP储备 4、探索动漫行业与AIGC技术应用的结合,推进动漫生产质量和效率的提升

更新于 2025-06-24
logo of youku
实习虎鲸文娱2026

1、负责AIGC大模型算法的研究和开发 2、负责多模态算法的研究和开发

更新于 2025-06-12
logo of youku
实习虎鲸文娱2026

-跟进学术前沿及落地成果,探索在我们工作中的应用价值 -设计制定数据自动化构造方案,完成数据准备 -参与模型训练调优和部署

更新于 2025-06-11
logo of youku
实习虎鲸文娱2026

1、根据业务需求,完成策划选题,进行世界观、剧情人物架构等设计; 2、能独立推进或配合完成剧本开发流程,按项目要求完成文学创作及剧本产出; 3、关注市场流行趋势,挖掘创新类题材,具备文学改编能力,能驾驭不同类型故事的编创。

更新于 2025-05-28