logo of aligenie

智能互联千问C端事业群-音频多模态理解算法专家-杭州/北京/上海

社招全职2年以上技术类-算法地点:北京 | 杭州 | 上海状态:招聘

任职要求


1. 计算机、信号处理、数学等相关专业硕士/博士学位,3 年以上相关工作经验;
2. 在语音识别、音乐理解、音频分类、声学事件检测或多模态理解领域有深入研究,具备大规模数据训练经验;
3. 熟练掌握 PyTorch/Dee…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1. 负责音频多模态理解大模型的研发,包含语音识别、语音翻译、副语言理解、音频事件检测或音频captioning等任务的基础研究和应用落地;
2. 研究音频编码器、跨模态对齐、强化学习、多任务学习或语音端到端等技术方向;
3. 跟踪并落地领域内前沿论文,保持技术方案的领先性。
包括英文材料
学历+
语音识别+
PyTorch+
DeepSpeed+
还有更多 •••
相关职位

logo of quark
社招2年以上技术类-算法

1. 负责音频多模态理解大模型的研发,包含语音识别、语音翻译、副语言理解、音频事件检测或音频captioning等任务的基础研究和应用落地; 2. 研究音频编码器、跨模态对齐、强化学习、多任务学习或语音端到端等技术方向; 3. 跟踪并落地领域内前沿论文,保持技术方案的领先性。

更新于 2026-04-02北京|杭州|上海
logo of quark
社招2年以上技术类-算法

1. 负责音频多模态生成大模型的研发,包含语音合成、音乐生成、音效生成和歌曲生成等任务的基础研究和应用落地; 2. 研发基于扩散模型(Diffusion Models)或自回归模型(AR)的音频生成算法; 3. 研究音频表征、强化学习或语音端到端等技术方向。

更新于 2026-04-02北京|杭州|上海
logo of aligenie
社招2年以上技术类-算法

1. 负责音频多模态生成大模型的研发,包含语音合成、音乐生成、音效生成和歌曲生成等任务的基础研究和应用落地; 2. 研发基于扩散模型(Diffusion Models)或自回归模型(AR)的音频生成算法; 3. 研究音频表征、强化学习或语音端到端等技术方向。

更新于 2026-04-02北京|杭州|上海
logo of quark
社招3年以上技术类-开发

1. 负责音频系统架构设计:主导智能终端的音频子系统方案设计,包括硬件选型(Codec/ADC/DAC/AMP)、接口协议(I2S/PCM/TDM)、功耗管理架构; 2. 开发基于RTOS/Linux/Android的音频驱动(ALSA/ASoC框架),适配主流芯片平台(如高通,MTK,恒玄等); 3. 实现ANC(主动降噪)、语音唤醒、空间音频等功能的底层算法集成(如Audiotec DSP库、CEVA音频IP); 4. 参与功耗优化项目,通过改进系统性能来延长设备的电池寿命。

更新于 2025-12-14深圳|杭州|上海