logo of tongyi

通义通义实验室-技术专家-语音/多模态

社招全职3年以上技术-基础平台地点:北京 | 杭州状态:招聘

任职要求


1. 计算机科学、人工智能、软件工程或相关领域的硕士或以上学位。 至少5年的AI平台开发经验,不要求有大模型开发经验。 
2. 熟悉多种机器学习框架和工具(如 TensorFlowPyTorch、Hugging Face等)。 
3. 对大数据技术和云服务平台(如 AWS、Azure、GCP、阿里云)有深入理解和实战经验。有…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


团队介绍:
通义实验室语音工程团队主要负责通义系列模型在语音及其他更广泛的多模态交互、理解场景下的落地和应用。我们在阿里云上提供业界领先、开箱即用的模型服务API,支持全世界的开发者,以及阿里集团内如钉钉、淘天、夸克等30+业务线。我们同时也在和算法科学家们一道探索最前沿模型的能力边界,构建以多模态大模型为核心的新产品,向外展示通义的技术先进性和影响力。								

职位描述:
1. 探索应用多模态理解与生成大模型,并进行极致端到端系统优化。
2. 建设超低延迟、高可用、可扩展的分布式模型服务系统,支持业务算法生产和高效迭代。
3. 探索构建多模态交互的通用多模态Agent、应用,推动多模态模型的落地和应用,研发以AI技术为核心的新技术、新产品。
4. 分析和解决复杂的软硬件技术问题,提供可靠的技术解决方案。 跟踪行业最新的多模态大模型和应用开发工具和技术,将最佳实践和创新集成到平台中。
5. 撰写技术文档,包括设计规范、操作手册和最佳实践指南。
包括英文材料
学历+
大模型+
机器学习+
TensorFlow+
PyTorch+
大数据+
还有更多 •••
相关职位

logo of quark
社招3年以上技术类-开发

1、负责语音方向团队建设,支持整体系统架构设计及核心功能开发; 2、对语音技术进行持续优化,支持先进语音大模型技术落地,提升语音产品的延迟、吞吐、稳定性; 3、负责语音系统的日常维护和迭代升级,发现并解决系统中的技术问题; 4、对接各类算法和业务场景,负责语音大模型相关项目的落地与优化,全链路提升产品语音交互体验。

更新于 2026-03-25广州
logo of cainiao
社招5年以上技术类-开发

1、负责 Voice Agent 中控编排系统(Orchestrator)的设计与落地 2、构建 ASR → NL → LLM → TTS 端到端语音链路并做工程化优化(并发控制、低延迟优化、分片流式处理、错误恢复机制) 3、设计与优化 Prompt 工程、Function Calling、工具调用、Agent 状态机 4、构建 Voice Agent 的“中断/打断”检测体系与决策引擎,包括不限于:音频能量检测、ASR 级别中断词库、LLM-based interrupt classifier、优先级调度。 5、推动 Agent 系统的质量体系建设,包括不限于:自动化评测、回放系统、Agent Trace、模型响应审计、Latency Profiling。 6、深度参与 Voice Agent 的性能优化,如:Token 成本优化、缓存策略、向量库优化、ASR/TTS 服务吞吐提升、服务并发治理。吞吐、并发、缓存、Token 成本 7、跨团队协作,与产品/算法/SRE 共同推进 Voice Agent 场景落地,包括不限于:新功能快速落地、A/B 实验、Agent 行为修正。 8、跟踪 Voice/LLM/Agent 前沿技术,例如:语音大模型(Whisper/Salmonn)、MCP、Multi-Agent、上下文压缩、OpenAI Realtime API

更新于 2026-02-04杭州
logo of alibaba
社招5年以上技术类-数据

1.开展音频模型能力评测建设,基于评测的错误类型、分布,能针对性构建音频数据,提高模型特定表现,并能够通过对数据有效性的评测,验证数据有效性; 2.建设AI音频应用业务评测维度、指标体系、业务评测集并开展深入的评测分析工作。产出评测报告,学术benchmark等有影响力的创新工作。

更新于 2026-06-04北京|杭州
logo of aligenie
社招5年以上技术类-数据

1.开展音频模型能力评测建设,基于评测的错误类型、分布,能针对性构建音频数据,提高模型特定表现,并能够通过对数据有效性的评测,验证数据有效性; 2.建设AI音频应用业务评测维度、指标体系、业务评测集并开展深入的评测分析工作。产出评测报告,学术benchmark等有影响力的创新工作。

更新于 2026-06-04北京|杭州