通义通义实验室-AI交互系统高级架构师-北京/杭州
任职要求
1. 计算机、人工智能、自动化或相关专业硕士及以上学历,8年以上AI算法研发经验,5年以上大型系统架构设计经验。 2. 在多模态人机交互领域有扎实积累,精通至少三项核心技术:语音处理(ASR/TTS/NLU)、计算机视觉(人脸/手势/场景理解)、自然语言处理、对话系统、行为建模或个性化推荐。 3. 熟悉端侧AI部署全流程,掌握模型压缩(剪枝/量化/蒸馏)、推理加速(TensorRT、NNAPI、Core ML等)及异构计算优化技术。 4. 具备优秀的系统抽象与工程落地能力,熟练使用C++/Python,熟悉Linux/Android/QNX等嵌入式或移动操…
工作职责
1. 主导面向ToB行业(如AI手机厂商等)的多模态交互系统整体架构设计,制定可扩展、高性能、低延迟的技术方案。 2. 深度参与客户需求分析,抽象行业共性问题,构建标准化、模块化的交互算法平台,支持多客户、多终端快速适配。 3. 负责核心交互链路的设计与优化,包括但不限于:端云协同语音识别与合成、多轮对话管理、视觉-语言跨模态理解、情境感知建模、用户意图预测与个性化响应。 4. 推动算法在资源受限设备(如手机SoC)上的高效部署,兼顾精度、功耗与实时性。 5. 牵头关键技术攻关,评估并引入大模型(LLM)、多模态基础模型(Multimodal Foundation Models)等前沿技术在交互场景中的应用路径。 6. 协同产品、硬件、OS、云服务及客户工程团队,确保技术方案从概念到量产的高质量交付。 7. 输出面向客户的架构白皮书、技术提案及标杆案例,支撑售前技术交流与生态合作。

1. 主导面向ToB行业(如AI手机厂商等)的多模态交互系统整体架构设计,制定可扩展、高性能、低延迟的技术方案。 2. 深度参与客户需求分析,抽象行业共性问题,构建标准化、模块化的交互算法平台,支持多客户、多终端快速适配。 3. 负责核心交互链路的设计与优化,包括但不限于:端云协同语音识别与合成、多轮对话管理、视觉-语言跨模态理解、情境感知建模、用户意图预测与个性化响应。 4. 推动算法在资源受限设备(如手机SoC)上的高效部署,兼顾精度、功耗与实时性。 5. 牵头关键技术攻关,评估并引入大模型(LLM)、多模态基础模型(Multimodal Foundation Models)等前沿技术在交互场景中的应用路径。 6. 协同产品、硬件、OS、云服务及客户工程团队,确保技术方案从概念到量产的高质量交付。 7. 输出面向客户的架构白皮书、技术提案及标杆案例,支撑售前技术交流与生态合作。
1. 负责AI交互设计的整体规划与实施,确保设计方案符合用户体验最佳实践,提升产品的用户满意度与市场竞争力; 2. 领导设计团队,制定设计标准与流程,指导团队成员完成设计任务,确保设计质量与项目进度; 3. 深入研究用户行为与需求,通过数据分析与用户反馈,不断优化产品的交互设计,提升用户体验; 4. 与产品、技术等跨部门团队紧密合作,确保设计方案的可行性与技术实现的可能性,推动项目的顺利进行; 5. 跟踪行业内的设计趋势与技术发展,引入先进的设计理念与工具,持续提升团队的设计能力与创新水平。
1. 负责面向AI手机等ToB场景的多模态交互模型研发,包括语音基础模型、视觉-语言模型(VLM)、全模态大模型的后训练(CPT/SFT/RL)与推理优化。 2. 研发基于神经网络、扩散模型或大模型的端侧音频信号处理算法(如语音增强、降噪、去混响),提升复杂声学环境下的语音交互质量。 3. 构建支持自然打断、精准判停、上下文感知的实时双工交互模型,实现低延迟、高鲁棒性的流式对话体验。 4. 针对端侧资源约束,开展模型压缩、量化、蒸馏及高效部署,确保算法在DSP/NPU等嵌入式平台稳定运行。 5. 与系统、产品团队紧密协作,推动算法从原型验证到大规模商用落地。

1. 负责面向AI手机等ToB场景的多模态交互模型研发,包括语音基础模型、视觉-语言模型(VLM)、全模态大模型的后训练(CPT/SFT/RL)与推理优化。 2. 研发基于神经网络、扩散模型或大模型的端侧音频信号处理算法(如语音增强、降噪、去混响),提升复杂声学环境下的语音交互质量。 3. 构建支持自然打断、精准判停、上下文感知的实时双工交互模型,实现低延迟、高鲁棒性的流式对话体验。 4. 针对端侧资源约束,开展模型压缩、量化、蒸馏及高效部署,确保算法在DSP/NPU等嵌入式平台稳定运行。 5. 与系统、产品团队紧密协作,推动算法从原型验证到大规模商用落地。