千问千问事业部-全模态后训练算法专家(智能穿戴硬件方向)-杭州/北京
任职要求
● 计算机科学、人工智能、数学等相关专业硕士及以上学历; ● 有扎实的大模型理论基础,熟悉业界前沿模型架构&技术;并且熟练掌握基本工具/主流框架的使用(如python/pytorch/swift/verl/megatron等); ● 具备大模型、对话系统、多模态模型或语音交互方向研发经验,对实时对话式 AI 产品有较深理解,具备较强的工程落地与问题抽象能力; ● 在以下一个或多个…
工作职责
负责千问智能硬件(眼镜/耳机等)的云端大模型能力体系,打造面向文本、语音、图像、视频流等全模态交互的硬件 AI 助手。主导llm/vlm/omni模型后训练、agentic范式、数据体系等方向持续迭代,提升模型在聊天、文本问答、视觉问答、livetalk、agent任务执行的能力;联动硬件侧多模态传感器(如眼动追踪等)开展融合建模与能力增强,进一步拓展模型在真实交互场景下的理解、推理与执行上限,打造自然流畅、有温度、能办事的 AI 体验。
深入阿里云各行业的真实业务场景,基于阿里的语音与全模态大模型(Omni/ASR/TTS),打造行业领先的领域模型与定制化解决方案,并将核心能力反哺至基座模型。工作内容包括并不限于: 1、业务攻坚与定制化调优:深入理解业务场景(如智能客服、会议转录、车载语音、在线教育等),针对客户真实需求和挑战问题(如高噪音、多说话人、情感感知等)进行算法攻坚和端到端交付。 2、大模型增强:利用后训练全链路技术和数据飞轮(数据构建 → 模型微调 → 强化对齐 → 效果评测),增强模型的语音识别、语音合成、多模态理解、声纹识别等核心能力,并将评测、数据和算法能力沉淀到基座模型,持续提升通用大模型在真实场景中的能力。 3、多模态融合与对齐优化:主导语音信号与文本、图像、视频等模态的深度融合技术研发,解决跨模态语义对齐、噪声鲁棒性、低资源适配等关键挑战。
1、参与贝壳全模态智能体核心能力建设,围绕大语言模型(LLM)开展增量预训练、指令微调及对齐优化(SFT / RLHF / DPO / RLAIF 等),提升模型在复杂业务场景中的推理、规划与决策能力; 2、设计与优化基于LLM的Agent系统,包括任务拆解、链式推理、多步决策、工具调用(Tool Use / Function Calling)、RAG增强、长短期记忆机制等核心能力建设; 3、构建面向垂直业务场景的智能体解决方案,提升模型在多轮对话、流程执行、结构化信息理解与生成等复杂任务中的稳定性、可控性与泛化能力; 4、推动文本为核心的全模态能力融合,探索文本与视觉、语音等模态的统一建模与对齐机制,提升跨模态理解与交互能力; 5、搭建全模态智能体的数据与评测体系,包括指令数据构建、偏好数据生成、自动化benchmark设计及效果评估,支撑模型持续迭代优化; 6、与工程、产品团队紧密协作,推动全模态智能体系统在真实业务场景中的规模化落地与性能优化。
1、参与贝壳全模态智能体核心能力建设,围绕大语言模型(LLM)开展增量预训练、指令微调及对齐优化(SFT / RLHF / DPO / RLAIF 等),提升模型在复杂业务场景中的推理、规划与决策能力; 2、设计与优化基于LLM的Agent系统,包括任务拆解、链式推理、多步决策、工具调用(Tool Use / Function Calling)、RAG增强、长短期记忆机制等核心能力建设; 3、构建面向垂直业务场景的智能体解决方案,提升模型在多轮对话、流程执行、结构化信息理解与生成等复杂任务中的稳定性、可控性与泛化能力; 4、推动文本为核心的全模态能力融合,探索文本与视觉、语音等模态的统一建模与对齐机制,提升跨模态理解与交互能力; 5、搭建全模态智能体的数据与评测体系,包括指令数据构建、偏好数据生成、自动化benchmark设计及效果评估,支撑模型持续迭代优化; 6、与工程、产品团队紧密协作,推动全模态智能体系统在真实业务场景中的规模化落地与性能优化。