OPPO高级语音算法工程师
任职要求
1,专业不限,具备语音交互判停和拒识、说话人识别、说话人日志、情感识别等相关知识和经验的人选优先。
2,熟练掌握PyTorch等深度学习框架,Python等编程语言。
…工作职责
1,深度参与语音交互中的判停和拒识/音频属性理解(说话人识别、说话人日志、情感识别等)算法研发工作。 2,跟进和探索结合音频大模型技术的语音交互和音频属性理解技术,持续优化系统性能。 3,结合终端应用场景,参与技术方案落地,为数亿级用户提供服务。
1、对语音方向有浓厚兴趣,扎实的语音信号处理和深度学习理论功底,对语音领域前沿技术有深入跟踪与实践,精通语音识别、语音理解、语音交互中至少两个领域。 2、、语音识别方向:精通语音识别全链路技术,包括 VAD、声学模型、语言模型、端到端建模(CTC / RNN-T / Conformer 等),熟悉解码与优化方法(Beam Search / WFST / LM 融合等),具备复杂声学环境下识别效果优化的实战经验。 3、语音理解方向:对语音大模型与语音理解技术有深入理解,熟悉主流语音理解大模型方案(如 Whisper、Qwen-Audio 等),具备 LLM 理论基础和调优实践经验,能够将语音理解能力与业务场景深度结合。 4、语音交互方向:熟悉语音交互系统架构,具备半双工 / 全双工语音交互系统开发经验,深入理解语义打断(barge-in)、轮次控制、端点检测等关键机制,有语音交互链路从设计到上线的完整研发经验。 5、熟悉语音大模型的训练和调优技术,熟悉预训练、后训练、上下文学习、反馈强化学习等相关技术,具备独立设计训练方案和解决训练疑难问题的能力。 6、具备良好的工程能力,熟练使用 Python / C++,熟悉模型部署与推理优化技术(如 ONNX / TensorRT / 量化加速等),能够推动算法从原型到高性能线上服务的全流程落地。
1.负责语音识别ASR应用涉及的效果调优与实现,比如多语种语音识别与翻译(中/英/法/日/韩/东南亚/中东等)、端侧超级轻量级高效ASR的落地实现、解决目标说话人增强的ASR相关技术的落地、声学/语意vad等; 2.负责语音识别asr-llm大模型与前沿技术调研与落地,比如更合理的语音与文本对齐、适用于多语种的模型方案、更高效的弱监督数据筛选流程等; 3.负责跟踪并复现业界最前沿的音频处理方案,并能融合优化当前效果。
1.拟人SFT数据构建与策略设计 (1)负责面向超拟人语音交互场景的SFT数据方案设计,涵盖角色人设一致性、多轮对话逻辑、情感表达等维度,构建高质量对话语料。 (2)针对多模态交互、A陪伴等需求,设计角色扮演数据的标注规范,包括身份背景、经典台词、行为模式等细粒度标签。 (3)基于业务场景(如儿童教育、情感陪伴、游戏NPC、模拟面试等)设计符合角色设定的对话逻辑,提升用户交互沉浸感。 (4)建立SFT数据评估体系,针对人设一致性、意图识别准确率、对话流畅度等指标进行量化分析与迭代。 2.SFT数据在语音交互模型中的优化 (1)结合语音交互链路(ASR→LLM→TTS),通过SFT技术优化大模型的对话能力,重点提升上下文理解、情感响应准确度及多轮对话连贯性。 (2)探索角色扮演数据在语音Agent中的应用,例如通过Prompt工程控制对话风格、情绪倾向,实现个性化交互体验。 (3)协同声纹识别、情感计算等技术,构建语音-文本-用户画像对齐的数据集,支持个性化交互(如儿童声线识别、成人情感分析)。 (4)推动SFT数据在低延迟语音交互场景的落地,优化端到端响应效率(如实时打断、长上下文记忆等能力)。