钉钉钉钉-AI(音频)-开发工程师
任职要求
1、计算机、软件工程、人工智能等相关专业本科及以上学历,3年以上后端开发或 AI 工程化经验。 2、精通 Python 和 C++ 编程,具有扎实的算法与数据结构基础,熟悉多线程/多进程编程及异步 I/O(Asyncio)。 3、熟悉 PyTorch 生态,熟练掌握 ONNX / TensorRT / OpenVINO 等模型导出及推理加速工具库。 4、熟悉主流音频模型架构(如 Whisper, Paraformer, VITS, CosyVoice, ChatTTS 等)。 5、熟悉音频处理基…
工作职责
1、模型部署与服务化封装:负责音频相关 AI 模型(ASR、TTS、Audio LLM 等)的工程化落地。将训练好的模型(涵盖小参数模型及复杂的音频处理 Pipeline)封装为高可用、高性能的线上服务(gRPC/RESTful API)。 2、高性能推理优化:负责构建支持高并发、低延迟的推理引擎。参考 vLLM、TGI 等主流 LLM 推理框架的优化思路(如 PagedAttention、Continuous Batching 等),针对音频模型的特性进行算子融合、显存优化和吞吐量提升。 3、实时流式处理:设计并实现 ASR(语音转文字)和 TTS(语音合成)的实时流式(Streaming)推理架构,优化首字延迟(TTFT)和端到端响应速度,确保在实时交互场景下的流畅体验。 4、系统稳定性与运维:负责推理服务的容器化(Docker/K8s)部署,配合 DevOps 建立服务的监控、日志追踪及自动扩缩容机制,保障线上服务的稳定性。
1. 参与语音/音乐/音效生成模型效果的效果评估标准建立(如语音自然度、清晰度、情绪表达); 2. 标注效果评测过程的音频错误(口音偏移、节奏突变、情绪不到位、语音断裂等); 3. 设计与执行主观打分测试(MOS)、音频AB测试、风格对比测试; 4. 管理评估音频测试集,保证语种、风格、情绪维度覆盖全面; 5. 协助产品和算法团队优化音频生成偏好/异常反馈链路。
1、负责AI音频美学研究与标准化:构建AI音频的审美评价体系,参与多模态美学模型的感知层训练与标注策略制定,建立音频生成质量的主观与客观评测指标; 2、负责音频生成与算法协同:与算法团队协作,优化音乐生成,调参与分析音频模型的声学特征; 3、负责听觉体验与叙事美学设计:分析并优化AI生成视频/动画/虚拟角色中的声音叙事逻辑与声画关系,研究听觉情绪曲线、音调与光影/色彩的匹配策略,指导AI模型在不同文化语境下的声音审美适配; 4、负责跨团队协作与创新实验:构建AI音频Demo,输出可视化/听化展示材料,参与跨媒体创意实验(如AI音乐短片、虚拟人声表演、AI拟声叙事剧等)。
**** 1. **核心产品设计与管理:**主导新产品/新功能的设计与搭建,负责产品生命周期的规划、落地和持续优化。 2. **大模型能力评估与集成:**深入研究国内外主流大模型(LLM/多模态模型)的优劣势、接口能力和最佳实践。结合产品需求,评估并选择最适合的底层模型,设计高效的集成方案。 3. **提示词工程与效能优化(核心):**负责核心AI功能的提示词工程设计、撰写、测试和持续迭代,最大化大模型在音频处理、内容生成等场景下的输出质量与效率。 4. **C端用户增长策略:**设计并推动C端APP的用户增长策略,包括基于AI能力的用户留存和分享机制设计、数据驱动的功能优化,推动产品在早期市场的传播增长; 5. **前沿跟踪与跨团队赋能:**跟进国内外AI生成模型及产品的最新动态,对AIGC领域的技术产品、应用趋势进行市场调研和分析。 **