拼多多音视频实时传输网研发工程师/专家
任职要求
1. 本科及以上学历,电子、通信及计算机相关专业,3年以上 Linux 后台服务器开发经验; 2. 具备良好的编程能力,熟练掌握 C/C++/Go/Rust,熟悉网络编程,有扎实的数据结构和算法基础; 3. 熟悉 WebRTC 协议及 RTMP、FLV 等常…
工作职责
1. 传输协议开发与优化,持续提升实时音视频的质量指标; 2. 接入调度与选路,实时计算最佳传输路径; 3. 网络链路监测,实时评估接入点和传输路径的质量; 4. 系统监控和全链路质量保障体系建设。
负责音视频实时传输网后端服务开发,主要包括以下几个方向: 传输协议开发与优化,持续提升实时音视频的延时、卡顿率、清晰度等质量指标; 接入调度与选路,实时计算最佳传输路径; 网络链路监测,实时评估接入点和传输路径的质量; 系统监控和全链路质量保障体系建设。
1. 负责推动LLaDA系列扩散模型在实时音视频多模态场景的技术探索和突破; 2. 负责实时音视频大模型技术带来的新特性(如交错交互等)从实验性走向实用性全流程所需的训练、语料优化、评测反馈等环节相关工作;
在这里,你将参与淘宝直播及短视频等丰富的内容业务场景,围绕“更好听、更好看、更好玩”,和其他优秀的同学一起,为用户提供极致的体验; 在这里,你将负责为用户提供最优的音质,负责音频增强及编码相关算法研发,包括但不限于音频3A算法(降噪、回声消除、自动增益)、音频编码、人声美化,虚拟音效、空间音频等算法; 在这里,你将负责音乐相关算法研发,包括但不限音乐理解、音乐检索、音乐生成、智能配乐等算法; 在这里,你将负责面向RTC的音视频传输算法优化,包括但不限于带宽预测、拥塞控制、多码率自适应、音视频弱网对抗等算法; 在这里,你将会持续关注AI音视频、AI传输等相关领域的前沿算法,并针对真实场景,把算法落地应用到实际项目中。 加入我们,你将会面对新的内容场景,通过技术深耕,致力于行业领先的音视频技术创新和应用,帮助创造极致的消费者体验。 你的工作将服务于改善全世界数十亿人的购物、娱乐和交互的体验。 探索未知,挑战未来,来吧,我们等你加入!
1.前沿技术研究:负责端到端多模态语音大模型的核心算法研究,攻克语音-语义联合建模、流式实时推理、情感感知对话等关键技术难题,推动从级联式架构向原生多模态架构的技术范式升级; 2.系统架构设计:主导设计面向智能外呼场景的下一代多模态对话系统架构,实现毫秒级端到端响应、自然话轮切换、实时情感理解等核心能力,重新定义人机语音交互体验; 3.大规模落地实践:将前沿研究成果落地到日均千万级调用量的工业级外呼系统,负责从数据构建、模型训练、效果调优到线上部署的全链路技术方案设计与实施; 4.数据与评测体系建设:主导构建大规模多模态对话数据集与标注体系,设计并建立覆盖语音理解、情感识别、对话质量等维度的系统化评测基准; 5.学术影响力建设:在语音、自然语言处理、多模态等领域顶级学术会议发表高质量论文,参与行业标准制定,提升团队在学术界和产业界的技术影响力; 6.技术创新孵化:探索多模态语音技术在更多创新场景(智能客服、语音助手、数字人、同声传译等)的应用可能,孵化下一代AI交互产品形态。