夸克千问C端事业群-AI助手算法架构师-杭州/上海
任职要求
1. 硕士以上相关专业,对语音和多模态助手有深入理解,有大模型人机交互系统设计经验 2. 有3年以上语音/视觉交互系统相关从业经验,熟悉人机交互各模块的基本…
工作职责
1. 负责语音/视觉端云融合人机交互系统链路的设计与搭建,包括多智能体框架、端到端大模型系统、记忆系统等 2. 参与智能硬件AI-OS的整体设计,负责语音和多模态助手的能力定义和整体技术架构设计 2. 负责多端协同下人机交互系统算力网络的自适应与扩展设计
1. 优化多模态对话框架,建设超长程对话能力,通过长短期记忆、物理环境感知等手段增强智能度,打造行业领先的智能对话助手; 2. 建设AI穿戴硬件网关,与硬件端侧紧密协作,多种手段优化穿戴硬件在弱网、断网场景下的用户体验问题,持续提升易用性、稳定性; 3. 把握行业的前瞻技术发展趋势,基于业务场景,结合新技术、新形态,推动技术创新性产品落地.
负责AI眼镜背后的整体云端算法解决方案,包括语音助手、拍照问答、全模态live交互等核心能力。持续推动大模型(LLM/VLM)在逻辑推理、问答、复杂上下文理解、指令遵循、Agent智能体及多模态交互等核心方向取得突破性进展,打造行业领先的智能体验。具体职责包括: 1、LLM/VLM后训练技术研发与落地: 探索并应用SFT、RLHF、DPO、RLVR等训练范式及模型蒸馏等对齐策略,持续提升模型在RAG、行业知识掌握、用户偏好理解、指令遵循能力及抑制幻觉等方面的表现。 2、多模态统一模型构建: 规划并实施文本、语音、视觉等多模态信息的统一建模方案,确保模型在文本问答、图文百科、视频实时对话等复杂场景下具备精准的理解能力和高效的输出能力。 3、眼镜场景算法闭环迭代: 构建基于线上日志的数据飞轮,体系化建设眼镜场景专属训练数据集,并推动模型持续迭代更新。聚焦业务痛点,解决实际问题,构建坚实的技术壁垒。
岗位目标: 面向人工智能前沿技术领域,聚焦计算机视觉、自然语言处理、大模型等核心技术,研发高性能、低时延的智能系统,支持语音助手、多语言交互、智能内容生成、视觉理解等多种应用场景,推动AI技术的产品化落地与规模化应用。 具体职责包括但不限于: 核心算法研发与优化: 针对具体任务场景(如语音识别、机器翻译、图像理解、文本生成等),开展深度学习模型的算法设计与创新,探索新型神经网络架构(如Transformer、MoE、扩散模型等),提升模型在复杂环境下的准确性、鲁棒性与泛化能力。 负责端到端建模优化,结合上下文理解、对话状态追踪或多模态融合技术,增强系统在连续交互场景中的语义理解与响应能力。 构建高质量训练数据体系,设计自动化语料清洗、标注与增强方案,覆盖多语言、多方言、噪声或小样本等挑战性场景,支撑模型持续迭代。 大模型技术研发与应用: 参与大规模预训练模型(LLM、VL模型等)的研发与微调,包括指令微调、对齐优化、提示工程及推理加速,提升模型在下游任务中的表现。 探索大模型在跨模态理解(图文、音视频)、实时生成、知识推理等场景的应用路径,推动AIGC、智能摘要、自动字幕、翻译等业务的技术升级。 研发高效微调技术(LoRA、Adapter等)与模型服务架构,实现大模型在资源受限环境下的灵活部署。 系统性能优化与工程化落地: 推动模型轻量化与推理加速,应用模型压缩、量化、蒸馏、剪枝等技术,提升模型在移动端、边缘设备或云端的运行效率。 协同工程团队完成算法模块的高性能集成,优化分布式训练与推理框架,保障系统低时延、高并发与稳定性。 支持多平台部署(移动端、PC端、Web端、云服务),参与全链路性能调优与监控体系建设。 前沿技术探索与跨领域协作: 跟踪人工智能领域最新研究进展(CV/NLP/ASR/TTS/MT等),结合业务需求进行技术预研与原型验证。 与产品、数据、工程团队紧密协作,深入理解用户场景,推动AI能力在实际产品中的创新应用。