logo of quark

千问千问事业部-全模态后训练算法专家(智能穿戴硬件方向)-杭州/北京

社招全职1年以上技术类-算法地点:北京 | 杭州状态:招聘

任职要求


● 计算机科学、人工智能、数学等相关专业硕士及以上学历;
● 有扎实的大模型理论基础,熟悉业界前沿模型架构&技术;并且熟练掌握基本工具/主流框架的使用(如python/pytorch/swift/verl/megatron等);
● 具备大模型、对话系统、多模态模型或语音交互方向研发经验,对实时对话式 AI 产品有较深理解,具备较强的工程落地与问题抽象能力;
● 在以下一个或多个…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


负责千问智能硬件(眼镜/耳机等)的云端大模型能力体系,打造面向文本、语音、图像、视频流等全模态交互的硬件 AI 助手。主导llm/vlm/omni模型后训练、agentic范式、数据体系等方向持续迭代,提升模型在聊天、文本问答、视觉问答、livetalk、agent任务执行的能力;联动硬件侧多模态传感器(如眼动追踪等)开展融合建模与能力增强,进一步拓展模型在真实交互场景下的理解、推理与执行上限,打造自然流畅、有温度、能办事的 AI 体验。
包括英文材料
学历+
大模型+
Python+
PyTorch+
Swift+
Megatron+
SFT+
RLHF+
AI agent+
还有更多 •••
相关职位

logo of aliyun
社招3年以上云智能集团

深入阿里云各行业的真实业务场景,基于阿里的语音与全模态大模型(Omni/ASR/TTS),打造行业领先的领域模型与定制化解决方案,并将核心能力反哺至基座模型。工作内容包括并不限于: 1、业务攻坚与定制化调优:深入理解业务场景(如智能客服、会议转录、车载语音、在线教育等),针对客户真实需求和挑战问题(如高噪音、多说话人、情感感知等)进行算法攻坚和端到端交付。 2、大模型增强:利用后训练全链路技术和数据飞轮(数据构建 → 模型微调 → 强化对齐 → 效果评测),增强模型的语音识别、语音合成、多模态理解、声纹识别等核心能力,并将评测、数据和算法能力沉淀到基座模型,持续提升通用大模型在真实场景中的能力。 3、多模态融合与对齐优化:主导语音信号与文本、图像、视频等模态的深度融合技术研发,解决跨模态语义对齐、噪声鲁棒性、低资源适配等关键挑战。

更新于 2026-03-23北京|杭州
logo of ke
校招算法类

1、参与贝壳全模态智能体核心能力建设,围绕大语言模型(LLM)开展增量预训练、指令微调及对齐优化(SFT / RLHF / DPO / RLAIF 等),提升模型在复杂业务场景中的推理、规划与决策能力; 2、设计与优化基于LLM的Agent系统,包括任务拆解、链式推理、多步决策、工具调用(Tool Use / Function Calling)、RAG增强、长短期记忆机制等核心能力建设; 3、构建面向垂直业务场景的智能体解决方案,提升模型在多轮对话、流程执行、结构化信息理解与生成等复杂任务中的稳定性、可控性与泛化能力; 4、推动文本为核心的全模态能力融合,探索文本与视觉、语音等模态的统一建模与对齐机制,提升跨模态理解与交互能力; 5、搭建全模态智能体的数据与评测体系,包括指令数据构建、偏好数据生成、自动化benchmark设计及效果评估,支撑模型持续迭代优化; 6、与工程、产品团队紧密协作,推动全模态智能体系统在真实业务场景中的规模化落地与性能优化。

更新于 2026-03-10北京
logo of ke
实习算法类

1、参与贝壳全模态智能体核心能力建设,围绕大语言模型(LLM)开展增量预训练、指令微调及对齐优化(SFT / RLHF / DPO / RLAIF 等),提升模型在复杂业务场景中的推理、规划与决策能力; 2、设计与优化基于LLM的Agent系统,包括任务拆解、链式推理、多步决策、工具调用(Tool Use / Function Calling)、RAG增强、长短期记忆机制等核心能力建设; 3、构建面向垂直业务场景的智能体解决方案,提升模型在多轮对话、流程执行、结构化信息理解与生成等复杂任务中的稳定性、可控性与泛化能力; 4、推动文本为核心的全模态能力融合,探索文本与视觉、语音等模态的统一建模与对齐机制,提升跨模态理解与交互能力; 5、搭建全模态智能体的数据与评测体系,包括指令数据构建、偏好数据生成、自动化benchmark设计及效果评估,支撑模型持续迭代优化; 6、与工程、产品团队紧密协作,推动全模态智能体系统在真实业务场景中的规模化落地与性能优化。

更新于 2026-06-02北京
logo of mihoyo
社招程序&技术类

1、设计并研发输入输出任意模态(Any-to-Any)的统一架构,重点攻克 Audio-in-Audio-out 的原生建模; 2、研发高性能的神经音频编解码器(Neural Audio Codec),探索连续表征与离散 Token 的最优平衡; 3、利用海量多模态数据(语音、音乐、环境音、视频),负责超大规模参数模型的分布式预训练; 4、探索针对音频模态的指令微调与强化学习算法,优化模型在语音交互中的情感表达、打断机制、副语言(笑声、停顿)以及听感质量。

上海