
智能互联千问C端事业群-千问/夸克-VLM训练与应用数据工程师-杭州/北京
任职要求
1.扎实的编程能力,精通数据结构、并发/异步编程,熟悉高效文件I/O与分布式文件系统
2.熟练使用图像与视频处理工具及常用文本处理库,具备复杂场景下的数据工程实战经验;
3.熟悉多模态数据(图像-文本、视频-文本等更多模态)对齐策略、模态融合机制和处理规范;
4.熟悉数…工作职责
我们致力于构建支持通用人工智能发展的高质量、多模态大规模训练数据集,服务于图像、视频、文本等复杂模态融合下的大模型研发。该岗位将主导多模态数据基础设施的设计、处理流程的智能化优化,并深度参与高价值数据(如推理类任务数据、领域权威知识数据)的构建与增强,为模型的理解力、泛化能力与推理能力提供坚实数据支撑。 你将与算法工程师、数据产品经理紧密合作,共同推动数据与模型的正反馈闭环,包括数据构建策略共创、实验验证、产品化数据标准制定等,在万卡集群的充足算力支持下,实现“数据即能力”的宏大目标。 主要职责: 1.设计与维护高扩展性、多模态数据基础设施 支持图像、视频、文本等模态数据的高效采集、存储、调度与版本化管理,满足大模型多轮训练与快速迭代需求。 2.构建推理能力导向的数据集 主导构建具备复杂因果关系、长链思维、多跳推理、模态融合推理、多语言对齐推理等能力评估或训练所需的数据集,服务大模型“理解-生成-决策”闭环。 3.高性能并行数据处理优化 在CPU/GPU集群或分布式环境中优化大规模图像/视频/文本混合数据的处理性能,提升数据准备效率与稳定性。 4.构建可视化与分析工具,辅助数据理解与反馈闭环 实现多模态数据分布可视化、异常聚类检测与质量诊断,服务于模型训练前/中/后的数据决策优化。 5.与算法工程师深度协同,提升模型性能与数据对齐度 基于模型效果与损失分析,共同制定数据增强策略、采样分布设计、多轮训练数据构造方法,实现数据与模型迭代的高效协同。 6.与数据产品团队合作,推进数据标准化与平台化建设 参与数据标签体系、任务定义、多模态对齐协议等的标准制定,推动数据处理工具、标注平台、数据质量评估体系的产品化落地。
加入千问/夸克APP的核心团队,共同打造下一代AI智能助理的“推荐大脑”。包括但不限于:对话推荐、AI内容创作、内容消费,负责推荐系统的算法设计、优化及落地,通过精准的算法策略提升对话体验与内容分发效率,带动千问/夸克APP的DAU、AI生成内容(AIGC)、创作者生态等核心业务的增长。 1.算法设计与优化:利用前沿技术优化千问/夸克APP的对话推荐、消费和创作模块,全链路地优化包括召回模型、排序模型、多模态推荐、多目标、冷启动,探索等推荐算法和模块; 2.数据驱动迭代:基于用户行为数据、内容特征数据等,构建算法评估体系,通过AB测试等方式验证算法效果,持续迭代优化推荐策略,解决冷启动、多样性不足等实际业务问题。 3.特征工程与模型搭建:利用大模型构建千问/夸克用户的画像,参与内容特征、用户特征的挖掘与构建,结合场景需求选择或改进合适的推荐模型,提升模型预测精度与泛化能力。 4.系统协同与落地:与工程、产品、数据等团队协作,将算法方案转化为可落地的技术实现,保障推荐系统的高可用性、低延迟与稳定性,适配各场景的动态变化需求。 5.技术探索与沉淀:跟踪推荐算法、AI大模型在内容领域的应用动态,探索大模型与推荐系统结合的创新方向,沉淀算法研发经验与技术方案。
主导通用AIAgent(对标Manus等前沿形态)的核心算法研发与技术落地,带领团队攻克大模型驱动下的信息搜集、智能决策、智能办公等关键技术难题,构建具备搜索增强、自然对话能力的新一代通用智能体,支撑业务在多领域的创新应用。 具体职责: 1.算法研发与创新:牵头通用AIAgent的核心算法设计,包括但不限于大模型微调与强化学习、智能规划与决策、多模态信息融合、搜索增强机制等,持续提升Agent的通用性与任务执行能力。 2.场景落地与优化:聚焦搜索、对话等核心应用场景,主导算法方案的落地实施,结合业务需求迭代优化模型效果,解决实际场景中的技术瓶颈(如上下文理解、意图识别、多轮交互连贯性等)。 3.团队管理与赋能:带领5-10人算法团队开展研发工作,制定技术研发计划,统筹项目进度,搭建高效协作机制;指导团队成员成长,提升团队整体技术水平与创新能力。 4.技术攻坚与前瞻布局:跟踪国内外通用Agent、大模型领域的前沿技术动态(如顶会论文、行业实 践),主导技术预研与攻关,推动技术成果转化,保障团队技术竞争力。 5.跨部门协作与国际化支持:与产品、业务等部门深度协作,明确技术需求与落地路径;若涉及海外业务,需主导适配海外场景的算法优化,提供国际化技术支持。
1. 参与千问/夸克APP 智能对话AI产品研发,构建基于大模型驱动的Agent应用(对话/任务/多模态等); 2. 参与对话式产品后端核心架构设计和迭代,构建高可用、低延迟的AI应用基础设施; 3. 协同算法、产品、前端等多团队,将前沿AI能力转化为产品能力,提升体验。
【我们是谁】 你将加入阿里千问C端事业群的核心算法团队,直接负责 千问、夸克AI问答 等大模型产品背后至关重要的“大脑”—— RAG(检索增强生成)系统。我们的使命是为大模型打造一个专属的、下一代搜索引擎,确保AI在回答用户问题时,能做到响应快速、内容全面、信息时效性强且高度专业。 作为算法组内的工程中坚力量,你将负责高性能检索系统的架构设计与核心代码实现(以C++为主),是一个有意从工程转算法的理想岗位。 1. 构建极速引擎:负责RAG检索链路的工程落地,面对海量并发请求,通过极致的代码优化和架构设计,保障系统的高吞吐与低延迟。 2. 算法工程化落地:与算法专家紧密配合,将前沿的向量检索、倒排索引、重排等算法策略转化为稳定、高效的线上工程服务。 3. 系统架构升级:针对AI问答场景的特殊性(如长文本处理、实时索引更新),打造具备高可用、高扩展性的分布式后端服务体系,支撑未来AI搜索形态的快速演进。