
智能互联千问事业部-高级数据研发专家-大模型方向
任职要求
1. 主导过LLM、VLM、ASR或TTS大模型预训练及微调语料数据建设工作,有丰富的数据交付经验; 2. 精通大规模分布式数据处理技术(如spark/flink/ray等),拥有从0到1搭建全模态数据处理pipeline的丰富实战经验; 3. 深刻理解大模型训练数据的特性与需求…
工作职责
1. 负责大模型数据研发方向,为LLM、VLM、ASR、TTS及omni model的训练供给优质语料数据,推动各业务场景提升模型训练效果; 2. 与算法团队协同、搭建各模态数据处理pipeline,利用业界先进技术对数据进行清洗、去重、打标、标注、圈选、打包,交付优质数据进行模型训练,提升整体交付效率和数据质量; 3. 与数据采集团队协同,推动前沿数据获取策略的研发与落地,探索合成数据技术,主动解决特定领域或模-态的数据稀缺与多样性挑战; 4. 构建各模态数据分类&质量体系及数据画像,对数据进行多维度、细粒度分析,基于模型训练效果反馈进行数据挖掘,指导数据收录优化方向,构建数据飞轮。
1. 负责语料数据处理工程架构的整体设计与演进,覆盖文本、图片、音视频等多模态语料的清洗、处理与交付,支撑千问app toC业务场景的高质量语料供给; 2. 负责语料数据处理体系的架构设计与能力建设,基于对模型训练需求与语料特性的理解,设计标准化的数据处理算子与Pipeline体系(如清洗、去重、过滤、结构化、对齐、质量评估等),与基础调度及AI Infra团队协同,实现大规模语料数据处理的效率提升与成本优化; 3. 构建语料数据管控、数据画像与数据资产管理能力,对语料数据的来源、结构、分布、质量、覆盖度及使用效果进行系统化刻画,实现语料数据的可管理、可理解、可追溯,为模型训练与业务优化提供数据洞察与决策支持; 4. 打造语料数据质量评估平台,支持多模态语料数据质量分析,沉淀高质量语料数据资产,并通过AI能力显著提升语料生产效率与质量; 5. 构建语料数据分析与效果归因能力,打通“语料数据—模型训练—业务效果”的反馈链路,通过数据分析识别关键数据问题与数据缺口,指导语料数据采集、处理与标注策略,形成持续优化的数据飞轮; 6. 规划语料方向的Agent应用落地,覆盖数据处理、问题排查、指标分析、效果归因等各环节,提升模型语料数据建设的效率与效果; 7. 作为工程架构负责人,统筹语料数据处理相关技术方向与系统演进,带领团队完成关键系统建设,并与算法、业务及AI基础平台团队协同,推动语料数据体系在各类AI场景中的落地。

1、负责千问C端事业群用户数据平台规划与团队管理,构建完整的用户数据资产体系,在合规基础上多手段持续提升用户画像和重点人群的覆盖与准确,完善用户标签体系,探索新的画像体系的构建,建立数据质量保障和迭代机制; 2、深度理解千问APP、智能体等业务场景与数据需求,主导数据平台架构设计,驱动提升数据采集与计算效率,为业务核心问题提供有效归因和增量洞察; 3、统筹跨部门协作,推动用户数据在千问APP、智能体、用户发展等多场景的应用落地,以业务价值驱动用户数据的迭代优化; 4、持续演进数据平台产品,加强数据服务能力,包括不限于画像人群平台、智能分析工具等,通过产品化方案降低数据使用成本、提升分析洞察效率。
1、负责规模、营收业绩达成全链路中的数据化运营的数据指标体系构建、数据产品建设; 2、通过数据化指引,帮助业务达成目标,包含业务目标拆解、机会点洞察、业绩监控、异动分析、协同运营策略推进落地、商业变现等; 3、基于对业务理解,熟练运用多种分析手段和方法(如海量数据分析和挖掘手段、资料收集&分析、行业研究、竞争分析等),诊断业务问题、评估运营效果等,为业务提供决策支持和参考; 4、通过对业务数据的挖掘,对专项问题、指定方向的重点研究与分析,能输出专项的商业分析报告,清晰传达帮助业务看清问题,并沉淀方法论。