通义通义实验室-技术专家-大模型数据
任职要求
1、计算机/人工智能及相关专业硕士及以上学历,优异者条件可适当放宽; 2、具备3年以上数据处理或模型训练工作经验,熟练掌握文本、多模态等非结构化数据处理方法,精通数据清洗、特征提取和数据增强等技术,能够解决数据工作中各种问题; 3、精通Python、Java等至少一种编程语言,熟悉常用的数据处理、文本处理和图像处理库,能够高效地实现数据清洗和处理的算法和流程; 4、具备丰富的数据湖开…
工作职责
1、负责AI平台大数据架构演进以及推进落地:根据不同领域场景大模型落地需求,与算法团队和IT基础设施团队紧密合作,提出大模型训练和优化数据规模、数据类型、数据结构等建议,确保架构有效实施; 2、负责搭建大模型数据平台:支撑大模型数据的存储、预处理(去重、相似度计算、脱敏等)诉求,针对大模型场景、数据类型、数据规模具有高扩展性,以支持大模型数据集持续迭代,实现高质量数据集沉淀,确保数据安全和隐私保护; 3、与算法团队紧密协作,抽象研发诉求,落地为便捷实用的的平台能力,提升整个团队的工作效率和数据处理能力。
我们正在寻找一位兼具技术深度与行业广度的数据采购技术专家。您不仅是大模型技术的“鉴赏家”,更是数据供应链生态的“战略家”。您将利用对全球大模型数据供应商格局及行业趋势的深刻洞察,主导我们的数据资源引入策略,评估供应商的长期发展潜力与交付能力,确保我们的数据供应链既具备技术领先性,又拥有商业可持续性。 1. 供应商生态图谱与趋势研判:构建并维护全球大模型数据供应商的生态图谱。深入分析不同供应商(如数据标注、合成数据、真机采集、预训练数据提供商)的商业模式、技术壁垒及市场定位,预判行业整合趋势,为公司引入最具潜力的合作伙伴。 2. 数据供应链技术评估:针对具身智能、多模态等大模型前沿领域,评估供应商的数据采集能力(如仿真引擎、真机遥操作)、数据处理管线(Pipeline)及质量控制标准。确保供应商的技术路线符合行业Scaling Law的发展趋势。 3. 技术尽调与交付能力验证:主导对潜在供应商的技术尽职调查。不仅审查其现有数据质量,更要评估其数据生产的自动化水平、成本控制能力及未来技术迭代路线,规避供应商“掉队”风险。 4. 前沿技术引入与落地:追踪大模型数据领域的最新技术突破(如World Model生成数据、自动化标注技术),识别并引入能显著提升模型效果的创新数据源或工具,推动采购品类从“买数据”向“买能力”转型。 5. 跨部门技术协同:作为采购与业务技术部门的桥梁,将外部供应商的技术能力转化为内部可理解的评估报告,协助算法团队制定数据需求标准,并参与技术谈判。
1、主导大模型数据采集方向的技术选型与架构设计,制定采集系统的中长期技术演进路线图,推动系统性建设及规模化落地; 2、带领团队攻克复杂采集场景下的技术难题,包括大规模分布式爬取、动态渲染页面处理、反爬对抗、App逆向解析等,保障大模型训练数据供给的稳定性与质量; 3、统筹数据采集全链路设计——涵盖任务调度、分布式采集、内容结构化解析、数据清洗与持久化,持续优化系统吞吐量、稳定性与成本效率; 4、建立团队编码规范、数据质量标准及安全合规体系(遵循 robots 协议、数据安全相关法规),推动工程化建设与最佳实践落地; 5、与大模型训练、数据标注、平台工程等团队紧密对齐需求,作为技术接口人协调资源、推动项目交付。
1.主导EB级海量全模态(文本/图像/视频/音频3D等)AI数据处理平台的规划,负责高性能、可扩展的数据处理架构设计; 2. 负责AI数据资产体系构建与AI数据资产规划,推动数据、算法、工程及产品等多团队协作,实现AI全模态数据标准化、流程化及资产化,加速AI数据在基模和AI应用之间效能转化; 3. 主导核心数据处理算子(清洗、加工、转换、融合)的研发与工程化落地,并构建高效的流程编排与执行引擎,支持百亿级数据在异构卡型上快速自动化处理; 4. 负责全域EB级检索引擎的架构设计与实现,包括多模态检索、内容检索与RAG(检索增强生成)等,并持续进行性能与效果优化; 5. 关注并引领AI数据处理领域的新技术、新架构、新工具,积极推动平台技术升级和平台开放,推动团队在AI数据处理能力提升和内部技术分享。
1、负责多模态数据处理链路的推理优化,分析性能瓶颈,软硬件结合优化,实现包括语言识别、计算机视觉等多方向的推理优化,达到极致性能; 2、负责多模态数据处理链路的可观测性工具建设,包括数据处理、模型推理的监控、告警等; 3、负责异构资源(GPU、CPU等硬件)的调度优化,实现潮汐资源、混部资源、多云资源的最优化调度 4、负责集群和业务服务的稳定性治理、资源利用率提升,通过系统化方式提高GPU、CPU等硬件资源的使用效率。 5、参与设计高吞吐、低延迟的数据处理 pipeline。针对大模型数据处理场景(如LLM、多模态),优化数据清洗、预取、缓存及异步加载策略,确保数据大规模产出。