logo of alibaba

阿里巴巴未来生活实验室-大模型训练数据专家(百晓生)-北京/杭州

社招全职地点:北京 | 杭州状态:招聘

任职要求


1. 有较强的工程能力和数据处理能力,处理数据细致,工作思路体系;
2. 自然语言处理数据挖掘、知识图谱等相关专业的硕士生/…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1.大模型前置数据链路工程技术优化,数据去重、数据格式处理、数据分布式分析等
2.大模型预训练数据算法处理技术,数据聚类、打标、高质量筛选模型设计和优化等
3.持续发现开源或者可采买的高质量语料数据,有开阔的思路进行数据获取
4.进行预训练和标注数据质量分析,进行标注任务设计、回收和质检
包括英文材料
NLP+
数据挖掘+
还有更多 •••
相关职位

logo of bytedance
社招A164788

1、深度参与大模型前沿方向的数据工作,重点负责视频生成模型的数据标注与管理,模型效果评估; 2、建设视频生成大模型的数据生产和质量提升流程,建设起行业领先的数据生产标准; 3、建立科学的模型效果评估方案与策略,保证对模型效果的正确评估,助力模型效果达到业内一流; 4、深入理解业务场景、市场动态和大模型技术趋势,牵引数据团队和算法团队的深度融合。

更新于 2024-09-26北京
logo of tencent
社招TEG技术

1.设计和开发大规模预训练数据处理pipeline,为模型预训练提供稳定、可靠的高质量数据处理能力; 2.根据大模型训练数据特点,抽象并开发高效、可靠的数据加工框架,提升处理数据的工程效率; 3.建设对标业内前沿的大模型训练数据集,提升数据质量和多样性,并验证数据价值和效果。

更新于 2025-06-17深圳
logo of mihoyo
实习产品策划类

1. 自主寻找并匹配 1 名适合的搭档,组成双人工作小组; 2. 灵活挑选自身擅长的话题(可从现有话题库挑选也可自找,覆盖文学、哲学、历史等方向); 3. 与搭档围绕所选话题进行深度聊天、访谈,全程记录真实、有深度的对话内容; 4. 输出符合要求的高质量文本语料,作为大模型训练数据; 5. 最后按验收通过的话题数量获取报酬,上不封顶。

杭州|苏州|成都
logo of quark
社招1年以上运营-产品运营

1、深度参与大模型前沿方向的数据工作,重点负责文生图模型的数据寻源、数据标注与管理,模型效果评估; 2、设计各技术方案下阶段的数据方案与策略,建设文生图大模型的数据生产和质量提升流程,管理高效高质的数据生产pipeline,建设起行业领先的数据生产标准; 3、建立科学的模型效果评估方案与策略,给出模型优化建议,助力模型效果达到业内一流; 4、深入理解业务场景、市场动态和大模型技术趋势,牵引数据团队和算法团队的深度融合。

更新于 2025-09-26北京|杭州|上海