logo of mihoyo

米哈游大模型-LLM数据处理

校招全职程序&技术类地点:上海 | 北京状态:招聘

任职要求


1.计算机/软件工程等相关专业本科以上学历,拥有LLM相关专业硕士/博士学位者优先;
2.熟悉常见数据处理流程,拥有大模型数据处理与合成经验,有一线互联网大模型数据处理实习经历者优先;
3.熟悉Python,了解大模…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1.参与LLM大模型的数据准备、数据清洗、质量过滤及数据实验等工作,交付高质量训练数据;
2.参与建设对标业内前沿的LLM训练数据集,并在此基础上持续迭代,进一步提升数据质量和多样性;
3.参与构建和维护高性能LLM数据处理Pipeline,优化链路成本,提升性能和稳定性;
4.与算法同学协作,参与大模型训练数据的质量分析、评估体系建设和数据迭代,推动模型效果提升。
包括英文材料
学历+
大模型+
Python+
PyTorch+
还有更多 •••
相关职位

logo of mihoyo
校招程序&技术类

作为一名核心的预训练数据算法研究员,你将直接参与构建和优化我们核心大语言模型的预训练,并侧重在 code、agentic、reasoning-heavy 类任务的高质量训练数据集搭建;包含但不限于数据收集、合成数据生成、任务行为轨迹构建等。 1.开发并生成用于大模型训练的合成任务与数据集,涵盖两类场景: 可验证类任务:代码解题、数学计算题等; 不可验证类任务:开放式逻辑推理、通用综合问题求解等。 2.搭建并规模化运行多领域数据合成流程,覆盖 agent、code、math、general reasoning; 3.参与搭建 agentic task environments 以及配套的大模型训练评测体系。

上海|北京
logo of mihoyo
校招程序&技术类

作为一名预训练数据算法研究员,你将负责开发大语言模型训练所需的大规模数据处理算法与数据学习策略。 主要负责: 1.针对多源数据设计并开发code类数据、通用文本数据清洗、增强、合成算法; 2.基于大语言模型研发并迭代数据筛选策略,提升预训练语料的数据质量; 3.搭建并规模化优化数据处理流水线,保障高并发场景下的运行性能与稳定性。

上海|北京
logo of aligenie
社招3年以上技术类-开发

1、参与境内外互联网网页、文档、代码等文本数据的发现、采集、处理及标注工作,完善相应平台和架构能力; 2、为文本大模型训练供给语料数据,为AI toC应用供给领域优质内容数据; 3、评估并提升训练数据的质量、多样性及标注准确性; 4、通过AI能力来赋能数据建设,提升数据效果及生产效率; 5、与模型及业务研发团队紧密协作,根据训练效果和业务指标反馈持续迭代数据策略。

更新于 2026-04-06北京|杭州
logo of aligenie
社招2年以上

1. 负责大模型的高质量的数据构造及模型评测工作,主要在LLM、科学(数学/化学/物理)等各垂域数据任务,与算法团队密切合作,理解算法需求,提供满足算法研发需求的数据; 2. 设计和实现各领域标注方向AI训练流程,并不断优化迭代,高效完成标注和内容生产项目; 3. 统筹各领域核心知识点分类框架、回答思维模式、推理问答、权威教材教研资料、前沿科研论文专著等关键要素。依据多元数据集设计需求与应用场景,为数据集标准环节制定详实、完备且极具可操作性的标准;定期对数据集开展阶段性质量检测,持续迭代体系化标注标准,助力打造行业标杆级数据集; 4. 构建并维护一套完善的各领域AI数据内容质量管理体系,全面把控内容质量并对结果负责,并不断进行优化迭代; 5. 积极推动组织流程及交付流程优化,对接数据标注供应商。负责组织培训、试标、通过持续培训和反馈提升供应商标注质量与效率; 6.开展LLM/科学/各垂域大模型及应用的评测建设,能够从各领域专业层面设计专业评测方案、开展专业的评测服务。

更新于 2026-03-30杭州