logo of xiaohongshu

小红书【Dots】大模型数据工程

社招全职1-3年大模型地点:北京 | 上海状态:招聘

任职要求


-本科及以上学历,计算机科学、软件工程、大数据等相关专业,5 年以上大规模数据处理经验。
-精通大数据技术栈,包括但不限于:
-计算框架:HadoopSparkFlinkRay 等,具备流批一体化数据处理经验。
-存储系统:HBaseClickHouseCassandraElasticsearchIcebergDelta Lake 等,能够根据业务需求选择最优存储方案。
-分布式消息队列:Kafka、Pulsar 等,优化大规模数据流传输。
-ETL 及数据管道:精通 Airflow、KubeFlow 等数据编排工具,能够高效构建数据流转任务。
-熟练掌握至少一种编程语言(Python、Java、Sca…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1、负责 万亿级语料数据 处理体系的设计与优化,涵盖 数据采集、清洗、存储、转换、索引 及分析等全流程建设。
2、设计并优化 超大规模数据管道(ETL),提升网页数据的抽取、转换、加载(ETL) 效率,确保数据高效流转和存储。
3、负责 超大规模分布式数据处理架构 设计,支撑搜索引擎及大模型预训练数据处理需求。
4、研究并优化数据存储、索引及查询架构,提高 语料数据的组织方式,支持大规模 文本、结构化/非结构化数据 的高效检索。
5、研发 高效的数据清洗、去重、质量评估 体系,确保大模型训练数据的高质量输入。
6、与 算法、搜索、模型训练团队 深度合作,提升数据可用性,助力大模型预训练及微调。
7、关注高性能计算,优化数据处理任务的并发执行、计算资源管理,提升计算效率和存储利用率。
包括英文材料
学历+
大数据+
Hadoop+
Spark+
Ray+
HBase+
ClickHouse+
Cassandra+
ElasticSearch+
Iceberg+
Delta Lake+
消息队列+
还有更多 •••
相关职位

logo of xiaohongshu
社招大模型

1、Self Evolving:提升模型进行机器学习与大模型优化的能力,探索以 AI 加速 AI 研发的新范式:让模型参与到自身的训练、部署及 Agent 调度机制的迭代中,把改进的对象从"模型本身"抬升到"产生模型的研发流程",构建可递归的能力增益回路,持续寻找下一代能力增长曲线。 2、Lifelong Learning:探索模型"学会学习"的 Meta 能力:让模型在与陌生、开放环境的在线交互中持续更新自身内部状态,无需重新训练即可积累经验,不断提升长期的 decision making 与任务完成能力。 3、Scalable Oversigh:在难以 verify 的 fuzzy / 开放式任务上,突破人类监督的扩展性瓶颈:研究可扩展的监督、自我评估与自我修正机制,让监督信号的质量能随模型能力一同增长,降低对外部人工反馈的依赖。

更新于 2026-08-04北京|上海
logo of xiaohongshu
社招3-5年大模型

数据工程 详负责支撑 dots(LLM / 多模态 / Agentic)训练与对齐所需的超大规模数据工程体系,覆盖从 数据生产、清洗、存储、调度、分布式读取到质量闭环的全链路。 RL 训练框架 负责强化学习系统的规模化落地,优化分布式 RL 训练吞吐,处理长序列/推理/CLI Agent 任务 算子优化 深入 CUDA/CuteDSL/TileLang 底层,攻克性能瓶颈(如 FlashMLA、Mega Kernel、低精度算子、通信计算重叠优化) 推理引擎 打造高并发、低延迟的推理架构,优化 PD/AF 分离 schedule、解耦架构及动态资源调度

更新于 2026-08-04北京|上海
logo of xiaohongshu
社招大模型

团队介绍 做多模态的人通常有两种:一种是把各种模态「拼」在一起,一种是真的想搞清楚不同模态之间的关系,我们是后者。从视觉理解,到视觉+语音联合感知,到生成与理解统一——我们在挑战的不是某一个模态的单点能力,是整个「理解-生成-统一」的链条,挑战每种模态的单一能力上限,挑战多种模态的融合难题,挑战理解和生成能力的融合难题,实现类人的多模态能力。 岗位职责:参与视觉语言大模型的研发工作,负责下属事项至少一项或若干 VIT Pretrain:提升模型感知能力,包括但不限于 Vision Encoder Pretrain 算法架构 / 多种感知能力数据构建 VLM Pretrain:提升 vlm pretrain 的通用能力,探索各种不同训练阶段设计 / 不同通用数据的组织形式; VLM Post Train:提升 vlm 通用能力,包括但不限于合成数据 / RL 等方法 生成理解统一:探索生成理解统一架构,同时提升理解和生成能力

更新于 2026-07-23北京|上海
logo of xiaohongshu
社招1-3年大模型

1、建立文本和多模态数据源、数据格式解析(网页,PDF等)、数据策略、模型能力、下游任务的全链路归因能力 2、建立并持续完善的数据质量、多样性、重复度、覆盖率等评估体系,分析和量化每个维度的影响 3、针对模型核心能力进行重点强化,包括不限于数学、推理、Code、Agent、ICL、OCR等 4、探索如何使用更少数据量,达到同样模型能力的策略,持续提升per token的通用能力训练效果 5、探索基于各类策略的高质量数据生成方式,定向优化特定模型能力和为长期Scaling Law解决数据缺失问题

更新于 2026-08-04北京|上海