logo of xiaohongshu

小红书【hi lab】Posttrain算法工程师

社招全职1-3年大模型地点:上海 | 北京状态:招聘

任职要求


1. 具备扎实的机器学习基础,能熟练使用至少一种深度学习框架(e.g. PyTorchJaxTensorFlow、MindSpore、PaddlePaddle)。
2. 对监督学习、强化学习、表示学习等机器学习方法有深入理解并具备相关的实践经验。
3. 在 NLP/CV/RL 等至少一个 AI 领域中有过深入的研究经历,或通过机器学习算法解决过复杂业务场景问题。
4. 具备卓越的实验分析与问题解…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


利用多种方法获得效果、 Robustness、Uncertainty校准都足够好的 Reward Model
1、RM标注策略优化,包括但不限于迭代标注策略、AI标注策略等,探究数据和模型性能的关系;
2、研发fine-grained reward modeling,对幻觉、推理、数学等场景进行针对性优化;
3、探索 PMP、Reference、Tool-Augmented、RM+CoT等对现有方法的改进,探索language-based RM以提高可解释性及鲁棒性;
4、研究Self-Rewarding、Self-Crituqing、Scalable Oversight等方向下的对齐技术,探索LLM booststrap的技术路径。
包括英文材料
机器学习+
深度学习+
PyTorch+
JAX+
TensorFlow+
PaddlePaddle+
强化学习+
NLP+
算法+
还有更多 •••
相关职位

logo of xiaohongshu
社招1-3年大模型

利用强化学习方法对多模态大模型进行对齐: 解决优化现有多模态大模型 RLHF 中的训练效果、稳定性、Reward Hacking 等问题; 探索 RL 阶段 computaiton scaling 对模型能力提升的方法; 研究 Multi-Agent、Long-term Objective、Scalable Oversight 等方向下基于强化学习的对齐方法; 基于前沿方法对幻觉、推理、工具使用、安全等场景问题进行针对性优化,提升大模型的应用价值。

更新于 2025-09-26北京|上海|杭州
logo of xiaohongshu
社招1-3年大模型

1.利用强化学习方法对多模态大模型进行对齐: 2.解决优化现有多模态大模型 RLHF 中的训练效果、稳定性、Reward Hacking 等问题; 3.探索 RL 阶段 computaiton scaling 对模型能力提升的方法; 4.研究 Multi-Agent、Long-term Objective、Scalable Oversight 等方向下基于强化学习的对齐方法; 5.基于前沿方法对幻觉、推理、工具使用、安全等场景问题进行针对性优化,提升大模型的应用价值。

更新于 2026-01-14北京|上海
logo of xiaohongshu
校招产品运营

我们寻找热爱生活、钟情于艺术与科技交融的你,加入小红书AI性格设计师team,在追求 AI 模型在技术上的有用性基础上赋予 AI 温暖与诗意,注入灵魂,让 AI 能够为世界和人类带来美好。 1、AI 的文学与艺术表达训练:精细调校 AI 的语言风格,深入分析并优化 AI 的表达中的修辞手法、叙事结构和情感节奏,确保 AI 的语言兼具艺术美感与逻辑严谨 2、提升 AI 的多元智能水平:基于广博的人文视角和跨文化理解,萃取历史、哲学及心理学中的精华思想,塑造 AI 的底层世界观、价值观、性格和行为准则,训练 AI 在艺术审美、哲学思考、同理心等方面的能力 3、构建生动的 human-AI 交互体验:关注 human-AI 交互中的每一个细节,优化 AI 在不同情境下的回答与主动表达,让它从冷冰冰的工具转变为懂得倾听和理解你心情的温柔伙伴,用美学和智慧激发用户内心共鸣

更新于 2026-02-10上海
logo of xiaohongshu
社招3-5年大模型

负责大模型预训练数据的全局采集策略设计,制定高效、可持续的数据获取路径,覆盖多语言、多领域、多模态数据源。 构建数据需求量化体系,针对模型能力目标(如推理、代码、知识等)规划数据采集优先级与规模,确保token总量与质量满足训练需求。 设计数据源发现、去重、质量评估与增量更新的自动化流程,平衡开源数据、合作数据与自采数据的应用。 探索低成本、高合规性的数据获取方案,应对版权、隐私等风险,支撑团队长期数据需求。

更新于 2025-10-29北京|上海|广州