知乎大模型数据质量经理
社招全职地点:广东 | 成都 | 武汉状态:招聘
工作描述
职位描述: 1、模型对齐与数据影响分析:深⼊⼤模型对齐训练(SFT/RLHF)的全流程,理解并分析数据在每个环节对模型能⼒的核⼼影响。 2、数据缺陷定位与优化:通过对模型评测、负⾯案例和⽣产数据的深度分析,从数据视⻆定位模型与数据的缺陷,提出并推动有效的优化策略。 3、数据⽣产与评测体系建设:参与设计…
登录查看完整工作描述
微信扫码,1秒登录
包括英文材料
SFT+
https://cameronrwolfe.substack.com/p/understanding-and-using-supervised
Understanding how SFT works from the idea to a working implementation...
RLHF+
[英文] What is RLHF?
https://aws.amazon.com/what-is/reinforcement-learning-from-human-feedback/
Reinforcement learning from human feedback (RLHF) is a machine learning (ML) technique that uses human feedback to optimize ML models to self-learn more efficiently.
https://www.ibm.com/think/topics/rlhf
Reinforcement learning from human feedback (RLHF) is a machine learning technique in which a “reward model” is trained with direct human feedback, then used to optimize the performance of an artificial intelligence agent through reinforcement learning.
相关职位
社招
1、热衷于追求 AI 前沿技术,有⼤模型训练、数据集构建或 Benchmark 测评等相关⼯作经验优先。 2、对数据有较强的敏感度和好奇⼼,享受从海量数据中抽丝剥茧、发现问题的过程,并具备出⾊的逻辑分
更新于 2025-12-05北京
社招
1、热衷于追求 AI 前沿技术,有⼤模型训练、数据集构建或 Benchmark 测评等相关⼯作经验优先。 2、对数据有较强的敏感度和好奇⼼,享受从海量数据中抽丝剥茧、发现问题的过程,并具备出⾊的逻辑分
更新于 2026-05-14成都
实习A179699
1、2027届本科及以上学历在读,计算机、统计、数据科学或相关专业; 2、可提供至少3个月实习周期;具备机器学习基础知识,了解NLP或CV方向模型训练流程,理解准确率、召回率等模型评估指标; 3、熟练
更新于 2026-05-28北京