快手多模态大模型算法工程师-【可灵AI-数据效能研究方向】
任职要求
1、具有计算机、人工智能、统计学等相关专业硕士及以上背景,理解深度学习与多模态模型基本原理; 2、熟练掌握 Python/PyTorch,具备扎实的数据分析能力,对模型训练数据的分布、质量与信号敏感度有较强理解力; 3、对数据效能、数据选择、数据蒸馏、合成数据、self-supervised 等方向有浓…
工作职责
1、数据效能研究(Data Efficiency):基于多模态大模型训练过程,分析不同模态数据的有效性、信息增益与贡献度;参与数据选择、数据蒸馏、难例挖掘等前沿技术探索,提升训练效率与模型表现; 2、数据–模型协同设计(Co-Design):与模型团队协作,从训练曲线、梯度信号与分布特征中反推数据质量,研究分阶段(预训练/SFT/对齐)数据策略,设计高效的数据结构与采样机制; 3、高质量数据构建(Data Quality Engineering):参与多模态数据 pipeline,包括自动标注、Caption 生成、数据去噪与一致性检查;探索弱监督、合成数据与模型 in-the-loop 的高质量数据生产方式; 4、多模态数据分析(Multimodal Analytics):对训练数据进行覆盖度、偏差与难度分析,构建可视化与指标体系,为模型能力诊断与数据重构提供依据。
1、了解多模态内容生成相关算法,如Diffusion Models 、 GAN 、 VAE 、 Autoregressive Models等,包括但不限文本/图像/视频生成,解决生成质量、多样性、可控性、采样效率、可编辑等问题; 2、了解端到端多模态生成式大模型的框架设计、训练与调优,构建基于生成模型的AI系统,推动多模态AIGC在快手各业务场景的产品化落地。
1、数据特征算法方案制定与效果优化:针对不同模态、多种类目的数据,设计自动化筛选方案;对多模态数据涉及的前沿特征算法(如物体跟踪、ID 重识别、音频分离)进行场景化效果优化。与算法工程师协作,制定数据调整与扩展策略,提升模型在真实场景中的生成能力; 2、数据 pipeline 建设:负责多模态大模型训练数据的构建与管理,参与数据筛选、标注及质量评估工作。分析和挖掘现有数据资源,设计有效的数据分布策略,支持模型持续迭代; 3、数据分布分析:对模型训练数据分布进行详细分析,识别数据偏差、不均衡及潜在问题。提供可视化报告及改进建议,确保训练数据覆盖目标场景并满足多样性需求,最终通过数据驱动方法优化视频生成大模型效果。

【工作职责】 1.负责面向自动驾驶极端场景下多模态大模型系统的算法研发与优化 2.负责面向自动驾驶图像质量评估相关算法的研发与优化 3.深度参与数据闭环、模型训练和部署、场景泛化性提升

1、负责视觉-语言大模型(VLM)研发与优化,推动中医智能诊疗、医学图像分析等场景的端到端算法落地。 2、针对舌象、面色、关节等多类医学图像,开发分类、检测、分割及异常检测算法,支撑辅助诊断与健康评估。 3、设计跨模态融合架构,实现图像、文本等多源数据的协同建模与联合推理。 4、基于LLM/VLM进行SFT、RLHF、LoRA等微调,优化辨证论治、报告生成、医学问答等任务,提升临床实用性。 5、开发具备自主推理与工具调用能力的Agentic智能体,覆盖辅助诊断、用药监测、随访管理等自动化场景。 6、构建医学知识图谱,结合RAG技术增强模型可解释性与专业可信度。 7、跟踪前沿技术,探索创新应用,确保算法符合医疗伦理与监管要求。