快手大语言模型算法研究员(架构创新方向)
任职要求
1、计算机科学、人工智能、自然语言处理等相关专业硕士及以上学历; 2、在模型架构创新方面有实际研究经验,深入理解Transformer架构及其变体、MoE架构改造、线性注意力等方向; 3、有丰富的研究经验,在顶级会议(如NeurIPS、ICML、ICLR、ACL、EM…
工作职责
1、设计和实现高效稀疏的混合专家(MoE)模型架构,探索稳定训练方法和动态路由机制; 2、改进Transformer架构,通过注意力机制优化等技术显著降低训练推理计算成本; 3、研究基于线性注意力机制的新型架构,突破传统Transformer在长序列处理上的复杂度限制; 4、设计创新的模型结构以增强大模型的长文本理解和生成能力; 5、与工程团队紧密合作,确保新架构在大规模训练和部署中的可行性。
参与微信大规模语言模型(WeLM)的建设,涵盖训练流程的多个环节 1.探索大规模预训练模型的结构创新、优化器策略创新,提升单位算力下的智能获取效率 2.探索更高效全面的预训练数据建设方案、预训练数据使用方案 3.建设通用 Long-Horizon LLM Agent 的训练策略 4.独立或与其他研究员合作进行前沿领域研究。
【愿景】 建成全球持续领先、客户长期信赖的履约技术平台,打造市场首选、社会认可、服务10亿用户的配送品牌。 【你将参与】 方向一:多模态Agent技术体系研究与落地 1.面向真实业务场景,设计并构建多模态Agent技术体系,覆盖图像、视频、文本、语音等多源信息理解,以及任务规划、工具调用、多轮交互、跨模态推理、自我反思与纠错等核心能力。 2.围绕复杂业务任务,抽象多模态Agent的关键问题与模式,探索视觉感知、复杂推理、工具协同和任务执行的一体化优化方案,提升Agent在真实场景中的准确性、鲁棒性与执行效率。 方向二:多模态模型训练与后训练优化 1.负责多模态大模型及Agent模型的训练与优化,包括多模态指令精调、偏好对齐、奖励建模、过程监督等方向,提升模型在视觉理解、视频分析、图文推理、工具调用和复杂任务执行中的能力上限。 2.参与多模态训练数据与反馈数据建设,包括图文/视频数据清洗、合成数据构建、标注流程设计、偏好数据生产、评测数据沉淀等,支撑模型持续迭代。 方向三:多模态评测与业务闭环建设 1.设计覆盖多模态Agent行为、模型感知能力、跨模态推理能力、工具调用能力和业务效果的评测体系,建立自动化诊断与归因链路。 2.与业务团队深度协作,构建训练—评估—迭代闭环,将多模态Agent能力落地到真实业务流程中,并转化为可量化的线上收益。
参与大语言模型的核心技术研发,包括但不限于: 1、预训练优化(数据合成、长上下文建模、训练动力、scaling laws分析); 2、后训练技术(强化学习、奖励模型、推理能力提升); 3、代码生成与理解(自动化数据构建、运行反馈优化); 4、模型架构创新(MoE、高效推理、稳定性优化); 5、 探索AI Agent、长序列推理、在线学习等新兴方向。
专注于LLM post-training和agent相关算法研究,具体职责包括: 1、探索LLM可解释性 + 模型增量CPT/SFT/RL算法,提升语言模型在专业领域上的能力; 2、探索LLM可解释性 + 低比特量化算法,降低模型training/inference阶段计算成本; 3、探索agent 增强微调算法,提升模型在专业领域上端到端解决复杂任务的能力; 4、将相关算法研究成果发表在国际顶级会议上(ICLR/NeurIPS/ICML/ACL); 5、将相关算法研究成果应用于模型低比特量化、海外大模型业务中,显著提升阿里云通义千问模型服务效率和沙特、日本等国家主权大模型线上效果。