顺丰大模型算法高级工程师-(智能体)
任职要求
具备大规模语言模型(LLM)或多模态大模型的预训练,指令微调(SFT)或对齐(RLHF)全流程实践经验。 对Transformer架构,缩放定律,大模型训练稳定性有第一手的技术洞察和实操经验。 精通Python,熟练掌握PyTorch框架,具备出色的工程实现与调试能力。 核心技能 扎实的机器学习基础,出色的数据敏感性和分析能力。 熟悉Linux开发环境,具备大规模分布式训练或高性能推理优化经验者…
工作职责
基座大模型研发与创新 参与设计并研发面向大规模多元时间序列的预训练基座模型,探索适用于时序数据的 Transformer变体(如Informer,FEDformer, PatchTST)及创新架构。 负责构建超大规模,高质量的时序预训练数据集,设计掩码重建,上下文预测等自监督预训练任务。 研究时间序列中的关键问题,如长周期依赖建模,多尺度特征提取,缺失值处理,以及时序与文本/事件等多模态信息的对齐与融合。 模型深度优化与领域适配 针对特定高价值场景(如电力负荷预测,量化金融,工业设备预测性维护),对基座模型进行深度微调与优化,实现"通用能力"到"领域专家"的转化。 研发高效的模型适配技术(如参数高效微调 PEFT),确保基座模型能够快速,低成本地适配到多样化的下游任务。 系统工程与高性能推理 负责将模型从研究原型推进到稳定,高性能的生产级系统。优化训练框架,利用混合并行(数据并行,模型并行,流水线并行)技术实现千亿参数模型的分布式训练。 主导模型的高效推理优化,应用量化(INT8/ FP4),编译优化等技术,大幅降低服务延迟与资源消耗,支撑海量时序数据的实时预测需求。 技术前瞻与行业赋能 追踪时间序列分析,大模型预训练的前沿学术进展,并将有潜力的技术引入到产品研发中。 与业务团队紧密合作,深入理解行业痛点,将基座模型的强大能力转化为可衡量的业务价值,定义时间序列预测领域的新标准。 岗位要求 必备条件 计算机科学,人工智能,统计学或相关专业硕士及以上学历(博士优先).
1. 前沿模型架构研发:负责大模型前沿架构(如 Linear Attention、原生多模态、MoE 等)的底层工程实现。深度参与算法底层逻辑重构,将前沿理论模型转化为高性能的训练与推理模型。 2. 复杂算子优化与系统级重构:针对非标准及新型算法架构,设计并实现深度定制化的分布式算子。通过重构核心计算组件,解决超大规模模型在异构算力集群下的瓶颈问题,打造具备极致响应速度和吞吐能力的推理后端。 3. 大规模并行策略与资源调度:设计并落地匹配复杂架构的计算并行策略(TP/PP/EP/CP)及精细化显存管理方案。持续优化大规模集群通信机制,降低通信开销,确保在算力池中实现模型的高效、稳定运行。

1. 前沿模型架构研发:负责大模型前沿架构(如 Linear Attention、原生多模态、MoE 等)的底层工程实现。深度参与算法底层逻辑重构,将前沿理论模型转化为高性能的训练与推理模型。 2. 复杂算子优化与系统级重构:针对非标准及新型算法架构,设计并实现深度定制化的分布式算子。通过重构核心计算组件,解决超大规模模型在异构算力集群下的瓶颈问题,打造具备极致响应速度和吞吐能力的推理后端。 3. 大规模并行策略与资源调度:设计并落地匹配复杂架构的计算并行策略(TP/PP/EP/CP)及精细化显存管理方案。持续优化大规模集群通信机制,降低通信开销,确保在算力池中实现模型的高效、稳定运行。
1. 高质量垂域数据工程:深入优化垂直领域(如文本内容审核)的高质量数据构建与迭代方法论,持续提升数据的质量、多样性与生产效率。 2. 可扩展后训练体系:探索适配领域特性的 SFT/RL 算法,构建高效、稳定、可扩展的垂域模型后训练范式,系统性提升模型能力。 3. 前沿技术研究与落地:探索推理模型前沿技术(如高效蒸馏、reward system、agentic RL、test-time learning 等)以及模型可解释性技术,沉淀技术成果和影响力,并推动大模型相关技术在行业场景中的转化与落地,提升领域模型竞争力,支撑业务持续增长。