鹰角网络服务端开发工程师-研发技术平台
任职要求
1、本科及以上学历,计算机相关专业,3年以上服务端开发经验,有平台型系统或中台系统经验者优先; 2、扎实的计算机基础,熟练掌握操作系统、网络、数据结构与算法等; 3、精通 Golang 开发,具备良好的代码工程能力和规范意识,熟练使用 MySQL、Redis 等常用存储技术; 4、熟悉分布式系统设计原理,具有高并发、高可用系统的设计与优化实战经验; 5、具备以下一个或多个方向经验者优先:本地化平台或内容管理相关…
工作职责
1、负责公司核心平台的架构设计与核心模块研发,支撑多业务线的高效能力建设和持续迭代; 2、围绕本地化业务场景,设计高扩展性、高灵活性的服务端架构,提升系统交付效率和业务支持能力; 3、参与平台化能力建设,主导内容生产、交付平台及配置服务等通用中台系统的设计与实现,推动复杂业务流程的抽象、标准化与复用; 4、与客户端、产品、QA、运维等跨团队紧密协作,确保业务流程在多角色参与下高质量落地; 5、持续优化系统性能与稳定性,攻克高并发、大规模数据处理及复杂业务场景下的技术挑战; 6、参与工程体系建设,完善监控告警、自动化测试、CI/CD 流程,提升系统的可维护性与可靠性; 7、主导项目从需求分析、方案设计到上线交付的全流程,推动系统稳定高效运行。
我们是小红书中台大模型 Infra 团队,专注打造领先易用的「AI 大模型全链路基础设施」!团队深耕大模型「数-训-压-推-评」技术闭环,在大模型训练加速、模型压缩、推理优化、部署提效等方向积累了深厚的技术优势,基于 RedAccel 训练引擎、RedSlim 压缩工具、RedServing 推理部署引擎、DirectLLM 大模型 API 服务、QuickSilver 大模型生产部署平台等核心产品,持续赋能社区、商业、交易、安全、数平、研效等多个核心业务,实现 AI 技术高效落地! 1、参与设计实现支持RLHF/DPO等对齐技术的高效训练框架,优化强化学习阶段的Rollout、Reward Model集成、多阶段训练 Pipline; 2、研发支持多机多卡 RL 的分布式训练框架,开发TP/PP/ZeRO-3与RL流程的动态协同机制,解决 RL 算法在超长时序下的显存/通信瓶刭 3、构建端到端后训练工具链,主导框架与 MLOps 平台集成,提供训练可视化、自动超参搜索等生产级能力 4、与公司各算法部门深度合作,参与大语言模型LLM、多模态大模型 MLLM等业务在 SFT/RL领域的算法探索和引擎迭代; 5、参与分析各业务 GPU 利用率与饱和度等指标,结合业务场景持续优化训练框架能力,提升框架领先性。
【业务介绍】 我们是小红书内稠密类模型(LLM/MLLM/SD/CV/NLP)统一的AI平台QuickSilver,负责调度公司内所有稠密类模型训练与推理资源,基于自建的训推引擎,为公司所有AI算法同学迭代业务模型提供端到端一站式AI服务;包括数据管理,模型管理,模型训练、压缩、推理、部署,服务管理,资源调度等一系列能力。 工作职责: 1、负责稠密类模型训练推理开发平台的架构设计和核心功能研发 2、设计和实现大模型训练部署流程,包括模型fine-tuning、推理服务化等 3、构建云原生架构,设计高可用、高性能的微服务体系 4、优化平台性能,提升系统稳定性和可扩展性
加入我们,您将参与构建贝壳业务(新房、二手、租赁、家装、商办等)基础设施商机平台。建设基于流量分发引擎的一站式商机分配业务解决方案和完善的B端精细化运营管理系统。您将有机会深度参与: 1、参与承载日均15亿+展位流量的分发引擎智能化升级,探索和应用A技术,夯实平台能力,助力业务目标达成; 2、参与建设一站式指标计算与管理平台,提升商机分配策略构建、数据经营分析效率; 3、参与迭代平台核心服务与系统,如:推荐策略开放平台、测算仿真平台、商机数据服务、效果溯源服务等; 4、参与大流量、高并发、海量数据处理相关大型分布式系统架构升级。