logo of liauto

理想汽车技术运营(SRE)专家/负责人

社招全职5年以上智能与信息技术地点:北京状态:招聘

任职要求


1.计算机或工程相关专业,统招本科以上学历,具备扎实的计算机和软件技术基础。
2.熟悉 Linux 系统,对网络、系统优化、性能调优的工具和方法有深入理解;熟悉 Ansible/Saltstack/Puppet 等常用运维自动化工具,有基础架构自动化搭建经验。
3.至少掌握一门主流编程语言,具备 Shell 编程能力,有自动化运维平台开发建设经历;认同 DevOps/SR…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1.负责理想汽车软件、芯片研发基础设施的运营管理,保障核心应用的稳定可靠运行,结合业界技术演进迭代基础设施架构,通过规范化、标准化、自动化、智能化等手段不断提升运营效率和服务质量。
2.研发构建核心基础设施工具链,以及相应监控、配置、日志、智能化运营(AIOps)能力建设,制定业务相关的运维技术方案,确保业务高效稳定的运行。
3.负责服务的容量规划和预测,软件的性能分析以及系统调优,软硬件系统的采购与服务部署等。
4.负责高可用和可观测体系建设,制定如全链路监控、故障定位、自动恢复、异地容灾等方案并落地实施,保障业务持续可用。
5.和算法、工程团队协同完成研发基础设施的智能化改造,构建新一代 AI 友好型研发基础设施。
6.负责技术运营(SRE)团队的日常管理,带领团队达成业务建设目标。
包括英文材料
学历+
Linux+
性能调优+
Ansible+
SaltStack+
还有更多 •••
相关职位

logo of kuaishou
社招5年以上D2068

1、作为公司技术中后台的项目经理,以项目BP的身份对接中后台不同业务部门负责人, 支持部门日常,包括但不限于:OKR管理、战略规划、大型项目过程管理、会议体系设计等工作; 2、作为不同技术战略方向的项目经理、对接方向负责人,可以与各中台团队、前台业务团队进行良好的跨团队协同,保证公司技术战略的切实落地; 3、可以结合业务和团队特点, 设计并落地项目管理流程及工具,提升团队协作效率,积累、沉淀、复用项目管理经验及方法论,对团队进行赋能。

更新于 2025-04-08北京
logo of dewu
社招5年以上技术类

1、负责核心搜推工程业务的稳定性,通过指标建设、制度建设、降级容灾、预案设计、容量管理、监控/告警优化等一系列手段提升业务稳定性; 2、高效满足研发团队的运维服务需求,整合技术保障平台能力、服务能力等资源,提供研发团队高质量的支撑保障,并深度参与业务重大架构方案的设计与评审; 3、通过效率指标识别,新技术引进在业务域落地等手段,配合成本运营部门持续优化技术成本投入; 4、负责核心基础服务标准化建设、维护和管理,建立SOP,自动化运维工具,规范团队人员变更操作,确保系统的持续集成与交付。

更新于 2025-08-04上海
logo of google
社招3年以上

• 在与客户打交道的整个过程中,与客户方技术负责人、客户方高管以及合作伙伴通力协作,管理并实现云解决方案,成为决策者信赖的顾问。 • 根据客户要求和实现方面的最佳实践,提出解决方案架构建议,并管理云端分布式虚拟化基础设施解决方案的部署。 • 与内部专家团队、产品团队和工程团队合作,以便汇总各种做法、最佳实践和经验教训,进而提取出能够发挥思想引领作用的洞见、行之有效的方法和可供发布的资源。 • 与销售人员、合作伙伴以及客户在技术方面的利益相关方沟通合作,管理项目范围、优先事项、可交付成果、风险和问题以及时间表,助力客户取得成功。

上海|北京|深圳
logo of xiaohongshu
社招5-10年引擎

我们是小红书中台大模型 Infra 团队,专注打造领先易用的「AI 大模型全链路基础设施」!团队深耕大模型「数-训-压-推-评」技术闭环,在大模型训练加速、模型压缩、推理优化、部署提效等方向积累了深厚的技术优势,基于 RedAccel 训练引擎、RedSlim 压缩工具、RedServing 推理部署引擎、DirectLLM 大模型 API 服务、QuickSilver 大模型生产部署平台等核心产品,持续赋能社区、商业、交易、安全、数平、研效等多个核心业务,实现 AI 技术高效落地! 1、参与设计实现支持RLHF/DPO等对齐技术的高效训练框架,优化强化学习阶段的Rollout、Reward Model集成、多阶段训练 Pipline; 2、研发支持多机多卡 RL 的分布式训练框架,开发TP/PP/ZeRO-3与RL流程的动态协同机制,解决 RL 算法在超长时序下的显存/通信瓶刭 3、构建端到端后训练工具链,主导框架与 MLOps 平台集成,提供训练可视化、自动超参搜索等生产级能力 4、与公司各算法部门深度合作,参与大语言模型LLM、多模态大模型 MLLM等业务在 SFT/RL领域的算法探索和引擎迭代; 5、参与分析各业务 GPU 利用率与饱和度等指标,结合业务场景持续优化训练框架能力,提升框架领先性。

更新于 2026-03-28上海|北京