腾讯AI AGENT智能运维场景产品经理-可观测方向

社招全职5年以上CSIG产品2025-10-13地点：深圳状态：招聘

扫码手机上打开

任职要求

1.本科学历以上，3 年及以上互联网、云计算或 AI 领域产品经验，有智能运维、AI Agent 相关产品经验者优先；；
2.熟悉 AI 技术（尤其是 LLM和AI算法）及智能运维场景，具备云计算、大数据或运维相关技术背景，对 AI 在运维领域的应用趋势敏感度高；；
3.执行能力强，具备 AI 产品设计（如 Agent 交互逻辑、智能决策流程）和商业化包装能力，能深度理解 AI 技术与运维场景的结合点；；
4.具备极强的跨团队合作能力（能高效联动 AI 算法、运维技术、工程开发等团队），沟通清晰，思维活跃，学习能力、适应能力强；；
5.工作主动积极，有创新突破的内驱力，也有沉下心来攻坚和落地复杂场景…

登录查看完整任职要求

微信扫码，1秒登录

工作职责

1.负责 AI AGENT 在智能运维场景的产品策划工作，聚焦基于 LLM 的智能运维 Agent 产品设计，涵盖智能告警、根因分析、自动化排障等核心场景；；
2.通过市场竞品分析（包括 AI 运维工具、智能 Agent 产品）、客户运维场景需求调研、前沿 AI 技术（如 LLM、多模态模型）在运维领域的应用研究，明确产品核心需求与差异化方向；；
3.主导 AI 智能运维 Agent 的产品策划与架构设计，协调 AI 算法团队、运维技术团队、工程实现团队等多方资源，推动产品从概念落地到交付全流程，确保产品功能与体验符合运维场景实际需求；；
4.支持产品商业化进程，提供面向客户的 AI 运维 Agent 产品解决方案、销售素材，并参与售前支撑，对产品在运维场景的规模化落地与增长负责；；
5.持续关注 AI 技术发展（如 Agent 能力进化、LLM 模型迭代）与运维行业趋势（如自动化运维、AIOps 升级），对产品方向进行前瞻性设计，挖掘新的场景增长点（如跨场景 Agent 协同、智能化运维闭环）。。

📮 投递简历 ✨AI模拟面试

难度：

包括英文材料

学历+

大数据+

Presto+

Flink+

Spark+

ElasticSearch+

还有更多 •••

登录查看完整学习资料

相关职位

大模型训练框架研发工程师/专家

社招5-10年引擎

我们是小红书中台大模型 Infra 团队，专注打造领先易用的「AI 大模型全链路基础设施」！团队深耕大模型「数-训-压-推-评」技术闭环，在大模型训练加速、模型压缩、推理优化、部署提效等方向积累了深厚的技术优势，基于 RedAccel 训练引擎、RedSlim 压缩工具、RedServing 推理部署引擎、DirectLLM 大模型 API 服务、QuickSilver 大模型生产部署平台等核心产品，持续赋能社区、商业、交易、安全、数平、研效等多个核心业务，实现 AI 技术高效落地！ 1、参与设计实现支持RLHF/DPO等对齐技术的高效训练框架，优化强化学习阶段的Rollout、Reward Model集成、多阶段训练 Pipline； 2、研发支持多机多卡 RL 的分布式训练框架，开发TP/PP/ZeRO-3与RL流程的动态协同机制，解决 RL 算法在超长时序下的显存/通信瓶刭 3、构建端到端后训练工具链，主导框架与 MLOps 平台集成，提供训练可视化、自动超参搜索等生产级能力 4、与公司各算法部门深度合作，参与大语言模型LLM、多模态大模型 MLLM等业务在 SFT/RL领域的算法探索和引擎迭代； 5、参与分析各业务 GPU 利用率与饱和度等指标，结合业务场景持续优化训练框架能力，提升框架领先性。

更新于 2026-03-28上海|北京

AI平台开发工程师-数据方向-机器学习平台

社招3年以上机器学习平台

【业务介绍】作为公司统一的机器学习平台团队，负责调度公司所有模型训练与推理资源；基于自建的训推引擎，构建公司统一的机器学习平台，为公司所有算法同学（稀疏 & 稠密，含 LLM）模型迭代提供端到端的一站式服务；包括数据生产，模型训练，模型上线，特征管理，模型测试，资源管控等一系列能力。【岗位职责】 1、负责机器学习链路，离在线数据相关的开发工作，包括样本数据、特征数据等的数据链路搭建、任务运维和调优、性能优化等 2、负责小红书大规模机器学习平台的后台系统设计和开发工作；包括样本平台，特征平台，训练平台，推理平台等AI应用后台建设等； 3、研究分析业内AI平台产品，优化技术方案，改进产品功能，完善产品体验。

上海

大模型推理框架研发工程师/专家

社招5-10年引擎

我们是小红书中台大模型 Infra 团队，专注打造领先易用的「AI 大模型全链路基础设施」！团队深耕大模型「数-训-压-推-评」技术闭环，在大模型训练加速、模型压缩、推理优化、部署提效等方向积累了深厚的技术优势，基于 RedAccel 训练引擎、RedSlim 压缩工具、RedServing 推理部署引擎、DirectLLM 大模型 API 服务、QuickSilver 大模型生产部署平台等核心产品，持续赋能社区、商业、交易、安全、数平、研效等多个核心业务，实现 AI 技术高效落地！工作职责： 1、参与/负责研发面向大语言模型(LLM)/多模态大模型(MLLM)等类型模型的推理服务框架； 2、参与/负责KV Router、PD分离/EPD分离、KVCache管理、动态PD调整等分布式推理能力建设； 3、通过并行计算优化、分布式架构优化、异构调度等多种框架技术，打造高效、易用、领先的AI推理框架； 4、参与/负责构建推理框架的系统容错能力，包括但不限于请求迁移、优雅退出、故障检测、自愈等能力建设； 5、深度参与周边深度学习系统多个子方向的工作，包括但不限于模型管理、推理部署、日志/监控、工作流编排等； 6、与全公司各业务算法部门深度合作，为重点项目进行算法与系统的联合优化，支撑业务目标达成。

更新于 2026-03-28北京|上海

大规模GPU集群调度优化工程师/专家

社招引擎

大模型具备很强的泛化及理解世界能力，在小红书内的众多生产场景遍地开花，大模型的训练和部署已成为许多算法工程师的日常。在多团队、多业务频繁使用的大规模GPU集群上，如何能够通过高效的GPU调度策略，使大家不仅能丝滑地完成训练及部署任务，同时也能充分激发大规模GPU集群的效能，是行业公认的关键挑战。在这里，你可以聚焦LLM场景，接触到超大规模GPU集群，并使用真实负载数据进行深入分析及技术探索。欢迎加入我们，一起探索领先技术改变世界！工作职责： 1、负责万卡规模GPU集群效能分析及优化，通过调度策略优化、在离线混部、集群调度、GPU虚拟化、故障快速恢复、存储&网络加速等手段，提升大规模GPU集群的整体使用效率。 2、负责构建面向大模型训练、微调、推理、部署全流程LLMOps，与下游云原生平台深度融合，支撑大模型在公司内各业务生产链路稳定高效地落地。 3、持续关注业界最新的GPU资源调度相关技术动态，探索建设业界领先的资源调度策略及方法，构建下一代大规模AI资源调度系统。

北京|上海

腾讯AI AGENT智能运维场景产品经理​-可观测方向

任职要求

工作职责

腾讯AI AGENT智能运维场景产品经理-可观测方向