心动运维开发工程师(AI方向)
任职要求
1、本科及以上学历,3年及以上运维开发经验; 2、精通 Python/Golang,熟悉 Django、Flask、Vue 等前后端开发框架,具有良好的编码风格; 3、熟悉 LLM 应用开发(Prompt Engineering、RAG、Agent),有 LangChain/LlamaIndex 经验; 4、能调用 OpenAI/Azure/Claude 等主流 LLM …
工作职责
1、负责运维自动化平台的设计与开发,参与运维体系建设; 2、负责 AI 能力的探索与落地,包括 LLM 应用集成、RAG 知识库构建、智能运维等; 3、构建 AIOps 能力,包括智能告警、异常检测、根因分析; 4、开发 AI Agent,落地运维场景的自动化与智能化; 5、负责把日常运维操作实现为自动化工具,挖掘并发现工具需求; 6、将工作过程中的经验积累、研究成果、技术要点等以文档形式保存及传承,建立知识库体系。
负责公司 MLP 平台的 GPU 集群底座建设,主导大规模多集群环境下的稳定性、调度效率和基础设施插件能力,支撑内部模型训练和推理业务。 核心职责 1. GPU 集群稳定性建设:主导 GPU 集群高可用架构设计,制定 SLA/SLO 目标,建立容量规划、变更管控、灰度发布和稳定性度量体系。 2. 故障响应与处理:负责 P0/P1 级故障的快速定位、根因分析和事后复盘,建立可观测性、告警和应急响应机制。 3. 多集群管理:设计多集群联邦、统一接入、资源调度和灾备方案,解决跨集群业务调度、流量分发和数据一致性问题。 4. 基础设施插件开发:基于 K8s 二次开发或定制 CNI、CSI、Device Plugin、Scheduler Extender 等核心组件,适配公司 GPU 资源池和存储/网络环境。 5. 跨团队协作:与算法、业务方紧密协作,承接模型训练/推理场景的底层需求,推动平台能力落地。
团队介绍:视频与边缘部门承载了字节跳动的媒体内容分发基建及技术中台,支持了字节全系产品,如抖音、今日头条、番茄小说、西瓜视频等APP的点播、直播、实时通信、图片等多媒体业务发展,同时将业务发展过程中沉淀下来的技术能力和工具,通过火山引擎对外输出,面向各行各业用户提供视频云产品和服务,愿景是为内外部业务伙伴提供最低成本、最优画质、最低延时、最安全可靠的富媒体内容分发解决方案,助力业务伙伴降本提效实现持续增长。 1、负责字节跳动视频与边缘业务稳定性及运维平台系统设计、开发; 2、包括但不仅限于变更,监控,应急等智能运维平台的建设; 3、负责通用组件、优化工具的设计和开发; 4、参与视频与边缘稳定性、运维平台、AIOps工具产品定义,规划及建设。

方向一:系统运维开发工程师 1.负责开发、测试或生产环境中服务器和应用系统的管理与监控,确保系统的稳定运行; 2.使用夜莺、Prometheus、Grafana等工具进行实时监控和数据分析,及时发现和解决潜在问题。 方向二:容器运维开发工程师 1. 协助公司K8s集群及中间件集群的运维; 2. 协助自动化平台、工具的落地开发; 3. 参与云原生技术的调研。
1.系统设计与研发: 负责设计、实现并运维支撑智能运维智能体平台的大规模、高可用分布式系统,处理PB级的实时日志&监控等数据; 2.核心功能开发: 端到端地负责AI Agent核心功能的研发,包括异常检测、根因分析、任务规划(Planning)及智能修复建议等模块,将前沿概念转化为可靠的线上服务; 3.算法工程化落地: 与算法科学家紧密合作,负责将前沿的大语言模型(LLM)及其他机器学习模型产品化,构建高效的数据处理管道、模型推理服务与反馈闭环; 4.技术战略与卓越工程: 参与制定团队的技术路线图,驱动软件工程、系统架构与运维卓越的最佳实践,持续提升系统的扩展性与鲁棒性; 5.技术攻坚与指导: 解决系统中最具挑战性的技术难题,并乐于指导团队其他工程师,共同营造追求技术卓越的工程师文化。