logo of tencent

腾讯混元大模型SRE运维工程师(北京)

社招全职3年以上AI技术地点:深圳状态:招聘

任职要求


1.计算机相关本科及以上学历,有3年以上行业运维经验;
2.熟悉Linux操作系统,具备扎实的系统管理和网络知识;
3.熟练掌握至少一种编程语言(如PythonGoShell等),有自动化运维工具开发经验;
4.熟悉大模型、云原生相关技术以及LLMOps部署流程,具备容器化和微服务架构经验;
5.熟悉常用的基础硬件评测技术,具备资源规划和成本控制经验,能够制定并执行资源优化、成本控制计划;
6.具备较强的故障排除和问题解决能力,能够在高压环境下快速响应和处理系统问题;
7.具备良好的沟通能力和团队协作精神,能够与跨部门团队有效合作;
8.具备快速学习和适应新技术的能力,乐于接受挑战和不断提升自我。

加分项
1.有AI大模型、广告、搜索以及推荐系统相关运维经验优先;
2.有大规模GPU集群管理经验者优先。

工作职责


1.负责大模型服务的稳定性和高可用性,确保平台在高并发和大流量下的稳定运行,设计和实施监控、报警和自动化运维平台建设等,及时发现和解决问题;
2.负责故障的快速定位和修复,制定并执行应急预案,确保业务连续性,参与故障复盘,分析根本原因,提出改进措施,防止类似问题再次发生;
3.开发和维护自动化运维平台与工具,提高运维效率,减少人为操作失误。进行资源使用优化,提高资源利用率,提升系统性能;
4.分析和深入发掘现有系统的不足,数据驱动找到薄弱点,推动系统优化落地改进;
5.负责资源规划和管理,确保资源的合理分配和高效利用,进行资源成本分析,监控和评估资源使用情况,提出成本优化方案,同时能结合业界硬件演进roadmap与技术平台需求不断推动最优配置选型与迭代。
包括英文材料
学历+
C+
TCP/IP+
HTTP+
Bash+
Python+
Go+
脚本+
NoSQL+
Nginx+
Apache+
Redis+
DevOps+
Docker+
Kubernetes+
Linux+
大模型+
微服务+
推荐系统+
相关职位

logo of tencent
社招3年以上TEG技术

1.负责混元大模型相关研发工作,包括文本创作、文本理解、数学、翻译、Agent FunctionCalls等专项; 2.负责混元在公司内相关业务场景落地,根据业务需求优化混元模型,提升业务效果; 3.负责跟踪和探索大语言模型的前沿问题,结合实际场景,提供全面的技术解决方案,参与前沿算法与应用的研究。

更新于 2025-06-19
logo of tencent
社招TEG技术

1.基于大模型训练对于数据的需求进行互联网数据抓取,对提供给大模型训练/搜索等场景的语料进行清洗,提升语料纯度; 2.建设对标业内前沿的大模型训练数据集和数据清洗能力,提升数据质量和多样性,并验证数据价值和效果。

更新于 2025-06-18
logo of tencent
社招3年以上TEG技术

1.负责大语言模型后台系统的性能优化、流程建设、稳定性和研效提升; 2.负责建设混元大模型的研发体系后端; 3.参与新技术调研及实际业务场落地,不断提升业务指标。

更新于 2025-06-17
logo of tencent
社招TEG技术

1.设计和开发大规模预训练数据处理pipeline,为模型预训练提供稳定、可靠的高质量数据处理能力; 2.根据大模型训练数据特点,抽象并开发高效、可靠的数据加工框架,提升处理数据的工程效率; 3.建设对标业内前沿的大模型训练数据集,提升数据质量和多样性,并验证数据价值和效果。

更新于 2025-06-17