特斯拉AI开发运维工程师 – IT 制造支持
任职要求
必备条件 • 计算机科学、人工智能、软件工程、电子工程等相关专业。 • 工作经验:至少 2 年 AI 开发、DevOps 或自动化部署相关工作经验,有制造业(尤其汽车制造、工业制造)相关经验者优先。 • 技术能力: o 熟练掌握 Python 语言,可独立编写高效的 AI 算法代码、数据处理脚本与 DevOps 自动化脚本,同时能运用 Dify 等低代码 AI flow 工具,在低代码环境中快速调用大模型o 以满足制造场景下的业务需求。 o 精通 Kubernetes(K8s)与 Docker 技术,具备生产环境下容器化部署、集群管理与运维的实战经验。 o 熟悉机器学习框架,能独立完成制造场景下 AI 模型的设计、训练与优化。 o 了解 Hadoop、Spark 等大数据处理技术,可处理制造过程中产生的海量生产数据(如传感器数据、日志数据)。 o 熟悉 CI/CD 流程与工具链(如 Jenkins、GitLab CI),能使用 …
工作职责
特斯拉为信息技术部开放 IT MFG DevOps AI 全职岗位(工作地点:特斯拉上海超级工厂)。若你是融合 AI 开发、DevOps 实践与制造业技术的全能专家,能在智能制造场景下高效应对挑战、解决复杂技术问题,拒绝重复低效的工作模式,那么该岗位正适合你。 IT MFG DevOps AI 是连接公司 IT 系统与生产制造环节的核心角色,身处智能制造落地的一线。你将每日对接 AI 技术研发、容器化部署与生产运维等多领域工作,通过技术实践支持公司优化生产流程、提升制造效率,助力实现智能制造转型的核心目标。 岗位职责 • 负责 AI 算法研发、模型优化与训练,聚焦生产线数据分析、质量控制、故障检测、自动化生产等场景,确保 AI 技术适配制造业务需求。 • 基于 Kubernetes(K8s)与 Docker 容器技术,完成 AI 解决方案的部署、监控与扩展,保障生产环境中系统的高可用性与稳定性。 • 参与 DevOps 流程建设,优化 AI 模型与系统的开发、测试、部署全链路,实现自动化部署、持续集成(CI)与持续交付(CD)。 • 与生产、质量控制、研发等制造相关部门对接,深入理解业务痛点,提供数据驱动的 AI 技术解决方案。 • 快速响应生产线上的技术需求与故障,排查 AI 系统、容器集群、网络环境等问题,减少对生产进度的影响,提升生产效率与质量。 • 跟踪 AI 与 DevOps 领域前沿技术(如工业大模型、云原生运维)及行业动态,推动新技术在制造场景的预研与应用,持续优化系统性能。
1、负责运维自动化平台的设计与开发,参与运维体系建设; 2、负责 AI 能力的探索与落地,包括 LLM 应用集成、RAG 知识库构建、智能运维等; 3、构建 AIOps 能力,包括智能告警、异常检测、根因分析; 4、开发 AI Agent,落地运维场景的自动化与智能化; 5、负责把日常运维操作实现为自动化工具,挖掘并发现工具需求; 6、将工作过程中的经验积累、研究成果、技术要点等以文档形式保存及传承,建立知识库体系。
负责公司 MLP 平台的 GPU 集群底座建设,主导大规模多集群环境下的稳定性、调度效率和基础设施插件能力,支撑内部模型训练和推理业务。 核心职责 1. GPU 集群稳定性建设:主导 GPU 集群高可用架构设计,制定 SLA/SLO 目标,建立容量规划、变更管控、灰度发布和稳定性度量体系。 2. 故障响应与处理:负责 P0/P1 级故障的快速定位、根因分析和事后复盘,建立可观测性、告警和应急响应机制。 3. 多集群管理:设计多集群联邦、统一接入、资源调度和灾备方案,解决跨集群业务调度、流量分发和数据一致性问题。 4. 基础设施插件开发:基于 K8s 二次开发或定制 CNI、CSI、Device Plugin、Scheduler Extender 等核心组件,适配公司 GPU 资源池和存储/网络环境。 5. 跨团队协作:与算法、业务方紧密协作,承接模型训练/推理场景的底层需求,推动平台能力落地。

方向一:系统运维开发工程师 1.负责开发、测试或生产环境中服务器和应用系统的管理与监控,确保系统的稳定运行; 2.使用夜莺、Prometheus、Grafana等工具进行实时监控和数据分析,及时发现和解决潜在问题。 方向二:容器运维开发工程师 1. 协助公司K8s集群及中间件集群的运维; 2. 协助自动化平台、工具的落地开发; 3. 参与云原生技术的调研。
团队介绍:视频与边缘部门承载了字节跳动的媒体内容分发基建及技术中台,支持了字节全系产品,如抖音、今日头条、番茄小说、西瓜视频等APP的点播、直播、实时通信、图片等多媒体业务发展,同时将业务发展过程中沉淀下来的技术能力和工具,通过火山引擎对外输出,面向各行各业用户提供视频云产品和服务,愿景是为内外部业务伙伴提供最低成本、最优画质、最低延时、最安全可靠的富媒体内容分发解决方案,助力业务伙伴降本提效实现持续增长。 1、负责字节跳动视频与边缘业务稳定性及运维平台系统设计、开发; 2、包括但不仅限于变更,监控,应急等智能运维平台的建设; 3、负责通用组件、优化工具的设计和开发; 4、参与视频与边缘稳定性、运维平台、AIOps工具产品定义,规划及建设。