字节跳动SRE高级工程师-Data(杭州)
任职要求
1、大学本科及以上学历,计算机相关专业; 2、三年以上运维开发项目经验; 3、掌握常用开发语言Shell/Python/Golang,熟悉业界主流技术,如Open-Falco…
工作职责
1、推进优化基础服务的响应延迟、性能问题,提升服务稳定性; 2、负责各种基础系统搭建和维护(DNS、LDAP等); 3、开发自动化运维平台,提高运维、开发协作效率,规范操作流程; 4、优化各种系统,减少重复性工作; 5、负责公司基础监控、报警系统开发与维护。
1、推进优化基础服务的响应延迟、性能问题,提升服务稳定性; 2、负责各种基础系统搭建和维护(DNS、LDAP等); 3、开发自动化运维平台,提高运维、开发协作效率,规范操作流程; 4、优化各种系统,减少重复性工作; 5、负责公司基础监控、报警系统开发与维护。
The Role Come join a small team of experts building the systems that connect Tesla and our customers to their cars, robotaxis, robots, and energy products. At Tesla, we’re at the forefront of connected innovation providing a suite of rich backend services to our growing fleets. The team operates the UI and services behind developer.tesla.com. We own the platform that enables owners to interact with their cars and developers to build device-connected applications. The platform includes Authentication systems and other back-end services powering vehicles and mobile apps. You will evolve across the tech stack to deliver features to millions of customers and improve our products. We are looking for a highly motivated software engineer specialized in web services and distributed systems. The platform you build will scale novel functionality to millions of users and devices.
1、负责Sdwan网络的日常运维、监控和故障排除,及时响应并解决网络故障和性能问题; 2、构建和维护Sdwan网络的监控和告警系统,实现对网络状态的全面监控和预警; 3、开发和维护自动化运维工具和脚本,提高运维效率,减少人为错误,并负责编写和维护Sdwan网络相关的文档和知识库; 4、参与容量规划和性能测试,确保Sd-wan网络能够满足业务需求。
1、Site Reliability Engineer (SRE) 结合了软件和系统工程,致力于打造高扩展、高可用的分布式系统; 2、保障大数据/计算/云原生/分布式存储等多个核心系统的可靠性与正常运行,同时关注系统成本与稳定性; 3、为大型系统构建自动化运营解决方案;与系统开发团队合作,从系统设计到上线的整个生命周期内保障系统可靠性; 4、通过监控系统组件可用性、性能指标提升系统可见性,帮助系统开发以及团队快速定位故障; 5、推动提升服务的可靠性、可扩展性以及成本、性能优化,保障系统SLA;参与设计、实现能够保障线上大规模集群快速迭代的自动化平台; 6、基于业务使用场景,深入优化提供最佳服务治理实践,包含不局限于关键链路性能瓶颈分析、业务问题定位排障、推进系统高可用架构改造升级等。