
同程旅行运维工程师-27届
任职要求
1、计算机相关专业本科以上学历;——必须项 2、了解X86服务器的硬件体系结构;——必须项 3、具备一定的服务器系统SIT测试、BMC、BIOS测试经验;——加分项 4、具备一定的服务器OS兼容性,Ethernet/GPU/HBA卡兼容性测试经验,及对应的driver、FW的问题处理经验,协调资源解决问题,并完善测试用例;——加分项 5、熟悉服务器兼容性测试流程,具有较强的沟通协作能力,管理…
工作职责
1、负责参与评估硬件平台的计算性能测试、分析与落地; 2、负责服务器可靠性及稳定性验证,OS兼容性验证; 3、负责服务器新产品的BMC、BIOS测试设计及验证工作; 4、负责服务器板卡的引入测试,含内存、网卡、GPU及HBA卡等; 5、负责服务器配套软件变更,driver/fw升级的测试及版本管理; 6、负责服务器OS、driver及FW的网上问题分析处理; 7、参与硬件搭载软件相关的应用测试模型设计开发; 8、参与配套厂家制造品质的管理、解决产品质量问题;
参与业务基础运维工作,在导师指导下接触混合云环境下的运维体系建设与 AI Agent 驱动的智能运维平台开发。 协助自动驾驶业务日常运维技术支持,参与保障后台基础设施的稳定性和高可用 协助混合云(云上云下)各类资源的监控、维护和巡检 参与运维系统和工具的开发,协助落实运维体系工作建设,关注成本、质量、效率、安全目标 参与 XOPS 智能运维平台开发,协助将运维能力封装为 AI Agent 可调用的 Skill 和 MCP 服务,探索 Agent-driven Operations 落地实践 协助编写和调试 AI Agent 交互场景下的运维作业编排、审批流与自动化回滚逻辑 完成导师安排的技能学习与实操任务,逐步掌握生产环境运维规范
作为数据基础设施组的运维开发工程师,您将会了解前沿的自动驾驶数据和算法训练平台的基础架构以及有机会获得运维大规模人工智能训练平台的经验。1、持续对提供的基础架构及上层应用进行监控,并针对可能出现的问题,持续更新及优化所需的监控工具及监控内容,保证基础架构的服务可靠性满足SLA的要求; 2、配合算法、开发同学对机器学习中出现的问题进行定位,持续优化基础架构层提供的服务; 3、负责研发训练平台CI/CD环境运维,软件自动化构建,以及开发流程支持。 1、持续对提供的基础架构及上层应用进行监控,并针对可能出现的问题,持续更新及优化所需的监控工具及监控内容,保证基础架构的服务可靠性满足SLA的要求; 2、配合算法、开发同学对机器学习中出现的问题进行定位,持续优化基础架构层提供的服务; 3、负责研发训练平台CI/CD环境运维,软件自动化构建,以及开发流程支持。 1、持续对提供的基础架构及上层应用进行监控,并针对可能出现的问题,持续更新及优化所需的监控工具及监控内容,保证基础架构的服务可靠性满足SLA的要求; 2、配合算法、开发同学对机器学习中出现的问题进行定位,持续优化基础架构层提供的服务; 3、负责研发训练平台CI/CD环境运维,软件自动化构建,以及开发流程支持。
1. 负责智能网联平台应用配置与问题排查,监控告警配置与问题跟踪。 2. 负责智能网联平台CICD流水线配置,容器平台配置管理。 3. 负责智能网联平台运维工具开发、维护、BUG修复。
