阿里巴巴乌鸫科技-大模型应急运维工程师-平台技术
任职要求
1. 计算机相关本科及以上学历,1年以上互联网、云计算、AI Infra方向的运维保障经验,对故障排查、定位、快恢有一定经验积累。 2. 熟悉Linux系统、K8s、Docker等基础设施,掌握网络、存储、计算等常见系统问题的排查手段和恢复措施,具备日志分析、链路追踪等可观测性工具使用经验,了解大模型推理服务调用链路与故障排查者优先。 3. 具备强烈的责任心,做到负责事项有响应…
工作职责
1. 负责百炼大模型推理服务全链路的监控体系建设与应急响应,覆盖模型调用链路追踪、推理时延与吞吐监控、Token消耗与限流观测、GPU资源与卡型、推理引擎运行状态监控等核心场景,针对模型服务的限流、超时、OOM、推理性能退化等典型故障,建立快速定位与恢复机制,保障大模型服务的高可用与稳定输出。 2. 负责推动阿里各业务及百炼大模型的的各类业务的监控覆盖与质量优化,定期开展监控验证保鲜,覆盖阿里电商、中间件、ASI、大模型、基础设施等核心链路,针对监控盲区与未发现的风险/故障,从稳定性角度评估观测可行性,设计并推动落地解决方案,持续提升系统的可观测能力。 3. 负责阿里各集团及百炼大模型线上业务的7×24小时oncall、风险、故障应急响应与协同,包括应急事件判断、故障应急启动、应急处置与恢复、进展同步及应急质量复盘,持续沉淀应急经验与预案,提升应急处置的专业度与效率。 4. 负责阿里核心业务618、双11等大促活动的稳定性保障,以及大模型业务在流量高峰下的业务重保,参与容量交付、预案准备、压测演练、应急处置与现场护航。 5. 负责分析历史风险与故障案例,设计故障注入方式,复现故障场景,定期执行混沌演练,验证快恢预案的有效性,分析演练结果,提出改进措施,持续优化演练流程,确保核心业务具备分钟级恢复能力。 6. 负责建设自动化应急快恢工具,协助实现具备自主诊断、智能决策、自动处置能力的应急数字人,构建大模型运维诊断助手,缩短故障定位与恢复时间,推动AI时代稳定性保障新范式。

1. 负责面向LLM、图片、视频、音频的全模态标注能力建设; 2. 负责标注平台智能标注能力建设,如LLM、多模态自动标注等,并建设基于标注平台的agent框架以及相关标注agent的开发; 3. 负责面向领域专家的专家标注平台建设,同时把智能标注能力迁移至专家标注平台。

1.数据标注&采集专家基地运营管理: (1)负责站点搭建,人员招募,管理团队搭建,培训管理,质量管理与人员管理,负责站点的全面管理; (2)负责制定交付站点的日常运营计划、标准作业程序(SOP)与管理制度; (3)管理站点的标注评测专家,包括任务分配、绩效评估、技能培训与团队建设。 2.质量管理:搭建对大模型类数据标注、模型评测或数据集生产的质量和培训体系,对数据质量负责; 3.成本管控:负责对负责的交付站点的整体成本进行管控,包括人力成本,运营成本等各项成本,达成成本目标。 4.供应商管理:负责交付履约及结算等工作。对供应商在项目中出现的问题和事故进行及时干预与处理,确保项目顺利推进。"

1.开展具身智能行业的数据采集、标注及评测建设,能够从各领域专业层面设计专业的数据生产方案、评测方案、开展专业的评测服务; 2.建设各领域评测维度、指标体系、业务评测集并开展深入的评测分析工作。产出评测报告,学术benchmark等有影响力的创新工作; 3. 构建并维护一套完善的各领域AI数据内容质量管理体系,全面把控内容质量并对结果负责,并不断进行优化迭代; 4. 积极推动组织流程及交付流程优化,对接数据标注供应商。负责组织培训、试标、通过持续培训和反馈提升供应商标注质量与效率; 5.承担本方向数据处理、数据清洗、数据蒸馏、数据合成等多样数据工程工作.

1. 负责大模型的高质量的数据构造工作,主要在code模型、Agentic、具身智能等各垂域数据任务,与算法团队密切合作,理解算法需求,提供满足算法研发需求的数据; 2. 对于swe/terminal及业界更加前沿的代码场景任务能够熟练构建。设计和实现各领域标注方向AI训练流程,并不断优化迭代,高效完成标注和内容生产项目; 3. 统筹各领域核心知识点分类框架、回答思维模式、推理问答、权威教材教研资料、前沿科研论文专著等关键要素。依据多元数据集设计需求与应用场景,为数据集标准环节制定详实、完备且极具可操作性的标准。定期对数据集开展阶段性质量检测,持续迭代体系化标注标准,助力打造行业标杆级数据集; 4. 构建并维护一套完善的各领域AI数据内容质量管理体系,全面把控内容质量并对结果负责,并不断进行优化迭代; 5. 积极推动组织流程及交付流程优化,对接数据标注供应商。负责组织培训、试标、通过持续培训和反馈提升供应商标注质量与效率。