网易资深 AI 工程师(机器学习平台方向)
任职要求
1、熟练掌握 K8s 大规模集群运维管理,精通容器、镜像、存储、网络,熟悉云原生 CI/CD、服务网格主流工具链; 2、具备完整 MLOps 平台落地经验,熟悉 Kubeflow、MLflow、Ray 至少一种生态工具; 3、熟悉 TensorFlow / PyTorch 主流框架,了解分布…
工作职责
1、负责企业级云原生机器学习平台建设,支撑模型开发、训练、部署、上线全生命周期管理; 2、负责机器学习平台核心组件落地与优化,包含分布式训练调度、模型版本管理、模型服务化推理部署; 3、负责 GPU 算力集群精细化运营,通过资源调度、弹性伸缩、异构算力管理,优化大模型训练 / 推理成本; 4、搭建平台监控、告警、可观测体系,保障机器学习集群及业务系统高可用、高稳定; 5、对接算法、业务团队,拆解需求并提供 MLOps 标准化平台解决方案。
【团队介绍】 BA Agent(商业分析助手)是美团面向企业运营场景的 AI 策略引擎,通过"Agent 产品 + FDE(前线交付工程师)"双轮驱动,将非标运营流程转化为可规模复用的标准化能力(Skill),实现从数据分析到行动闭环的端到端价值交付。 【团队特点】 -扁平化,纯结果导向,打破职能与职级边界 -AI-Native 工作方式——团队自身重度使用 AI 工具辅助研发与协作 -当前处于架构重启 + 规模化前夜,加入即主导核心系统 【岗位职责】 1.主导 Agent 核心架构设计与演进 -对标 Claude Code 等业界最佳实践,设计轻量级 Agent 编排框架(Unix 哲学) -统一工具/Skill 接入协议,支撑多端(Web/OpenAPI/大象)一致性交付 -设计并落地上下文管理、流式输出、会话压缩等核心能力 2.AI 安全体系建设 -防御 prompt injection 攻击:输入过滤、输出校验、指令隔离 -模型越权防控:工具调用权限边界、沙箱隔离、敏感操作二次确认 -安全审计:模型决策链路可追溯,异常行为检测告警 3.多租户高并发高可用云服务 -设计多租户隔离方案(数据隔离、资源配额、权限体系) -Agent 推理链路的高并发调度:异步编排、队列管理、弹性伸缩 -高可用保障:限流降级、熔断、故障自愈、灰度发布 4.效果-成本平衡 + 企业级审计合规 -模型路由与成本管控:分级调度、Token 预算管理、推理资源池化 -企业级审计合规:操作可追溯、数据分级分类、合规准入 -效果评测闭环:golden dataset + 自动化 Eval,确保成本优化不牺牲效果底线 5.数据加工与数据飞轮 -ETL pipeline:多源数据接入与清洗转换,支撑 Agent 取数、聚合、归因等场景 -数据飞轮:离线(日志萃取 → 评测集维护)+ 在线(用户画像/偏好 → 实时注入上下文),建立复利效应
1.Benchmark 构建与管理:负责高质量评测数据集的挖掘、清洗、标注与动态更新,设计长尾场景测试集,专门捕捉模型在极端或复杂指令下的失效点; 2.自动化评测流水线开发:搭建自动评测框架,集成主流开源评测工具(如 OpenCompass, VLMEvalKit 等)。开发基于模型的自动评分器,提升评测效率并保持与人工评价的高一致性; 3.AIGC 专项评测:建立图像/视频生成的质量评估体系,涵盖视觉效果、语义遵循、物理规律等维度,并解决生成内容的主观评价量化难题。
1.针对LLM幻觉与随机性难题进行专项治理,构建确定性保障机制。确保AI生成的用例与脚本在多轮执行、异构环境下保持高度一致,建立团队对人机协同的信任基线; 2.破解AI决策“黑盒”痛点,搭建覆盖“意图-生成-执行-判定”的数字孪生与追溯系统,实现过程秒级回溯,满足核心业务对合规性与安全性的严苛要求; 3.将AI测试从“实验室Demo”推向生产环境,设计支持万级并发的调度引擎(可用性99.99%)。引入对抗样本与变异测试,建立AI测试本身的防篡改机制; 4.抽象云底层资源,赋予AI自主管理环境生命周期的能力。通过自然语言交互实现复杂拓扑的一键拉起、故障注入与销毁,极大提升研发效能; 5.基于MCP理念打磨测试脚手架,开发针对存储、数据库、大数据等业务的专属插件库(Tools/Skills),以“绿叶”精神赋能兄弟团队快速接入。