米哈游LLM网关SRE工程师
任职要求
1. 5 年以上运维/SRE 经验,其中 2 年以上 LLM/AI 推理服务/大模型平台生产运维经验; 2. 深度熟悉 LLM 服务线上运维(流式、限流、Token 计量、模型路由、多模型调度等); 3. 熟悉 Kubernetes、Prometheus/Grafana,有 LLM 监控指标设计与告警治理经验; 4. 熟悉 vLLM、Triton、SGLang 等推理引擎部署运维及常见故障处理; 5. 熟悉 CI/CD 与灰度发布,了解 GPU/NPU 推理资源特…
工作职责
1. 负责 LLM 网关及推理服务监控告警、日志链路追踪建设,覆盖 TTFT/TPOT/流式成功率、上游错误码、Token 用量等核心指标,优化 LLM 场景告警策略; 2. 负责 LLM 网关与推理服务版本发布、CI/CD 运维,制定模型路由、回退策略、限流与超时等配置变更的灰度与回滚规范,保障发布平稳; 3. 负责网关依赖组件(缓存、元数据存储等)与推理集群稳定性运维,排查流式中断、限流打满、上游超时/过载、OOM、排队超时等问题,参与 GPU/NPU 容量治理与高可用保障; 4. 制定并落地 LLM 服务 SLO/SLI 体系,参与 P0/P1 故障响应复盘,沉淀 Runbook 与运维规范;负责限流/降级/路由切换相关配置变更、应急处置与效果验证。
1. Agent方向:直接参与到导购Agent的算法研发工作,包含无障碍导购Agent、搜索导购Agent两个Agent项目并结合技术创新与实际业务落地,产出高质量论文、专利与开源成果。包括相关项目的高质量数据构建,支撑复杂任务建模与行为学习,运用大模型SFT、RL等Post-training训练方法并探索 Online RL 等前沿方法,设计并落地“过程监督 + 结果监督”联合训练范式,融合MCTS、ToT、Reflection等推理方法,等等; 2. LLM应用方向:探索基于LLM的Query理解大模型,通过天猫的数据微调大模型生成ID表征向量,在搜索和推荐算法各模块进行深度的探索和应用。包括但不限于语义相关性、类目预测、召回排序等。探索生成式搜索技术(如Query扩展、结果摘要生成),助力搜索从“信息呈现”向“决策辅助”升级; 3. 结合业务需求,设计和扩展LLM的应用场景范围及规模,提高模型微调后再垂直领域的应用及专家模式的架构尝试; 4. 跟踪LLM与Agent领域的国际前沿技术动态,开展前沿算法的研究工作,推动技术创新在业务场景中的落地应用,重点突破复杂推理、GUI Agent、AI搜索等方向的技术沉淀和业务创新。
我们正在寻找优秀的研究科学家和工程师,共同推进下一代 LLM 与 Multimodal Agent 系统 的关键技术研发。 该岗位聚焦于大模型后训练(Post-training)与Agent能力训练的前沿研究,致力于让基础模型具备 DeepResearch、Tool Use、Coding 以及复杂多步骤推理(long-horizon reasoning) 等能力。你将与一流的研究人员和工程团队合作,探索并实现包括 Agentic SFT、Agentic CPT、Reasoning RL、Agentic RL、RLHF 在内的新一代后训练方法,推动 AI 系统在复杂真实任务中的能力边界。 1、研究并开发 LLM 与 Multimodal 模型的 Post-training 方法,重点提升 Agent 能力与复杂推理能力; 2、设计与实现 Agentic SFT、Agentic CPT、Reasoning RL、Agentic RL等训练方法; 3、构建大规模 Agent training data,涵盖 DeepResearch、Tool Use、Coding等复杂任务; 4、设计并实现 Agent evaluation framework,评估模型在复杂任务执行与工具使用场景中的能力; 5、与模型训练、数据工程和系统团队协作,将研究成果应用到 真实 AI 系统与产品场景中; 6、推动前沿研究成果,通过技术分享、开源项目或学术论文等方式贡献于 AI 社区。
我们正在寻找优秀的研究科学家和工程师,共同推进下一代 LLM 与 Multimodal Agent 系统 的关键技术研发。 该岗位聚焦于大模型后训练(Post-training)与Agent能力训练的前沿研究,致力于让基础模型具备 DeepResearch、Tool Use、Coding 以及复杂多步骤推理(long-horizon reasoning) 等能力。你将与一流的研究人员和工程团队合作,探索并实现包括 Agentic SFT、Agentic CPT、Reasoning RL、Agentic RL、RLHF 在内的新一代后训练方法,推动 AI 系统在复杂真实任务中的能力边界。 1、研究并开发 LLM 与 Multimodal 模型的 Post-training 方法,重点提升 Agent 能力与复杂推理能力; 2、设计与实现 Agentic SFT、Agentic CPT、Reasoning RL、Agentic RL等训练方法; 3、构建大规模 Agent training data,涵盖 DeepResearch、Tool Use、Coding等复杂任务; 4、设计并实现 Agent evaluation framework,评估模型在复杂任务执行与工具使用场景中的能力; 5、与模型训练、数据工程和系统团队协作,将研究成果应用到 真实 AI 系统与产品场景 中; 6、推动前沿研究成果,通过技术分享、开源项目或学术论文等方式贡献于 AI 社区。