logo of alibaba

阿里巴巴面向云原生的因果世界模型与自主运维智能体-阿里星

实习兼职阿里巴巴2027届实习生地点:北京 | 杭州状态:招聘

任职要求


1. 专业背景扎实,计算机、人工智能、软件工程、模式识别、统计学等相关专业;
2. 具备扎实的算法功底,熟练掌握机器学习/深度学习算法基础,在顶级会议/期刊发表过相关论文;
3. 掌握 LLM 技术能力,熟悉 LLM 主流算法原理,在 Fine-tuning、Prompt Engineering、RAG、Agentic 应用开发等一个或多个方向有实践经验;
4. 对 AI 有极客般的探索与实战精神:对大模型、AI Agent 技术有浓厚兴趣,能熟练使用 AI 编程工具,有过大模型微调,或 A…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


负责阿里云可观测平台核心算法与智能引擎建设,沉淀深厚的运维领域知识与经验。加入该岗位,您将基于大模型技术,构建下一代 AIOps 产品核心竞争力,打造面向未来的智能运维基础设施。
1. 研发可观测核心算子,负责设计与研发面向海量可观测数据的核心算法算子,实现对海量原始数据的高效预处理与特征提取,为上层智能应用提供高质量输入;
2. 参与 AIOps Agent 设计与研发,负责 LLM 驱动的 AIOps Agent 的核心算法研发。通过多 Agent 架构解决复杂场景下的根因定位、影响评估、智能巡检、辅助运维等难题;
3. 构建并应用 AIOps Benchmark 体系,设计和落地具有业界影响力的 AIOps Benchmark 评测体系。通过系统化的故障注入与案例复盘,构建覆盖广泛、高度真实的评测数据集,用于度量和持续优化 AIOps 系统的泛化能力;
4. 探索前沿模型训练与优化技术,运用监督微调(SFT)、强化学习(RLHF)等前沿技术,针对 AIOps 中的关键过程进行模型优化和迭代,持续提升 AIOps 的准确性和性能;
5. 追踪前沿并推动技术落地,持续追踪和研究 LLM、Agent、知识图谱、图神经网络、因果推理等技术在 AIOps 领域的最新进展,结合阿里云可观测产品的实际场景,探索和推动前沿技术的应用与落地,构建技术壁垒。
包括英文材料
模式识别+
算法+
机器学习+
深度学习+
大模型+
Prompt+
RAG+
还有更多 •••
相关职位

logo of bytedance
校招A09518

团队介绍:字节跳动基础设施计算团队,专注构建面向大模型与 AI Agent 时代的 AI-Native Infra。我们从算力、系统到平台,围绕“AI 如何高效运行、持续进化、规模化落地”这一核心问题,重构计算基础设施。我们管理着数十万台服务器组成的超大规模集群,构建统一的异构算力调度与云原生运行体系;通过软硬协同与自研框架,持续突破大模型训练与推理的性能瓶颈;并进一步向上,打造企业级 AI Agent Infra,让 Agent 具备身份、权限、记忆、观测与治理能力,真正成为可运行在生产环境中的新型“应用形态”。 从云服务器、容器、函数,到 AI 网关、可观测与弹性体系,我们构建的是一个为 AI 而生、由 AI 驱动进化的基础设施平台,支撑集团核心业务与企业级客户的智能化升级。 如果你希望参与定义 AI 时代的 Infra 范式,而不仅是优化一个模块或服务——欢迎加入我们,一起构建下一代 AI 云原生基础设施。 课题介绍: 随着大语言模型与AI Agent规模化落地,传统云原生基础设施已难以适配AI负载的极致性能与弹性需求。本课题围绕AI基础设施全栈展开系统性研究: 1、网络与可观测:研究大规模AI集群故障智能定位与根因分析,结合时序数据库智能调优,提升集群稳定性; 2、存储系统:研发AI场景专属的Serverless高性能弹性文件系统与存储加速架构,探索DPU软硬件协同优化,突破AI存储性能瓶颈; 3、算力调度:研究GPU/CPU/MEM异构协同调度技术,面向AI Agent构建Serverless异构算力编排系统,解决负载异构、状态依赖等调度难题; 4、向量检索:优化面向大模型应用的向量检索核心技术,打造云原生分布式向量索引引擎,满足超大规模向量检索的低延迟、低成本需求; 5、智能化与Agent架构:探索基于AI Agent工作流的基础设施自动寻优,构建可自主进化的业务Agent框架,通过AI for Infra赋能全栈智能优化; 本课题旨在构建支撑大模型与AI Agent落地的下一代AI原生基础设施,提升资源利用率、降低成本、支撑弹性扩展,推动AI基础设施技术演进。 课题挑战: 1、全栈协同挑战:覆盖多技术领域,需要从端到端视角实现系统性优化,避免单点优化收益不足; 2、性能成本平衡:AI场景对性能提出极致要求,需要在吞吐、延迟、规模与成本之间找到最优平衡点; 3、云原生适配:需要将传统单机技术方案重构为适配云原生分布式架构,解决扩缩容、容错、调度等新问题; 4、AI系统融合:既需要用AI赋能基础设施优化,又需要基础设施原生适配AI负载,深度融合对技术整合要求高; 5、Agent稳定性:自主进化Agent框架需要解决经验学习、知识一致性、持续安全进化等基础问题,工程化难度大; 6、研发生态平衡:需要平衡前沿理论创新与工程落地,兼顾技术突破与现有业务生态适配。 课题价值: 1、构建大模型/RAG 场景的高性能基础设施底座,支撑大规模向量数据高效检索; 2、优化AI业务存储成本结构与运维复杂度; 3、提升异构算力资源配置效率与技术复用性。

更新于 2026-04-15上海
logo of bytedance
校招A13728A

团队介绍:字节跳动基础设施基础技术团队负责公司统一的基础软件,编译器&语言,DPU,大规模池化存储以及云原生计算集群,AI for Infra,Infra for AI 等相关领域,覆盖了在线存储、实时、离线、机器学习、软硬一体、AIOps 等多种应用场景,支持公司内外广泛的场景和需求。 课题介绍: 随着大语言模型与AI Agent规模化落地,传统云原生基础设施已难以适配AI负载的极致性能与弹性需求。本课题围绕AI基础设施全栈展开系统性研究: 1、网络与可观测:研究大规模AI集群故障智能定位与根因分析,结合时序数据库智能调优,提升集群稳定性; 2、存储系统:研发AI场景专属的serverless高性能弹性文件系统与存储加速架构,探索DPU软硬件协同优化,突破AI存储性能瓶颈; 3、算力调度:研究GPU/CPU/MEM异构协同调度技术,面向AI Agent构建Serverless异构算力编排系统,解决负载异构、状态依赖等调度难题; 4、向量检索:优化面向大模型应用的向量检索核心技术,打造云原生分布式向量索引引擎,满足超大规模向量检索的低延迟、低成本需求; 5、智能化与Agent架构:探索基于AI Agent工作流的基础设施自动寻优,构建可自主进化的业务Agent框架,通过AI for Infra赋能全栈智能优化。 本课题旨在构建支撑大模型与AI Agent落地的下一代AI原生基础设施,提升资源利用率、降低成本、支撑弹性扩展,推动AI基础设施技术演进。 课题挑战: 1、全栈协同挑战:覆盖多技术领域,需要从端到端视角实现系统性优化,避免单点优化收益不足; 2、性能成本平衡:AI场景对性能提出极致要求,需要在吞吐、延迟、规模与成本之间找到最优平衡点; 3、云原生适配:需要将传统单机技术方案重构为适配云原生分布式架构,解决扩缩容、容错、调度等新问题; 4、AI系统融合:既需要用AI赋能基础设施优化,又需要基础设施原生适配AI负载,深度融合对技术整合要求高; 5、Agent稳定性:自主进化Agent框架需要解决经验学习、知识一致性、持续安全进化等基础问题,工程化难度大; 6、研发生态平衡:需要平衡前沿理论创新与工程落地,兼顾技术突破与现有业务生态适配。 课题价值: 1、构建大模型 / RAG 场景的高性能基础设施底座,支撑大规模向量数据高效检索; 2、优化 AI 业务存储成本结构与运维复杂度; 3、提升异构算力资源配置效率与技术复用性。

更新于 2026-04-15北京
logo of bytedance
实习A52265

团队介绍:字节跳动基础设施计算团队,专注构建面向大模型与 AI Agent 时代的 AI-Native Infra。我们从算力、系统到平台,围绕“AI 如何高效运行、持续进化、规模化落地”这一核心问题,重构计算基础设施。我们管理着数十万台服务器组成的超大规模集群,构建统一的异构算力调度与云原生运行体系;通过软硬协同与自研框架,持续突破大模型训练与推理的性能瓶颈;并进一步向上,打造企业级 AI Agent Infra,让 Agent 具备身份、权限、记忆、观测与治理能力,真正成为可运行在生产环境中的新型“应用形态”。 从云服务器、容器、函数,到 AI 网关、可观测与弹性体系,我们构建的是一个为 AI 而生、由 AI 驱动进化的基础设施平台,支撑集团核心业务与企业级客户的智能化升级。 如果你希望参与定义 AI 时代的 Infra 范式,而不仅是优化一个模块或服务——欢迎加入我们,一起构建下一代 AI 云原生基础设施。 课题介绍: 随着大语言模型与AI Agent规模化落地,传统云原生基础设施已难以适配AI负载的极致性能与弹性需求。本课题围绕AI基础设施全栈展开系统性研究: 1、网络与可观测:研究大规模AI集群故障智能定位与根因分析,结合时序数据库智能调优,提升集群稳定性; 2、存储系统:研发AI场景专属的Serverless高性能弹性文件系统与存储加速架构,探索DPU软硬件协同优化,突破AI存储性能瓶颈; 3、算力调度:研究GPU/CPU/MEM异构协同调度技术,面向AI Agent构建Serverless异构算力编排系统,解决负载异构、状态依赖等调度难题; 4、向量检索:优化面向大模型应用的向量检索核心技术,打造云原生分布式向量索引引擎,满足超大规模向量检索的低延迟、低成本需求; 5、智能化与Agent架构:探索基于AI Agent工作流的基础设施自动寻优,构建可自主进化的业务Agent框架,通过AI for Infra赋能全栈智能优化; 本课题旨在构建支撑大模型与AI Agent落地的下一代AI原生基础设施,提升资源利用率、降低成本、支撑弹性扩展,推动AI基础设施技术演进。 课题挑战: 1、全栈协同挑战:覆盖多技术领域,需要从端到端视角实现系统性优化,避免单点优化收益不足; 2、性能成本平衡:AI场景对性能提出极致要求,需要在吞吐、延迟、规模与成本之间找到最优平衡点; 3、云原生适配:需要将传统单机技术方案重构为适配云原生分布式架构,解决扩缩容、容错、调度等新问题; 4、AI系统融合:既需要用AI赋能基础设施优化,又需要基础设施原生适配AI负载,深度融合对技术整合要求高; 5、Agent稳定性:自主进化Agent框架需要解决经验学习、知识一致性、持续安全进化等基础问题,工程化难度大; 6、研发生态平衡:需要平衡前沿理论创新与工程落地,兼顾技术突破与现有业务生态适配。 课题价值: 1、构建大模型/RAG 场景的高性能基础设施底座,支撑大规模向量数据高效检索; 2、优化AI业务存储成本结构与运维复杂度; 3、提升异构算力资源配置效率与技术复用性。

更新于 2026-04-15上海
logo of alibaba
实习阿里巴巴研究型实

我们致力于优化云计算场景下的弹性计算服务(ECS)资源调度系统,通过算法创新解决动态资源分配、集群资源优化等核心问题。本岗位将深度参与资源调度算法的设计与实现,推动资源装箱效率提升、性能争用降低等关键技术突破,最终实现资源供给成本优化与整体资源利用率的显著提升。具体职责包括: 1. 研究并设计面向云计算场景的资源调度算法,解决海量算力需求下的资源分配效率问题; 2. 结合服务等级协议(SLA)要求,优化调度系统在成本、稳定性、性能等多目标约束下的决策机制; 3. 分析集群资源使用数据,建设资源画像,提出并实施资源利用率提升方案; 4. 实现算法原型,推动算法在实际生产环境中的落地与迭代; 5. 跟踪前沿技术动态,探索机器学习、强化学习等技术在资源调度领域的创新应用。

更新于 2026-03-17北京|杭州