深度求索Agent Infra 研发工程师
任职要求
基本背景: 1.计算机或其他相关专业,本科及以上学历。 2.扎实的系统编程能力(倾向 Rust / C / Python),以及对简洁明了、可维护代码的基本美学素养。 3.对底层机制有着深厚的好奇心,同时热衷于搞懂事物的基本运行原理。 4.有良好的中文沟通能力和团队协作能力。 满足下列任意一条即可: 1.深入了解计算机体系结构,能够清晰描述一次文件写入从调用开始到落盘的全过程以及潜在瓶颈。 2.深入了解大规模分布式系统的组织方式,清楚架构瓶颈产生的原因和与之相关的 trade-off。 3.熟练运用压测和可观测性工具分析、定位涉及多个层级的复杂系统问题。 4.理解可靠系统的设计,并且有意识地确保前人的事故不会在当下重演。 5.有过大型系统的自动化运维、应急响应经验。 【加分项】 下面这些每一条都可以加分,但其实没有也没关系: 1.在 OSDI、S…
工作职责
【团队使命】 DSec 是我们为 Agent 量身定制的云平台,托管着成千上万个沙箱环境,正有序推进着下一代模型的迭代。为了增加可靠性和效率,DSec 需要修改整个系统栈:从操作系统到虚拟机,再到各级网络和存储,一直上到应用层调度和管控面服务。 在这里,你需要解决各种规模的系统问题——小到自旋锁,大到跨区域数据一致性——还要加上无监管全自动运行的 Agent 带来的更多安全挑战。这意味着以往对负载模式、数据隔离、资源用量、平台安全的种种假设都可能不复成立,需要另辟蹊径。 【岗位类别】:实习/全职 你可以参与以下的任一方向: 1.虚拟化环境:托管大规模 VM 集群,支持多样的操作系统配置和硬件方案。 2.容器化:加固隔离、缩小逃逸面、降低沙箱资源占用量;适配用户多种多样的需求以支持更高效的模型训练。 3.临时存储:设计专供沙箱的块设备和共享卷方案。 4.虚拟化网络:部署超大规模虚拟网络,允许 Agent 在不离开物理边界的前提下互相通信。 5.云服务:设计混合云架构,开发可观测平台、日志系统、控制面等。 6.可观测性和高可用性:配置监控,设计节点自动上下线流程和应急响应机制;负责平台的稳定运行。
负责 AI Agent Infra 建设,提升 AI Agent 产品创新效率,探索生成式 AI 在数字世界的实际应用。 1. 建设 Agent SWE Infra 工程,提升 Agent 相关代码的个性化构建和发布效率; 2. 建设 Sandbox Infra 工程,为各类 Agentic 场景提供高效、稳定、大规模的模拟器、多工具、图形交互的沙箱环境; 3. 建设 Serving Infra 工程,为生产提供通用的 Agent 服务化框架,优化 LLM 和 Agent 性能,保障高可用运行。
1. 负责 AI Agent 基础平台(Agent Infra)的设计与实现,确保系统稳定、可扩展,支持多种架构的Agent运行。 2. 参与 AI Agent 核心组件与相关产品的研发,支持业务团队进行快速迭代。 3. 与产品、业务团队密切协作,识别Agent场景需求与痛点,并给出技术方案及架构优化建议。 4. 负责 Agent 优化链路与模型评估体系,利用 Context Engineering、SFT、RL 等算法提升 Agent 性能。 5. 跟踪 AI Agent 生态技术发展,评估并引入前沿技术(如 LLM、MCP、A2A 协议),推动平台发展。
1. 操作系统及内核研发:面向 Agent 工作负载的操作系统能力演进,推动内核子系统与上层系统组件的适配与创新,构建 Agent 与 OS 之间的交互接口与运行时基础设施。 2. 安全底座:构建 OS 级的 Agent 安全体系,在供应链安全、运行时安全隔离、OS 级行为审计与访问控制等方向建立纵深防御。 3. 智能化运维:探索 AI 与系统运维深度结合的模式,将操作系统运维知识封装为 Agent 可理解、可执行的能力,推动运维从人工经验驱动向智能化演进。 4. 可观测与效能优化:构建面向 Agent 行为的可观测体系,度量和优化 Agent 运行效能,从 OS 层系统性降低 Agent 运行成本。 5. 工程平台建设:构建面向操作系统研发场景的 Agent 基础设施平台,将各方向的 Agent 能力进行平台化沉淀,支撑 Agent 的规模化开发、运行与迭代。