京东AI infra/Agent 研发工程师
任职要求
1. 具备AI基础设施整体架构设计能力,能够设计支撑多场景、可扩展的智能化系统并推动技术方案执行; 2. 拥有Agent框架与工具链开发经验,熟悉智能化任务编排与自主决策系统构建,能持续优化系统运行效率; 3. 具备系统性思维与前瞻性…
工作职责
1. 设计国际AI基础设施整体架构,支撑多场景AI能力沉淀与扩展; 2. 构建Agent核心框架与配套工具链,支持智能化任务编排与自主决策迭代; 3. 建立AI工程化开发规范与技术落地机制,统一团队技术标准与协作流程; 4. 搭建基础设施性能监控与优化体系,持续提升系统稳定性与运行效率; 5. 总结AI Infra建设经验,形成可复用技术文档并指导团队新人上手。
【构建大规模并发沙箱平台】 在 Agentic AI 时代,模型的迭代不仅仅依赖GPU算力的轰隆运行,也依赖海量、异构、瞬时爆发的沙箱(Sandbox)运行。我们的目标是:致力于构建超大规模的 Agent Sandbox 算力平台,支撑高并发沙箱请求。你将通过极致的底层性能调优、创新的资源调度策略以及高性能的沙箱控制平面,为 AI 模型提供“秒级拉起、丝滑交互、无限扩展”的 AaaS(Agent as a Service)底座。 【工作职责】 1. 极速调度与高并发管控: (1)构建高可用的分布式管控中心,支撑海量 Agent 任务的瞬间涌浪与规模化并发提交。 (2)设计并实现极速的 Sandbox 创建与休眠唤醒,为用户提供安全、高效、经济的沙箱环境。 (3)重构面向 Agent 场景的镜像分发体系,实现运行环境的“瞬间就绪”及高频数据读写的高效支撑。
【构建支撑 AI 自主进化的虚拟环境】 当大模型(LLM)进化为智能体(Agent),它们不再仅限于文本交互,而是开始真正在浏览器网页/电脑桌面和终端命令行中执行复杂任务。我们的目标是:构建一套全端覆盖、极速启动、深度可观测的 Agent 虚拟执行沙箱。无论是轻量级的 Web 交互,还是复杂的Windows真实系统仿真,我们致力于为 Agent 提供安全、高效的运行环境。加入我们,定义下一代 AI Agent 的基础设施,支撑模型的自我迭代进化! 【工作职责】 1、Agent 沙箱环境矩阵构建: (1)打造毫秒级启动的轻量化 Web 沙箱,构建完备的 ContainerUse 环境支持体系。 (2)突破 OS 层虚拟化瓶颈,构建支持全功能桌面的沙箱,支撑基于复杂人机交互(GUI)的评测需求。 2、统一沙箱管理引擎研发: (1)设计实现端侧管控服务的极致轻量化与高并发承载能力。
1. 技术战略与架构演进(Technical Vision & Architecture) * 顶层架构设计: 主导企业级AI Agent平台的整体技术蓝图规划,设计支持高并发、低延迟、高可靠的分布式Agent运行时架构。 * 前沿技术攻坚: 深入探索并落地Multi-Agent协作机制、长短期记忆管理(Memory Management)、复杂任务自动规划(Planning & Reasoning)及MCP&Skills等前沿技术,解决Agent在复杂场景下的幻觉、状态一致性及执行可靠性难题。 * 技术演进路线: 制定平台未来1-3年的技术演进路线图,平衡技术创新与系统稳定性,确保架构具备极强的扩展性与兼容性。 2. 商业落地与场景赋能(Business Impact & 2B Delivery) * 2B场景规模化落地: 深入理解金融、政务、制造等2B核心客户的业务痛点,主导Agent平台在复杂企业场景下的解决方案设计与交付,确保技术指标转化为可量化的商业价值(如效率提升率、成本降低率)。 * 生态建设与标准化: 构建开放的Agent插件生态与工具链标准,推动平台能力产品化,支持客户通过低代码/零代码方式自定义Agent工作流,加速行业解决方案的复制与推广。 * 关键项目兜底: 作为技术负责人(Owner),直接对重大标杆项目的成功交付负责,解决跨部门、跨系统的复杂集成难题。 3. 工程底座与技术体系建设(Engineering Excellence) * 夯实工程基石: 建立完善的Agent全生命周期管理体系(开发、调试、评估、部署、监控),打造业界领先的Agent Ops平台,显著提升研发效能与系统稳定性(SLA 99.99%+)。 * 安全与合规体系: 构建企业级的AI安全围栏,包括提示词注入防御、敏感数据脱敏、Agent行为审计及合规性检测,确保平台符合数据安全法规。 4. 梯队建设与文化塑造(Leadership & Talent Development) * 技术前瞻与创新: 保持对全球AI技术趋势的敏锐洞察,引入学术界最新成果(如ReAct, ToT, GraphRAG等)并在内部进行技术预研与转化。 * 高端人才培养: 负责组建并培养一支高水平的AI工程团队,建立清晰的人才成长路径与晋升机制,通过技术分享、黑客松等形式营造浓厚的创新氛围。 * 跨团队协同: 打破算法、工程、产品之间的壁垒,建立高效的协同机制,推动“算法模型”向“工程产品”的高效转化。
1. 负责百亿至万亿参数规模稠密、稀疏模型的训练与推理 Infra 建设,支撑千卡集群上的高效、稳定运行 2. 优化数据并行、模型并行、专家并行及异构计算体系,解决通信、显存、调度和训推性能瓶颈,提升 GPU 利用率与系统吞吐 3. 负责 LLM RL、Agentic RL Infra 的设计与研发,支撑 PPO、GRPO 等算法及大规模、多智能体、长链路 Agent 训练 4. 建设高性能 RL 训推系统,优化异步训推、Partial Rollout、分布式 Replay Buffer、样本流转、模型同步与资源调度 5. 跟进并落地强化学习、分布式训练和大模型推理领域的前沿技术,包括 VERL、rLLM、Agent Lightning、Ray、Megatron-LM 等,持续提升训练平台的性能、稳定性和技术领先性