腾讯智能体-强化学习算法研究员-CodeBuddy/WorkBuddy
任职要求
1.自然语言处理/机器学习/模式识别/人工智能/计算机等相关专业硕士以上学历; 2.有5年以上的工程编码经验,熟练掌握 Python,C/C++,Golang,Java,JavaScript,TypeScript 等至少一种语言; 3.掌握深度学习基础知识,能根据具体问题做针对性优化,熟悉深度学习中不同任务及相应的主流模型和算…
工作职责
1.作为研究者,探索有效的 Agentic Workflow 和 Agentic Memory 设计来解决代码领域的问题; 2.主要关注比SFT泛化效果更好的强化学习;能结合实际用户需求、产生的用户数据、agent的实现细节,调整训练语料和训练目标; 3.能和agent开发高效沟通,设计memory存取逻辑,并且通过模型训练让模型适配自己设计的agent; 4.作为工程师,考虑到 LLM inference 对推理算力的高消耗,设计出合理的前后端交互,前端架构,后端架构,在有限的推理算力下,做出完整的 Agentic Workflow 解决方案。最好是探索一套通用可扩展的 Agentic Workflow 解决方案; 5.备注:base地可选深圳/北京/上海。
1.负责构建智能仓储、物流、制造业垂直领域的数据驱动仿真引擎(World Model):利用海量IoT数据、AGV运行轨迹数据、边缘PDA交互数据,训练高保真的时序预测模型。 2.开展基于大模型及代理式AI驱动提效的强化学习:搭建分布式RL框架,驱动全局调度Agent与边缘端交互Agent进行百万次并发训练与策略寻优。 3.解决人机协同场景的建模难题:量化并模拟一线作业员(通过PDA)的随机性与干预,纳入智能体训练闭环。 4.主导Sim-to-Real(虚实迁移)架构设计,确保虚拟策略安全落地至真实仓储与产线系统中。
1、研究与算法实现: (1)参与图数据库代码知识图谱的构建与优化,借鉴最新的 RepoAudit 等研究成果。 (2)设计并实现基于强化学习(RL)的探索与反馈循环,包括智能体、动作空间、奖励机制。 (3)实验和优化多种RL策略(如PPO、DPO、GRPO、DAPO、GSPO)在真实图数据库测试场景的应用。 2、系统开发与实验: (1)构建可编译运行的图数据库测试平台,负责自动化测试流程(提出预言机→生成用例→执行验证→反馈奖励)的实现。 (2)针对开源图数据库(NeuG、Neo4j、RedisGraph、NebulaGraph等),验证并提交新型逻辑错误。 3、论文与成果输出: (1)参与撰写技术报告和学术论文,总结测试预言机生成的新方法与实验结果。 (2)协助开源端到端研究原型及技术文档的完善与维护。
面向Agentic智能体大规模后训练、环境仿真瓶颈、高质量评测等核心挑战,本课题聚焦下一代大规模智能体强化学习基础设施建设,基于阿里ROCK平台与ROLL框架,突破万级并发仿真、标准化评测、海量数据自动化生产的技术瓶颈,为智能体持续自进化提供可扩展的训练底座。 1. 研究高弹性、低开销的大规模环境调度机制,突破万级智能体仿真实例并行运行的技术瓶颈,攻克异构算力高效协同与资源弹性伸缩等核心问题,支撑超大规模群体智能训练。 2. 研究多场景、全覆盖的标准化智能体Benchmark评测体系,构建统一的能力度量与算法迭代验证底座,解决当前智能体能力缺乏统一评测标准的行业难题。 3. 研究大规模智能体交互数据自动化生产全链路技术,实现海量高质量训练数据高效量产,满足大模型智能体长周期强化学习迭代需求。 4. 探索智能体驱动的大模型持续自进化框架,结合强化学习优化训练效率,增强大模型在对齐、推理、代码、数学等维度的能力,并将成果发表于顶级学术会议与回馈开源社区。
1. 基座增强:探索大模型垂直领域知识高效增强方法,包括数据策略、训练策略以及scaling law友好的训练方法,打造适配实际应用所需的基座能力; 2. 多模态端到端:实现语音与文本模态的深度融合与统一建模,打造高效、轻量的端到端多模态系统,从而有助于更全面、多维度地理解语音与文本,提供更强的智能以及更智能的交互模式; 3. 深度推理:突破大模型在复杂逻辑推理、因果推断、多步决策、沟通技巧等大模型基础通用能力,提升模型解决开放式问题的能力; 4. 结合大模型,研发对话交互场景的大模型Agent,支持智能客服、销售、数据分析、C端助理等项目,通过预训练、微调、强化学习等全链路的技术实践,实现类人的理解和执行能力,提升美团服务能力和效率; 5. 不断探索技术新领域,推动技术能力的沉淀和技术氛围的建设。