logo of sensetime

商汤Agent Benchmark Research Intern

实习兼职测试地点:深圳状态:招聘

任职要求


职位要求
1、计算机、人工智能、软件工程、数学等相关专业本科及以上学历,具有扎实的数据结构算法及系统基础。
2、具备良好的Python开发能力,熟悉Linux开发环境,具有较强工程实现能力,能够独立完成功能开发或系统搭建。
3、熟悉大语言模型基本原理,了解Agent、Reasoning、Tool Calling、Benchmark、RL/Post-training等相关方向,对模型能力分析具有浓厚兴趣。
4、具备良好的科研阅读能力,能够阅读并理解英文论文,关注OpenAI、Anthropic、Google DeepMind等前沿技术发展。
5、具备优秀的问题分析能力和学习能力,能够快速理解复杂系统,从模型能力、数据、评测等多个角度定位问…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1、Benchmark研究与构建:负责Agent及大模型能力评测体系建设,围绕代码、复杂推理、长程任务、多Agent协作等方向设计Benchmark,持续提升评测覆盖度与区分度。
2、评测框架研发:参与评测平台与工程体系建设,包括Sandbox环境、任务调度、Judge设计、Trace采集、自动化评测Pipeline等,推动评测流程标准化、自动化。
3、模型能力分析:结合Benchmark结果开展模型能力分析与Badcase挖掘,定位能力瓶颈,形成可指导训练优化的数据分析报告,推动模型能力持续迭代。
4、数据与评测闭环:参与高质量评测数据集建设,包括任务设计、数据构造、评测标准制定、失败样本回流等工作,持续完善模型训练与评测闭环。
5、学术研究:持续跟踪国内外Agent、Reasoning、Evaluation等前沿工作,探索更科学、更稳定、更细粒度的大模型评测方法。
包括英文材料
学历+
数据结构+
算法+
Python+
Linux+
还有更多 •••
相关职位

logo of dingtalk
实习钉钉日常项目实习

职位描述 1、用户数据分析与产品优化:深入分析用户对 Agent 的使用情况,包括但不限于用户行为路径、功能使用频率等数据指标,完成用户需求满足度分析,识别用户痛点和未被满足的需求,提出并推动 Agent 供给补充或优化建议; 2、用户反馈分析和体验设计:收集、整理和分析用户反馈,发现产品问题并提出解决方案。通过用户调研、可用性测试等方式,深入了解用户需求和使用习惯,参与用户体验设计; 3、竞品分析与市场洞察:对标和分析 ChatGPT 等通用大模型产品、以及市面上其他通用 Agent 产品。从功能、体验、技术、商业模式等多个维度进行深入竞品分析,洞察市场趋势和产品发展方向。

更新于 2026-06-16北京|杭州|上海
logo of xiaohongshu
社招3-5年大模型

你将加入创新业务核心算法团队,围绕创新业务场景,利用 LLM、RAG、Tool Use、Multi-Agent 等前沿技术,打造真正理解用户需求、具备规划与执行能力的新一代 AI Native 产品。 岗位职责 1、负责通用 Agent 框架的设计与研发,包括意图识别(Router)、任务规划(Planning)、工具调用(Function Calling)、检索增强生成(RAG)、状态管理(Memory)等核心能力,构建可支撑复杂任务执行的智能体系统。 2、深入创新业务核心场景,设计垂类 Agent,打通用户状态、结构化信息、环境信息、知识库等多源信息,提升用户从“提出需求”到“获得可执行方案”的效率与体验。 3、基于开源或自研基座模型,利用 SFT、RL 等技术进行垂直场景微调,增强模型在复杂指令遵循、规划推理、工具使用、个性化表达与安全性上的能力。 4、面向长链路、复杂任务场景,探索并落地 Multi-Agent 协作机制,提升系统任务完成率、稳定性与可解释性。 5、建设 Agent 自动化评测平台,制定覆盖任务完成度、相关性、可执行性、工具调用准确率与安全性的多维指标,通过离线评测与在线 A/B 实验持续驱动效果优化。

更新于 2026-06-17北京|上海|杭州
logo of xiaohongshu
社招3-5年内容理解

1. 基于VLM/Agent等 AI 能力,融合图文/视频笔记的文本、图像、视频、音频等多维度信号,覆盖笔记、评论、账号、交易、直播等多体裁场景的国际化内容风险识别与处置,持续提升主动召回能力,实现风险、体验、效率的协同优化。 2. 建立并持续演进 Rednote 的内容特征体系与内容分级系统,输出结果应用于治理中的处置判罚、以及搜推流控等核心链路,为 Rednote 全球生态的内容质量与安全构建长期竞争壁垒。 3. 负责面向 Rednote 治理、内容理解、编辑等核心场景的 Agent 系统端到端研发,涵盖 ReAct / Tool Use / Multi-Agent 架构、意图理解与任务规划;深度参与 Agent 效果优化——从工具设计、上下文管理、编排策略到 Agentic RL 的 Post-Training,产出效果领先的 产品。 4. 深度参与LLM/VLM 的预训练、SFT、RL 等全链路训练,参与构建多模态内容理解、编辑、生成等 AI 基础能力,推动 AI 从技术到业务价值的闭环落地。 5. 持续追踪AI Agent领域的最新进展,引入并验证新技术的可行性,沉淀技术文档与最佳实践,推动前沿技术在rednote业务中的应用,保持团队的技术领先性;,沉淀国际顶会论文(CVPR/NeurIPS/ICLR/ACL 等)

更新于 2026-06-25北京|上海|杭州
logo of mihoyo
社招2年以上程序&技术类

1)Agent 能力研发:面向 AI Native 游戏场景,负责智能体(Agent)核心能力研发与优化,覆盖智能 AI NPC、AI 叙事、AI 玩法等方向,构建具备多轮对话、任务规划、工具调用、环境交互、长期记忆与自主决策能力的 Agent 系统 2)Agent 架构设计:设计并实现游戏场景下的 Agent 核心架构,包括 Planning、Memory、Tool Use、Action、Reflection、Persona、State Tracking 等模块,提升智能体在复杂动态环境中的稳定性、一致性与可控性 3)训练与对齐优化:结合业务需求,参与 Agent 相关模型与策略优化,包括 SFT、DPO、RLHF/RLAIF、PPO/GRPO 等方法,提升智能体在角色一致性、任务完成率、对话连贯性、行为合理性和安全性等维度的表现 4)记忆与数据体系建设:构建适用于游戏场景的 Agent Memory 与数据闭环体系,支持 NPC 对玩家历史行为、剧情进展、任务状态、角色关系和世界知识的长期记忆与高效调用,并持续优化训练数据与交互数据质量 5)工具调用与环境交互:建设 Agent 的工具与动作能力,使其能够可靠调用游戏内外部系统能力,如任务系统、剧情系统、检索系统、脚本/代码执行、UI/Browser 自动化等,提升 Agent 在真实业务场景中的执行能力 6)评测体系与系统优化:建立面向 Agent 的评测体系,围绕任务完成、角色设定一致性、叙事合理性、工具调用成功率、长期记忆效果、安全性等维度设计 Eval、自动化测试与分析机制,推动模型与系统持续迭代 7)多 Agent 与前沿探索:探索 Multi-Agent、GUI Agent、Browser Agent、World Model、MCP 等前沿方向在游戏中的应用,与产品、策划、工程团队协同推进 Agent 能力的落地与创新

上海|北京