logo of alibaba

阿里巴巴1688-评测算法工程师-Agentic AI

社招全职2年以上地点:杭州状态:招聘

任职要求


- 计算机科学/AI等相关专业硕士及以上学历,对agentic ai/ LLM技术高度热情;
- 精通Python编程,熟练掌握PyTorch/TensorFlow等深度学习框架;
- 熟悉主流语言大模型技术…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


- 构建并完善大模型评测体系,包括评测标准制定,评测工具链开发和评测数据集建设;
- 基于agentic业务需求设计评测方案,开展多维度模型评估,输出专业评测报告;
- 参与Agent /工具调用 在垂直领域的算法工程化实现及性能评估研究;
- 沉淀业务专家知识到 reward/critic 层面实现LLM-as-judge,沉淀长链数据资产;
包括英文材料
学历+
大模型+
Python+
还有更多 •••
相关职位

logo of autohome
社招3年以上技术

1、负责汽车垂直领域大语言模型(LLM)研发:CPT、指令微调、对齐优化、推理优化等全流程算法设计与实现,攻克模型效率、效果、可控性等关键技术难点,提升模型在汽车知识问答、车型对比、用户交互等场景的理解与生成能力; 2、汽车结合汽车之家业务(如车型库、评测报告、用户社区等),实现大模型驱动的智能产品功能(如AI搜索、智能AI买手、多模态AIGC等); 3、追踪业界前沿技术,结合业务需求特点进行创新,在取得实际产出的同时形成文章发表在相关会议上。

更新于 2025-11-26北京
logo of mi
实习

1. 参与大模型检索增强生成(RAG)技术的研发与优化,包括但不限于: 1.1 文档检索算法(如稠密检索、混合检索)的改进与实现; 1.2 大模型与检索系统的协同优化; 1.3 端侧RAG,agentic RAG等技术路径探索。 2. 构建和评测RAG系统在垂直业务领域的应用效果,设计实验方案并分析结果。 3. 跟进学术界与工业界最新进展,复现论文或开源项目,参与RAG在小米落地应用的相关工作。

更新于 2025-06-09北京
logo of bytedance
社招A166820

团队介绍:飞书是 AI 时代先进生产力平台,提供一站式工作协同、组织管理、业务提效工具和深入企业场景的 AI 能力,助力企业能增长,有巧降。 从互联网、高科技、消费零售,到制造、金融、医疗健康等,各行各业先进企业都在选择飞书,与飞书共创行业最佳实践。先进团队,先用飞书。 课题背景: 飞书沉淀了企业内大量知识(文档、wiki、消息、会议记录、图片、视频等)。随着企业知识图谱、用户行为轨迹等图结构数据规模的指数级增长,传统基于文本匹配的RAG系统面临关系感知缺失和个性化能力不足的矛盾。如何寻找相对开销低、效果好的企业问答RAG新范式,突破现有系统在跨模态意图理解深度、个性化排序精度与实时生成质量上的瓶颈,基于企业内部知识和外部公网知识来回答问题与完成深度创作,这项工作对于字节自身做好企业知识管理,和飞书打造国内领先的企业知识问答创作产品,都有重要意义。 课题挑战: 1、图结构融合挑战:传统RAG系统以文本匹配为核心,难以有效捕获用户行为模式、实体拓扑关系等非结构化图信息。如何将文本、图像、视频等异构图数据嵌入到语义理解框架中,构建统一的特征表示空间,是提升意图识别精度的关键瓶颈; 2、动态推理挑战:企业关系图谱具有实时演化特性,用户行为模式与实体关联强度随时间动态变化。现有静态图嵌入方法难以满足实时问答场景的时效性要求,需要开发增量式图学习算法实现动态知识更新; 3、企业内部知识和外部公网知识的融合:当两种知识之间存在差异或冲突时,如果无法有效融合,会显著降低回答的可靠性和实用性。如何在不同模态间建立准确的语义关联,并有效融合内外部知识,是提升回答可靠性和实用性的关键。虽然业界 Deep Research 实现了基于 Agent 架构的公网知识深度检索与创作,但尚无企业内外部知识融合的成功实践; 4、Agentic RAG 可控性:基于Agent架构来实现企业知识问答创作,依赖LLM进行自主推理和判断,其决策过程存在一定的不可预测性。在某些复杂情况下(召回语料量大且干扰性强、企业内部知识与外部知识冲突),Agent可能做出不符合预期的决策,且难以直接干预和纠正。 我们的优势: 1、飞书企业问答产品已经积累了一定的用户基础,并在快速增长; 2、依托飞书套件,能够建立比较完整的用户与其他飞书内实体的图结构数据,并且已经有过早期实践(Lark Graph); 3、飞书企业问答有完整的评测体系和资源,帮助RAG类探索快速迭代。

更新于 2025-05-28深圳
logo of bytedance
社招A218086

团队介绍:飞书是 AI 时代先进生产力平台,提供一站式工作协同、组织管理、业务提效工具和深入企业场景的 AI 能力,助力企业能增长,有巧降。 从互联网、高科技、消费零售,到制造、金融、医疗健康等,各行各业先进企业都在选择飞书,与飞书共创行业最佳实践。先进团队,先用飞书。 课题背景: 飞书沉淀了企业内大量知识(文档、wiki、消息、会议记录、图片、视频等)。随着企业知识图谱、用户行为轨迹等图结构数据规模的指数级增长,传统基于文本匹配的RAG系统面临关系感知缺失和个性化能力不足的矛盾。如何寻找相对开销低、效果好的企业问答RAG新范式,突破现有系统在跨模态意图理解深度、个性化排序精度与实时生成质量上的瓶颈,基于企业内部知识和外部公网知识来回答问题与完成深度创作,这项工作对于字节自身做好企业知识管理,和飞书打造国内领先的企业知识问答创作产品,都有重要意义。 课题挑战: 1、图结构融合挑战:传统RAG系统以文本匹配为核心,难以有效捕获用户行为模式、实体拓扑关系等非结构化图信息。如何将文本、图像、视频等异构图数据嵌入到语义理解框架中,构建统一的特征表示空间,是提升意图识别精度的关键瓶颈; 2、动态推理挑战:企业关系图谱具有实时演化特性,用户行为模式与实体关联强度随时间动态变化。现有静态图嵌入方法难以满足实时问答场景的时效性要求,需要开发增量式图学习算法实现动态知识更新; 3、企业内部知识和外部公网知识的融合:当两种知识之间存在差异或冲突时,如果无法有效融合,会显著降低回答的可靠性和实用性。如何在不同模态间建立准确的语义关联,并有效融合内外部知识,是提升回答可靠性和实用性的关键。虽然业界 Deep Research 实现了基于 Agent 架构的公网知识深度检索与创作,但尚无企业内外部知识融合的成功实践; 4、Agentic RAG 可控性:基于Agent架构来实现企业知识问答创作,依赖LLM进行自主推理和判断,其决策过程存在一定的不可预测性。在某些复杂情况下(召回语料量大且干扰性强、企业内部知识与外部知识冲突),Agent可能做出不符合预期的决策,且难以直接干预和纠正。 我们的优势: 1、飞书企业问答产品已经积累了一定的用户基础,并在快速增长; 2、依托飞书套件,能够建立比较完整的用户与其他飞书内实体的图结构数据,并且已经有过早期实践(Lark Graph); 3、飞书企业问答有完整的评测体系和资源,帮助RAG类探索快速迭代。

更新于 2025-05-28北京