字节跳动企业知识问答算法工程师-飞书-筋斗云人才计划
任职要求
1、获得博士学位,图论与组合数学、计算机科学、复杂网络分析相关专业优先; 2、扎实的图机器学习理论基础,对RAG、Agent、AI逻辑推理等领域有强烈的好奇心; 3、创新思维突出,并且能从本质出发思考问题,有自主探索解决方案的能力; 4、(加分)精通图数据库(Neo4j/Tigergraph)和分布式图计算框架(GraphX/Plato),具有TB级图数据处理经验。
工作职责
团队介绍:飞书是 AI 时代先进生产力平台,提供一站式工作协同、组织管理、业务提效工具和深入企业场景的 AI 能力,助力企业能增长,有巧降。 从互联网、高科技、消费零售,到制造、金融、医疗健康等,各行各业先进企业都在选择飞书,与飞书共创行业最佳实践。先进团队,先用飞书。 课题背景: 飞书沉淀了企业内大量知识(文档、wiki、消息、会议记录、图片、视频等)。随着企业知识图谱、用户行为轨迹等图结构数据规模的指数级增长,传统基于文本匹配的RAG系统面临关系感知缺失和个性化能力不足的矛盾。如何寻找相对开销低、效果好的企业问答RAG新范式,突破现有系统在跨模态意图理解深度、个性化排序精度与实时生成质量上的瓶颈,基于企业内部知识和外部公网知识来回答问题与完成深度创作,这项工作对于字节自身做好企业知识管理,和飞书打造国内领先的企业知识问答创作产品,都有重要意义。 课题挑战: 1、图结构融合挑战:传统RAG系统以文本匹配为核心,难以有效捕获用户行为模式、实体拓扑关系等非结构化图信息。如何将文本、图像、视频等异构图数据嵌入到语义理解框架中,构建统一的特征表示空间,是提升意图识别精度的关键瓶颈; 2、动态推理挑战:企业关系图谱具有实时演化特性,用户行为模式与实体关联强度随时间动态变化。现有静态图嵌入方法难以满足实时问答场景的时效性要求,需要开发增量式图学习算法实现动态知识更新; 3、企业内部知识和外部公网知识的融合:当两种知识之间存在差异或冲突时,如果无法有效融合,会显著降低回答的可靠性和实用性。如何在不同模态间建立准确的语义关联,并有效融合内外部知识,是提升回答可靠性和实用性的关键。虽然业界 Deep Research 实现了基于 Agent 架构的公网知识深度检索与创作,但尚无企业内外部知识融合的成功实践; 4、Agentic RAG 可控性:基于Agent架构来实现企业知识问答创作,依赖LLM进行自主推理和判断,其决策过程存在一定的不可预测性。在某些复杂情况下(召回语料量大且干扰性强、企业内部知识与外部知识冲突),Agent可能做出不符合预期的决策,且难以直接干预和纠正。 我们的优势: 1、飞书企业问答产品已经积累了一定的用户基础,并在快速增长; 2、依托飞书套件,能够建立比较完整的用户与其他飞书内实体的图结构数据,并且已经有过早期实践(Lark Graph); 3、飞书企业问答有完整的评测体系和资源,帮助RAG类探索快速迭代。
团队介绍:飞书是 AI 时代先进生产力平台,提供一站式工作协同、组织管理、业务提效工具和深入企业场景的 AI 能力,助力企业能增长,有巧降。 从互联网、高科技、消费零售,到制造、金融、医疗健康等,各行各业先进企业都在选择飞书,与飞书共创行业最佳实践。先进团队,先用飞书。 课题背景: 飞书沉淀了企业内大量知识(文档、wiki、消息、会议记录、图片、视频等)。随着企业知识图谱、用户行为轨迹等图结构数据规模的指数级增长,传统基于文本匹配的RAG系统面临关系感知缺失和个性化能力不足的矛盾。如何寻找相对开销低、效果好的企业问答RAG新范式,突破现有系统在跨模态意图理解深度、个性化排序精度与实时生成质量上的瓶颈,基于企业内部知识和外部公网知识来回答问题与完成深度创作,这项工作对于字节自身做好企业知识管理,和飞书打造国内领先的企业知识问答创作产品,都有重要意义。 课题挑战: 1、图结构融合挑战:传统RAG系统以文本匹配为核心,难以有效捕获用户行为模式、实体拓扑关系等非结构化图信息。如何将文本、图像、视频等异构图数据嵌入到语义理解框架中,构建统一的特征表示空间,是提升意图识别精度的关键瓶颈; 2、动态推理挑战:企业关系图谱具有实时演化特性,用户行为模式与实体关联强度随时间动态变化。现有静态图嵌入方法难以满足实时问答场景的时效性要求,需要开发增量式图学习算法实现动态知识更新; 3、企业内部知识和外部公网知识的融合:当两种知识之间存在差异或冲突时,如果无法有效融合,会显著降低回答的可靠性和实用性。如何在不同模态间建立准确的语义关联,并有效融合内外部知识,是提升回答可靠性和实用性的关键。虽然业界 Deep Research 实现了基于 Agent 架构的公网知识深度检索与创作,但尚无企业内外部知识融合的成功实践; 4、Agentic RAG 可控性:基于Agent架构来实现企业知识问答创作,依赖LLM进行自主推理和判断,其决策过程存在一定的不可预测性。在某些复杂情况下(召回语料量大且干扰性强、企业内部知识与外部知识冲突),Agent可能做出不符合预期的决策,且难以直接干预和纠正。 我们的优势: 1、飞书企业问答产品已经积累了一定的用户基础,并在快速增长; 2、依托飞书套件,能够建立比较完整的用户与其他飞书内实体的图结构数据,并且已经有过早期实践(Lark Graph); 3、飞书企业问答有完整的评测体系和资源,帮助RAG类探索快速迭代。
团队介绍:飞书是 AI 时代先进生产力平台,提供一站式工作协同、组织管理、业务提效工具和深入企业场景的 AI 能力,助力企业能增长,有巧降。 从互联网、高科技、消费零售,到制造、金融、医疗健康等,各行各业先进企业都在选择飞书,与飞书共创行业最佳实践。先进团队,先用飞书。 课题背景: 飞书沉淀了企业内大量知识(文档、wiki、消息、会议记录、图片、视频等)。随着企业知识图谱、用户行为轨迹等图结构数据规模的指数级增长,传统基于文本匹配的RAG系统面临关系感知缺失和个性化能力不足的矛盾。如何寻找相对开销低、效果好的企业问答RAG新范式,突破现有系统在跨模态意图理解深度、个性化排序精度与实时生成质量上的瓶颈,基于企业内部知识和外部公网知识来回答问题与完成深度创作,这项工作对于字节自身做好企业知识管理,和飞书打造国内领先的企业知识问答创作产品,都有重要意义。 课题挑战: 1、图结构融合挑战:传统RAG系统以文本匹配为核心,难以有效捕获用户行为模式、实体拓扑关系等非结构化图信息。如何将文本、图像、视频等异构图数据嵌入到语义理解框架中,构建统一的特征表示空间,是提升意图识别精度的关键瓶颈; 2、动态推理挑战:企业关系图谱具有实时演化特性,用户行为模式与实体关联强度随时间动态变化。现有静态图嵌入方法难以满足实时问答场景的时效性要求,需要开发增量式图学习算法实现动态知识更新; 3、企业内部知识和外部公网知识的融合:当两种知识之间存在差异或冲突时,如果无法有效融合,会显著降低回答的可靠性和实用性。如何在不同模态间建立准确的语义关联,并有效融合内外部知识,是提升回答可靠性和实用性的关键。虽然业界 Deep Research 实现了基于 Agent 架构的公网知识深度检索与创作,但尚无企业内外部知识融合的成功实践; 4、Agentic RAG 可控性:基于Agent架构来实现企业知识问答创作,依赖LLM进行自主推理和判断,其决策过程存在一定的不可预测性。在某些复杂情况下(召回语料量大且干扰性强、企业内部知识与外部知识冲突),Agent可能做出不符合预期的决策,且难以直接干预和纠正。 我们的优势: 1、飞书企业问答产品已经积累了一定的用户基础,并在快速增长; 2、依托飞书套件,能够建立比较完整的用户与其他飞书内实体的图结构数据,并且已经有过早期实践(Lark Graph); 3、飞书企业问答有完整的评测体系和资源,帮助RAG类探索快速迭代。
团队介绍:飞书是 AI 时代先进生产力平台,提供一站式工作协同、组织管理、业务提效工具和深入企业场景的 AI 能力,助力企业能增长,有巧降。 从互联网、高科技、消费零售,到制造、金融、医疗健康等,各行各业先进企业都在选择飞书,与飞书共创行业最佳实践。先进团队,先用飞书。 课题背景: 飞书沉淀了企业内大量知识(文档、wiki、消息、会议记录、图片、视频等)。随着企业知识图谱、用户行为轨迹等图结构数据规模的指数级增长,传统基于文本匹配的RAG系统面临关系感知缺失和个性化能力不足的矛盾。如何寻找相对开销低、效果好的企业问答RAG新范式,突破现有系统在跨模态意图理解深度、个性化排序精度与实时生成质量上的瓶颈,基于企业内部知识和外部公网知识来回答问题与完成深度创作,这项工作对于字节自身做好企业知识管理,和飞书打造国内领先的企业知识问答创作产品,都有重要意义。 课题挑战: 1、图结构融合挑战:传统RAG系统以文本匹配为核心,难以有效捕获用户行为模式、实体拓扑关系等非结构化图信息。如何将文本、图像、视频等异构图数据嵌入到语义理解框架中,构建统一的特征表示空间,是提升意图识别精度的关键瓶颈; 2、动态推理挑战:企业关系图谱具有实时演化特性,用户行为模式与实体关联强度随时间动态变化。现有静态图嵌入方法难以满足实时问答场景的时效性要求,需要开发增量式图学习算法实现动态知识更新; 3、企业内部知识和外部公网知识的融合:当两种知识之间存在差异或冲突时,如果无法有效融合,会显著降低回答的可靠性和实用性。如何在不同模态间建立准确的语义关联,并有效融合内外部知识,是提升回答可靠性和实用性的关键。虽然业界 Deep Research 实现了基于 Agent 架构的公网知识深度检索与创作,但尚无企业内外部知识融合的成功实践; 4、Agentic RAG 可控性:基于Agent架构来实现企业知识问答创作,依赖LLM进行自主推理和判断,其决策过程存在一定的不可预测性。在某些复杂情况下(召回语料量大且干扰性强、企业内部知识与外部知识冲突),Agent可能做出不符合预期的决策,且难以直接干预和纠正。 我们的优势: 1、飞书企业问答产品已经积累了一定的用户基础,并在快速增长; 2、依托飞书套件,能够建立比较完整的用户与其他飞书内实体的图结构数据,并且已经有过早期实践(Lark Graph); 3、飞书企业问答有完整的评测体系和资源,帮助RAG类探索快速迭代。
团队介绍:飞书是 AI 时代先进生产力平台,提供一站式工作协同、组织管理、业务提效工具和深入企业场景的 AI 能力,助力企业能增长,有巧降。 从互联网、高科技、消费零售,到制造、金融、医疗健康等,各行各业先进企业都在选择飞书,与飞书共创行业最佳实践。先进团队,先用飞书。 课题背景: 飞书沉淀了企业内大量知识(文档、wiki、消息、会议记录、图片、视频等)。随着企业知识图谱、用户行为轨迹等图结构数据规模的指数级增长,传统基于文本匹配的RAG系统面临关系感知缺失和个性化能力不足的矛盾。如何寻找相对开销低、效果好的企业问答RAG新范式,突破现有系统在跨模态意图理解深度、个性化排序精度与实时生成质量上的瓶颈,基于企业内部知识和外部公网知识来回答问题与完成深度创作,这项工作对于字节自身做好企业知识管理,和飞书打造国内领先的企业知识问答创作产品,都有重要意义。 课题挑战: 1、图结构融合挑战:传统RAG系统以文本匹配为核心,难以有效捕获用户行为模式、实体拓扑关系等非结构化图信息。如何将文本、图像、视频等异构图数据嵌入到语义理解框架中,构建统一的特征表示空间,是提升意图识别精度的关键瓶颈; 2、动态推理挑战:企业关系图谱具有实时演化特性,用户行为模式与实体关联强度随时间动态变化。现有静态图嵌入方法难以满足实时问答场景的时效性要求,需要开发增量式图学习算法实现动态知识更新; 3、企业内部知识和外部公网知识的融合:当两种知识之间存在差异或冲突时,如果无法有效融合,会显著降低回答的可靠性和实用性。如何在不同模态间建立准确的语义关联,并有效融合内外部知识,是提升回答可靠性和实用性的关键。虽然业界 Deep Research 实现了基于 Agent 架构的公网知识深度检索与创作,但尚无企业内外部知识融合的成功实践; 4、Agentic RAG 可控性:基于Agent架构来实现企业知识问答创作,依赖LLM进行自主推理和判断,其决策过程存在一定的不可预测性。在某些复杂情况下(召回语料量大且干扰性强、企业内部知识与外部知识冲突),Agent可能做出不符合预期的决策,且难以直接干预和纠正。 我们的优势: 1、飞书企业问答产品已经积累了一定的用户基础,并在快速增长; 2、依托飞书套件,能够建立比较完整的用户与其他飞书内实体的图结构数据,并且已经有过早期实践(Lark Graph); 3、飞书企业问答有完整的评测体系和资源,帮助RAG类探索快速迭代。