logo of bytedance

字节跳动分布式系统开发实习生-搜索-筋斗云人才计划

实习兼职A19469地点:上海状态:招聘

任职要求


1、2026届及之后毕业,博士在读,人工智能、计算机、自然语言处理计算机视觉等相关专业优先;
2、在人工智能领域顶级会议上有发表论文或有深入研究经历者优先;
3、有扎实的机器学习/深度学习算法基础和代码能力,熟练C/C++Python;
4、聪明、自信,敢于突破,对技术有执着的追求和热爱;
5、具备良好的团队沟通协作能力,能和团队一起探索新技术,推进技术进步。

工作职责


团队介绍:字节跳动搜索团队主要负责抖音、国际化短视频、今日头条、西瓜视频等产品以及电商、生活服务等业务的搜索算法创新和架构研发工作。我们使用前沿的机器学习技术进行端到端建模并不断创新突破,同时专注于分布式系统、机器学习系统的构建和性能优化,从内存、Disk等优化到索引压缩、召回、排序等算法的探索,充分给同学们提供成长自我的机会。
主要工作方向包括:
1、探索前沿的NLP技术:从基础的分词、NER,文本、多模态预训练,到业务上的Query分析、基础相关性等,全链路应用深度学习模型,每个细节都充满挑战;
2、跨模态匹配技术:在搜索中应用CV+NLP深度学习技术,实现多模态视频搜索强大的语义理解和检索能力;
3、大规模流式机器学习技术:应用大规模机器学习,解决搜索中的推荐问题,让搜索更加个性化更加懂你;
4、千亿级数据规模的架构:从大规模离线计算,分布式系统的性能、调度优化,到构建高可用、高吞吐和低延迟的在线服务的方方面面都有深入研究和创新;
5、推荐技术:基于超大规模机器学习技术,构建业界领先的搜索推荐系统,对搜索推荐技术进行探索和创新。

课题介绍:
1、课题背景:随着互联网数据规模的爆炸式增长和用户对搜索体验需求的不断提升,传统搜索引擎基于关键词匹配和规则推理的局限性日益凸显。例如,用户意图的复杂性、自然语言的歧义性、多模态数据(文本、图像、视频等)的融合检索需求,以及长尾查询的精准响应等问题,均对搜索系统的智能化提出了更高要求。
近年来,大模型技术(如GPT、BERT、多模态大模型等)在自然语言理解、知识推理和生成任务中展现出强大能力,为智能搜索的语义理解、意图识别和个性化推荐提供了新的技术路径。同时,数据库技术在高效数据存储、索引优化和实时检索方面的持续演进,为构建支持大模型推理的高性能搜索系统奠定了基础。
2、研究方向:本课题旨在结合大模型技术与数据库技术,探索新一代智能搜索系统的核心架构与关键技术,突破传统搜索的语义理解瓶颈,构建更高效、精准且可扩展的智能搜索服务,满足复杂场景下的用户需求。
包括英文材料
NLP+
OpenCV+
机器学习+
深度学习+
算法+
C+
C+++
Python+
相关职位

logo of bytedance
实习A180469A

团队介绍:字节跳动搜索团队主要负责抖音、国际化短视频、今日头条、西瓜视频等产品以及电商、生活服务等业务的搜索算法创新和架构研发工作。我们使用前沿的机器学习技术进行端到端建模并不断创新突破,同时专注于分布式系统、机器学习系统的构建和性能优化,从内存、Disk等优化到索引压缩、召回、排序等算法的探索,充分给同学们提供成长自我的机会。 主要工作方向包括: 1、探索前沿的NLP技术:从基础的分词、NER,文本、多模态预训练,到业务上的Query分析、基础相关性等,全链路应用深度学习模型,每个细节都充满挑战; 2、跨模态匹配技术:在搜索中应用CV+NLP深度学习技术,实现多模态视频搜索强大的语义理解和检索能力; 3、大规模流式机器学习技术:应用大规模机器学习,解决搜索中的推荐问题,让搜索更加个性化更加懂你; 4、千亿级数据规模的架构:从大规模离线计算,分布式系统的性能、调度优化,到构建高可用、高吞吐和低延迟的在线服务的方方面面都有深入研究和创新; 5、推荐技术:基于超大规模机器学习技术,构建业界领先的搜索推荐系统,对搜索推荐技术进行探索和创新。 课题介绍: 1、课题背景:随着互联网数据规模的爆炸式增长和用户对搜索体验需求的不断提升,传统搜索引擎基于关键词匹配和规则推理的局限性日益凸显。例如,用户意图的复杂性、自然语言的歧义性、多模态数据(文本、图像、视频等)的融合检索需求,以及长尾查询的精准响应等问题,均对搜索系统的智能化提出了更高要求。 近年来,大模型技术(如GPT、BERT、多模态大模型等)在自然语言理解、知识推理和生成任务中展现出强大能力,为智能搜索的语义理解、意图识别和个性化推荐提供了新的技术路径。同时,数据库技术在高效数据存储、索引优化和实时检索方面的持续演进,为构建支持大模型推理的高性能搜索系统奠定了基础。 2、研究方向:本课题旨在结合大模型技术与数据库技术,探索新一代智能搜索系统的核心架构与关键技术,突破传统搜索的语义理解瓶颈,构建更高效、精准且可扩展的智能搜索服务,满足复杂场景下的用户需求。

更新于 2025-03-03
logo of bytedance
实习A63598

团队介绍:Intelligence and Innovation团队,是飞书部门内部负责做算法创新与实践的部门,深耕于ToB办公场景的LLM应用相关的前沿技术探索与落地。既通过ASR、大模型文本总结、智能函数、多模态等AI中台能力的建设来支持飞书内外语音识别、会议纪要生成、智能表格公式等各类AI产品,同时也负责了企业AI搜索与知识管理等业务的落地和推广,团队目标是将飞书打造为AI与人高效协作的下一代智能平台,实现 “有效率、有方法、有结果” 的产品愿景。 课题背景: 飞书沉淀了企业内大量知识(文档、wiki、消息、会议记录、图片、视频等)。随着企业知识图谱、用户行为轨迹等图结构数据规模的指数级增长,传统基于文本匹配的RAG系统面临关系感知缺失和个性化能力不足的矛盾。如何寻找相对开销低、效果好的企业问答RAG新范式,突破现有系统在跨模态意图理解深度、个性化排序精度与实时生成质量上的瓶颈,基于企业内部知识和外部公网知识来回答问题与完成深度创作,这项工作对于字节自身做好企业知识管理,和飞书打造国内领先的企业知识问答创作产品,都有重要意义。 课题挑战: 1、图结构融合挑战:传统RAG系统以文本匹配为核心,难以有效捕获用户行为模式、实体拓扑关系等非结构化图信息。如何将文本、图像、视频等异构图数据嵌入到语义理解框架中,构建统一的特征表示空间,是提升意图识别精度的关键瓶颈; 2、动态推理挑战:企业关系图谱具有实时演化特性,用户行为模式与实体关联强度随时间动态变化。现有静态图嵌入方法难以满足实时问答场景的时效性要求,需要开发增量式图学习算法实现动态知识更新; 3、企业内部知识和外部公网知识的融合:当两种知识之间存在差异或冲突时,如果无法有效融合,会显著降低回答的可靠性和实用性。如何在不同模态间建立准确的语义关联,并有效融合内外部知识,是提升回答可靠性和实用性的关键。虽然业界 Deep Research 实现了基于 Agent 架构的公网知识深度检索与创作,但尚无企业内外部知识融合的成功实践; 4、Agentic RAG 可控性:基于Agent架构来实现企业知识问答创作,依赖LLM进行自主推理和判断,其决策过程存在一定的不可预测性。在某些复杂情况下(召回语料量大且干扰性强、企业内部知识与外部知识冲突),Agent可能做出不符合预期的决策,且难以直接干预和纠正。 我们的优势: 1、飞书企业问答产品已经积累了一定的用户基础,并在快速增长; 2、依托飞书套件,能够建立比较完整的用户与其他飞书内实体的图结构数据,并且已经有过早期实践(Lark Graph); 3、飞书企业问答有完整的评测体系和资源,帮助RAG类探索快速迭代。

更新于 2025-03-04
logo of bytedance
实习A231113

团队介绍:Intelligence and Innovation团队,是飞书部门内部负责做算法创新与实践的部门,深耕于ToB办公场景的LLM应用相关的前沿技术探索与落地。既通过ASR、大模型文本总结、智能函数、多模态等AI中台能力的建设来支持飞书内外语音识别、会议纪要生成、智能表格公式等各类AI产品,同时也负责了企业AI搜索与知识管理等业务的落地和推广,团队目标是将飞书打造为AI与人高效协作的下一代智能平台,实现 “有效率、有方法、有结果” 的产品愿景。 课题背景: 飞书沉淀了企业内大量知识(文档、wiki、消息、会议记录、图片、视频等)。随着企业知识图谱、用户行为轨迹等图结构数据规模的指数级增长,传统基于文本匹配的RAG系统面临关系感知缺失和个性化能力不足的矛盾。如何寻找相对开销低、效果好的企业问答RAG新范式,突破现有系统在跨模态意图理解深度、个性化排序精度与实时生成质量上的瓶颈,基于企业内部知识和外部公网知识来回答问题与完成深度创作,这项工作对于字节自身做好企业知识管理,和飞书打造国内领先的企业知识问答创作产品,都有重要意义。 课题挑战: 1、图结构融合挑战:传统RAG系统以文本匹配为核心,难以有效捕获用户行为模式、实体拓扑关系等非结构化图信息。如何将文本、图像、视频等异构图数据嵌入到语义理解框架中,构建统一的特征表示空间,是提升意图识别精度的关键瓶颈; 2、动态推理挑战:企业关系图谱具有实时演化特性,用户行为模式与实体关联强度随时间动态变化。现有静态图嵌入方法难以满足实时问答场景的时效性要求,需要开发增量式图学习算法实现动态知识更新; 3、企业内部知识和外部公网知识的融合:当两种知识之间存在差异或冲突时,如果无法有效融合,会显著降低回答的可靠性和实用性。如何在不同模态间建立准确的语义关联,并有效融合内外部知识,是提升回答可靠性和实用性的关键。虽然业界 Deep Research 实现了基于 Agent 架构的公网知识深度检索与创作,但尚无企业内外部知识融合的成功实践; 4、Agentic RAG 可控性:基于Agent架构来实现企业知识问答创作,依赖LLM进行自主推理和判断,其决策过程存在一定的不可预测性。在某些复杂情况下(召回语料量大且干扰性强、企业内部知识与外部知识冲突),Agent可能做出不符合预期的决策,且难以直接干预和纠正。 我们的优势: 1、飞书企业问答产品已经积累了一定的用户基础,并在快速增长; 2、依托飞书套件,能够建立比较完整的用户与其他飞书内实体的图结构数据,并且已经有过早期实践(Lark Graph); 3、飞书企业问答有完整的评测体系和资源,帮助RAG类探索快速迭代。

更新于 2025-03-04
logo of bytedance
实习A22726

团队介绍:Intelligence and Innovation团队,是飞书部门内部负责做算法创新与实践的部门,深耕于ToB办公场景的LLM应用相关的前沿技术探索与落地。既通过ASR、大模型文本总结、智能函数、多模态等AI中台能力的建设来支持飞书内外语音识别、会议纪要生成、智能表格公式等各类AI产品,同时也负责了企业AI搜索与知识管理等业务的落地和推广,团队目标是将飞书打造为AI与人高效协作的下一代智能平台,实现 “有效率、有方法、有结果” 的产品愿景。 课题背景: 飞书沉淀了企业内大量知识(文档、wiki、消息、会议记录、图片、视频等)。随着企业知识图谱、用户行为轨迹等图结构数据规模的指数级增长,传统基于文本匹配的RAG系统面临关系感知缺失和个性化能力不足的矛盾。如何寻找相对开销低、效果好的企业问答RAG新范式,突破现有系统在跨模态意图理解深度、个性化排序精度与实时生成质量上的瓶颈,基于企业内部知识和外部公网知识来回答问题与完成深度创作,这项工作对于字节自身做好企业知识管理,和飞书打造国内领先的企业知识问答创作产品,都有重要意义。 课题挑战: 1、图结构融合挑战:传统RAG系统以文本匹配为核心,难以有效捕获用户行为模式、实体拓扑关系等非结构化图信息。如何将文本、图像、视频等异构图数据嵌入到语义理解框架中,构建统一的特征表示空间,是提升意图识别精度的关键瓶颈; 2、动态推理挑战:企业关系图谱具有实时演化特性,用户行为模式与实体关联强度随时间动态变化。现有静态图嵌入方法难以满足实时问答场景的时效性要求,需要开发增量式图学习算法实现动态知识更新; 3、企业内部知识和外部公网知识的融合:当两种知识之间存在差异或冲突时,如果无法有效融合,会显著降低回答的可靠性和实用性。如何在不同模态间建立准确的语义关联,并有效融合内外部知识,是提升回答可靠性和实用性的关键。虽然业界 Deep Research 实现了基于 Agent 架构的公网知识深度检索与创作,但尚无企业内外部知识融合的成功实践; 4、Agentic RAG 可控性:基于Agent架构来实现企业知识问答创作,依赖LLM进行自主推理和判断,其决策过程存在一定的不可预测性。在某些复杂情况下(召回语料量大且干扰性强、企业内部知识与外部知识冲突),Agent可能做出不符合预期的决策,且难以直接干预和纠正。 我们的优势: 1、飞书企业问答产品已经积累了一定的用户基础,并在快速增长; 2、依托飞书套件,能够建立比较完整的用户与其他飞书内实体的图结构数据,并且已经有过早期实践(Lark Graph); 3、飞书企业问答有完整的评测体系和资源,帮助RAG类探索快速迭代。

更新于 2025-03-04