百度向量数据库研发工程师(J96224)
任职要求
-本科及以上学历,1 年以上后端或系统研发经验 -熟练掌握 C++ / Go 中至少一门语言,具备良好的工程能力与代码质量意识 -扎实的 数据结构与算法基础,理解常见索引结构、并发模型、内存管理等系统基础 -熟悉 Linux / Unix 系统原理,具备系统级问题定位与性能分析能力 -具备以下任一方向的研发经验(满足一项即可) -数据库 / 分布式存储 / 大规模检索系统研发经验 -向量检索、文本检索、Embedding / RAG 等相关系统研发经验 -数据库或大数据 云平台 / 云原生系统 研发经验 -具备良好的问题拆解与解决能力,能够主动推进复杂技术…
工作职责
-参与向量数据库内核能力的设计与研发,包括但不限于 -向量索引结构(如 HNSW / IVF / PQ 等)的工程实现与优化 -查询执行、召回与排序流程的性能优化 -数据组织、Segment / Index 管理、内存与磁盘效率优化 -参与 向量检索与 RAG 场景 的系统研发与优化 -向量 + 结构化 / 文本检索的混合检索(Hybrid Search) -向量召回、过滤、重排等链路的性能与稳定性优化 -参与 向量数据库云化 / 平台化能力 的研发 -集群管理、资源调度、弹性伸缩、多租户隔离 -高可用、容灾、监控、运维自动化能力建设 -参与线上系统问题定位与性能瓶颈分析,支持核心客户场景,推动产品能力持续演进
1、负责向量数据库深度定制化研发,优化分布式架构,实现高吞吐低延迟的向量检索能力; 2、负责解决海量向量数据场景下的存储引擎性能瓶颈; 3、负责快手向量数据库平台建设,构建稳定性链路,拓展生态; 4、针对向量检索业务场景下的特定需求,提出并推动解决方案落地。
从事ADB-PG向量数据库内核引擎技术研发,支撑阿里云海内外各行业的关键客户,以及阿里集团内部核心业务。 岗位职责包含: 1、海量数据下高性能低成本的向量索引与检索技术研发和创新突破,包括索引结构,量化压缩,异构计算加速,实时动态更新,向量标量全文混合检索等; 2、数据库内核引擎和功能模块(包括计算引擎、存储引擎、优化器等)的设计,开发,测试,交付; 3、数据处理分析以及Data+AI业务场景项目的方案架构设计实现,分析并解决海量数据场景下的性能瓶颈与稳定性问题; 4、关注研究业界前沿技术趋势,推动系统架构演进、功能迭代和性能优化。
随着近些年机器学习与表征学习的发展,非结构化数据的查询和分析变得更加普遍。通过表征学习,我们可以把图片或文本嵌入到高维空间从而用高维向量来代表这些图片或文本。进一步的,通过在高维空间中查找最近邻,我们可以对非结构化数据进行语义搜索。例如,通过检索增强生成技术(RAG),我们可以将外部知识或领域知识进行向量化,利用向量空间中的近邻搜索得到对应的原始知识,对大语言模型的生成结果进行增强,来减少大模型出现幻觉或知识过时的现象。 为了提升数据库产品对AI应用的支持,阿里云瑶池数据库也全面提升了向量检索能力,在PolarDB、RDS、AnalyticDB、Lindorm、Tair等产品中集成了向量功能,实现结构化数据、半结构化数据、多模数据、向量数据的一体化处理。 然而,目前向量索引主要关注查询速度和准确率,对于实际复杂场景下的搜索问题还没有足够的研究。例如,分布式架构下的向量查询索引、结构化与非结构化数据的联合查询,以及数据动态增删场景下的索引优化等问题,都需要进一步探索和研究。