阿里巴巴AI推理平台-技术专家-向量检索
任职要求
1、计算机或相关专业本科及以上学历,有后端/基础架构开发经验; 2、掌握C++/Go/Python语言中的一种或多种,具备良好的工程素养和代码规范意识; 3、有云原生技术栈实践经验(如 Kubernetes、Docker、Prometheus 等); 4、具备线上服务 SRE 意识,熟悉日志、监控…
工作职责
我们正在寻找一位后台研发工程师,加入我们的核心基础设施团队,负责支撑公司云原生向量检索服务的开发、运维与稳定性保障。该服务作为智能搜索、RAG(Retrieval-Augmented Generation)等关键业务的核心组件,承载着高并发、低延迟、高可用的线上查询需求。你将参与以下工作: 1、负责向量检索服务后端功能模块的设计、开发与持续优化; 2、保障线上服务的稳定性、可扩展性与可观测性,快速响应并修复线上问题; 3、与算法、产品及前端团队紧密协作,高效落地面向RAG、智能搜索等场景的功能需求; 4、参与服务的云原生架构演进,包括容器化部署、弹性扩缩容、服务治理、监控告警等; 5、持续提升系统性能与资源利用效率,在保证准确性的前提下优化检索延迟与吞吐能力;
1. 设计并实现高性能AI原生网关。构建低延迟、高并发的API网关系统,支持多模态、多协议接入,为国内及全球客户提供灵活、安全、可扩展的流量接入方案,提供完整的数据面控制与可观测能力。 2. 打造智能推理调度与资源管理系统。设计并实现面向复杂分布式推理场景的请求调度和资源调度系统,结合动态负载特征与异构硬件资源,持续优化请求分发策略;建设Serverless化资源调度架构,实现资源的弹性伸缩与极致利用率提升。 3. 构建先进的MLOps平台能力。深度优化模型服务的CI/CD流程,推动算法研发到生产部署的自动化与标准化;实现模型版本管理、灰度发布、监控告警、性能分析等全生命周期管理能力,提升迭代效率与系统稳定性。
1. 结合LLM技术,设计和优化RAG全链路的基础架构,提升系统的吞吐能力和响应速度。 2. 构建高性能,可扩展的分布式文件处理和索引构建系统,承载海量文档的知识库的索引和检索需求。 3. 规划和优化检索集群,通过合理的分片,资源分配等策略降低延迟提高吞吐,针对业务场景进行服务优化。 4. 建立完善的系统监控,日志分析和trace平台,能快速定位和解决系统问题。
1. 负责百炼平台的模型数据与应用数据管理、模型观测、模型评测等大模型工具链产品化落地. 2. 负责百炼平台的数据系统的架构和实现,包括多模态数据源接入、解析与清洗、数据管理等能力,为百炼模型层和应用层提供安全易用、高质量的数据能力。 3. 负责百炼平台的模型与应用可观测系统建设,以及基于观测日志等数据为基础的模型评测、应用评测、数据标注、模型调优等大模型工具层能力建设。 4. 负责百炼多云与多站点架构和开发工作,帮助百炼在多个方向的业务实现快速落地与发展。 5. 了解技术使用场景和优缺点,能够就复杂技术问题,提供解决方案并执行落地,同时对上下游技术团队及技术架构有完整的了解。 6. 基于业务需求和技术洞察,在大模型数据以及数据应用方面,进行技术规划并落地。
本团队涉及如下方面的工作:(工作内容可以根据候选人专业特长安排) 1. 多模态模型的推理功能开发和性能优化,包括对Qwen-3.6、Qwen-3.7、Qwen-VL、Qwen-Audio、Qwen-Omni等多模态输入/输出模型的功能支持和推理性能优化。 2. 分布式推理架构的研发,包括多机推理架构设计,P/D分离、A/F分离、VL模型分离架构、WideEP、ElasticEP等功能研发与落地。 3. 推理引擎服务化,包括推理引擎如何接入线上服务平台,自动扩缩容和可观测性的适配,以及提升线上服务稳定性。 4. NPU/GPU各类算子、kernel开发、算子融合、Compiler的开发等。