
平安科技算法研究员
任职要求
1.硕士以上学历,计算机、人工智能相关专业; 2.在计算机视觉、机器学习和深度学习方面有深入研究,有生成模型、多模态模型或工程优化经验优先考虑; 3.有新媒体营销、视觉风控、客户服务,或者保险、银行、证券等金融业务场景落地应用的优先 4.扎实的Python/C++编程功底,熟练掌握 PyTorch、TensorFlow 等深度…
工作职责
1.负责计算机视觉和多模态学习领域的算法研发工作,研发下属课题中的一项或多项,包括不限于:多模态大模型、数字人、图像生成、视频生成算法等 2.跟进行业前沿AI、应用研究(如多模态实时交互、创作智能体、多智能体协同等等),制定垂直场景解决方案 3.与业务、产品深度配合,推动研发的算法模型在实际场景应用领域的性能优化和落地

1. 负责公司身份认证核心算法的研发、迭代与优化,覆盖人脸、掌静脉、虹膜等多模态识别,以及合成数据生成等方向; 2. 参与从问题建模、特征工程、网络设计、模型训练到上线部署的全流程工作,持续提升算法的准确率、鲁棒性与效率; 3. 持续跟踪国际识别算法的前沿技术,根据产品需求开展技术预研与原型实现,推动新算法在产品中的落地和性能优化; 4. 基于 GAN、Diffusion 等前沿生成技术,构建大规模高质量数据集,改善模型泛化能力; 5. 与产品、研发、测试等跨职能团队紧密协作,参与需求评审、系统设计、代码实现及性能测试,确保项目按期交付; 6. 编写和维护技术方案、设计文档、实验报告及专利、论文等,持续沉淀公司技术。
一、关于阿里巴巴国际站 阿里巴巴国际站是全球领先的跨境 B2B 数字贸易平台,致力于推动全球贸易数字化升级。在这里,你将有机会深入 AIGC 在垂直领域的“深水区”,直接参与构建懂业务、能推理的Agentic Creative System(智能创意系统),用前沿的生成式 AI 技术重塑全球卖家的内容生产力。 二、关于项目 本项目旨在解决 B 端电商场景下,通用大模型难以理解复杂商业逻辑、生成内容不可控及缺乏业务反馈闭环的核心痛点。我们不只做通用的文生图/文生视频,而是致力于打造具备高度业务感知能力的智能创意引擎: 1. 突破生成模型的“幻觉”与对齐难题:针对 B 端商品严格的属性要求,探索 Diffusion Model + RL(强化学习) 训练范式。通过构建基于真实业务反馈(如点击率、转化率)的 Reward Model,实现模型策略的在线迭代,确保生成内容既美观又符合商业逻辑。 2. 构建复杂约束下的 Agent 编排架构:设计多 Agent 协作系统,使其能够自主规划生图步骤、调用外部工具并执行带强限制的 Function Calling(如保留特定 Logo、遵循材质规范),实现从“随机生成”到“精准可控”的跃迁。 3. 打造端到端的长上下文视频工作流:搭建高可用、可扩展的视频生成 Workflow,解决长序列生成中的一致性问题,实现从复杂文档/文本输入到高质量营销视频输出的全自动化链路。 三、你的职责 1. 前沿调研与方案设计:跟进工业界与学术界在 Diffusion Models、Reinforcement Learning from Human/Business Feedback (RLHF/RLBF)、Multi-Agent Planning 及 Long-Context Video Generation 方向的最新进展,探索适用于 B 端复杂场景的落地方案。 2. 负责生图/视频模型的 RL 训练框架搭建,设计高效的 Reward Model 以对齐业务目标,解决生成内容的“幻觉”与合规性问题。 3. 设计与实现 Multi-Agent 协作架构,优化 Agent 在复杂业务流程中的任务拆解、工具调用及自我修正能力。 4. 落地实践与成果转化:参与模型训练、链路调优与 AB 实验分析,将理论方案转化为线上可用的智能创意生产能力;对创新性研究成果进行总结,撰写高质量技术论文并尝试投稿顶级会议(如 CVPR, ICCV, NeurIPS, ICML, SIGGRAPH 等)。
一、关于阿里巴巴国际站 阿里巴巴国际站是全球领先的跨境 B2B 数字贸易平台,致力于推动全球贸易数字化升级。在这里,你将有机会直接参与构建""万物皆可搜""的下一代智能搜索引擎,利用最前沿的多模态大模型与 Agent 技术,连接海量商品库与全球复杂的商业需求,重新定义 B 类电商的搜索体验。 二、关于项目 本项目旨在解决国际站 B 类业务场景下,非结构化数据理解难、复杂意图推理弱、亿级规模响应慢的核心挑战。 传统关键词搜索已无法满足买家通过“竞品图”、“手绘草图”或“长篇规格书(PDF/Word)”寻找供应链的需求。 本项目致力于: 突破多模态语义鸿沟:实现从单纯的“以图搜图”到跨模态(图 + 文+ 文档)深度意图理解的跃迁,精准索引产品图片、设计图纸及长文档。 构建 Agentic 检索增强系统:面对超长上下文(整本产品目录)和强约束条件(材质、认证标准组合),利用多 Agent 协作与复杂 Function Calling 能力,让 AI 具备逻辑推理能力,不仅“找到”商品,更能“读懂”商机。 攻克高并发实时交互难题:在亿级商品库中,实现毫秒级的图 + 文混合检索响应,支撑全球买家的实时采购决策。 三、你的职责 1. 前沿调研与方案设计:跟进学术界与工业界在多模态检索(Image-Text-Document Retrieval)、长上下文理解(Long-Context Understanding)、Agentic RAG 及复杂任务编排方向的最新进展,探索适用于 B 端复杂场景的落地方案。 2. 负责多模态表征学习,提升图片、文本及长文档(PDF/Word)之间的深度语义对齐精度。 3. 针对亿级数据规模,优化检索链路的延迟与吞吐量,实现高并发下的实时多模态交互。 4. 落地实践与成果转化:参与模型搭建、全链路调优与离线/在线实验分析,将理论方案转化为线上生产能力;对创新性研究成果进行总结,撰写高质量技术论文并尝试投稿顶级会议(如 SIGIR, CVPR, ACL, KDD 等)。