阿里云阿里云智能-大模型工程链路测试开发专家/高级工程师-北京/杭州
任职要求
1. 计算机或相关专业硕士及以上学历,3年以上测试开发或质量保障经验,有大模型/AIGC项目经验者优先。 2. 精通Python/Java至少一种语言,熟悉主流测试框架(如PyTest、JUnit)及自动化工具链。 3. 熟悉大模型基本原理(如Transformer、Prompt Engineering、RLHF等),了解训练/推理/部署流程。 4. 具备数据驱动思维,能设计…
工作职责
1. 负责大模型训练、推理、评测、部署等核心链路的质量保障体系建设。 2. 设计并实现自动化评测框架,支持多维度(如准确性、一致性、安全性、推理速度等)的模型能力评估。 3. 构建高质量、可扩展的评测数据集,制定科学、可量化的评测标准与指标体系。 4. 推动CI/CD流程在大模型工程中的落地,保障模型迭代的稳定性与可回溯性。 5. 主导Bad Case分析闭环机制,联动算法、工程与业务团队优化模型表现。
1. 负责大模型训练、推理、评测、部署等核心链路的质量保障体系建设。 2. 设计并实现自动化评测框架,支持多维度(如准确性、一致性、安全性、推理速度等)的模型能力评估。 3. 构建高质量、可扩展的评测数据集,制定科学、可量化的评测标准与指标体系。 4. 推动CI/CD流程在大模型工程中的落地,保障模型迭代的稳定性与可回溯性。 5. 主导Bad Case分析闭环机制,联动算法、工程与业务团队优化模型表现。

1. 负责大模型训练、推理、评测、部署等核心链路的质量保障体系建设。 2. 设计并实现自动化评测框架,支持多维度(如准确性、一致性、安全性、推理速度等)的模型能力评估。 3. 构建高质量、可扩展的评测数据集,制定科学、可量化的评测标准与指标体系。 4. 推动CI/CD流程在大模型工程中的落地,保障模型迭代的稳定性与可回溯性。 5. 主导Bad Case分析闭环机制,联动算法、工程与业务团队优化模型表现。
【课题说明】 本课题目标打破传统推荐系统的召回范式,在LBS服务零售场景下,借助LLM的世界知识与推理能力,构建融合业务特点的生成式召回架构,实现效果突破。 主要挑战在于服务零售行业需求差异大、服务非标准化,在召回过程中同时把控个性化和相关性。 课题将重点设计基于LLM的生成式召回架构,通过领域知识增强与业务目标微调,结合传统稀疏模型的记忆能力与LLM的泛化推理能力,优化端到端目标一致性、长尾query/item的冷启动等问题。 【建议研究方向】 1.推理生成:基于生成式架构引入think过程,结合服务零售行业特点,推理用户真实需求,进而生成更匹配用户诉求的候选。 2.LBS码本优化:基于多模态表征优化语义ID的构建,同时融合时空位置信息与商户服务特征,提升本地生活场景下的地理相关性建模与长尾商户曝光。 3.链路融合:基于生成式架构统一建模传统“召回-粗排-创意-精排”漏斗,端到端建模优化目标一致性。
1、研发和实现前沿的机器翻译算法,探索基于大模型的跨模态语义理解与生成技术,包括但不限于文本翻译、语音翻译、上下文感知的翻译优化以及多语言生成; 2、设计并实现基于 Agent 的智能翻译工作流,探索利用大模型的规划、反思及工具使用能力,解决复杂场景下的多语言翻译和生成问题,如文档翻译等; 3、跟进多语言和机器翻译方向的前沿技术进展,探索 MoE、Multi-Agent以及低资源环境下的高效微调等策略; 4、参与构建高质量的多模态指令微调数据集,探索翻译质量评估的最新方法和应用,协助团队在顶级会议发表高水平论文,并推动算法在实际业务场景中的落地验证。