京东基于电商大模型的Mid-train及RL研究
任职要求
1. 计算机、人工智能或相关专业博士 / 硕士,有扎实的机器学习、强化学习理论基础。 2. 熟悉大语言模型(LLM)训练与后训练流程,有 SFT/RLHF/RLOO/GRPO 等相关项目经验。 3. 有 Agent 训练、Tool-us…
工作职责
1. 设计并实现电商场景下的大模型中期训练(Mid-train)算法,解决领域知识注入与能力对齐等核心难题; 2. 负责电商场景下Agentic大模型的强化学习后训练,攻坚奖励模型(RM)、策略优化(如PPO、GRPO)及多轮交互决策优化等关键技术; 3. 构建面向电商业务的高质量训练数据、奖励数据及评测基准(Benchmark),通过数据闭环迭代驱动模型性能优化; 4. 推动大模型研究成果在智能推荐、智能导购及智能运营等真实业务场景中的端到端落地,解决实际业务痛点。
团队介绍:AI 数据与安全团队为 Seed 基座模型及 AI 原生应用提供跨模态数据服务,覆盖数据生产全流程,包含模型评估标准的制定、数据规模化生产、数据飞轮搭建,不断提升数据质量,支持模型快速迭代。 团队由产品经理、数据工程、数据运营等跨职能人才组成,并通过与 Seed 研究员、行业专家、全球顶尖数据供应商紧密合作,从真实场景中收集反馈并分析模型表现数据,解决 AI 前沿突破过程中的复杂数据问题,推动模型性能与用户体验的双重提升。我们既是帮助模型技术迭代的一线贡献者,也是模型和 AI 产品的一手用户。 课题介绍: AI Coding是当前大模型领域最热门的方向之一,高质量的Code训练数据和完善的模型评估机制是决定大模型Coding能力上限的关键因素。本课题通过探索基于主动学习技术的Code数据合成方案,系统性优化Code数据生产过程中存在的生产效率低、数据质量不佳、模型评估机制不完善等痛点问题。 课题挑战: 1、动态抗污染Benchmark 构建:针对评测集易污染、静态固化问题,构建具备防泄露机制的评测基准体系;建立动态更新迭代机制,适配模型能力演进与场景拓展,打造稳定可靠的评测标尺; 2、基于主动学习与自博弈的数据合成方法:以主动学习筛选策略结合智能体环境模拟,替代高成本人工标注,实现数据自动化、规模化生成;引入自进化与自博弈机制,定向挖掘模型薄弱领域,合成高价值演化数据,补齐能力短板; 3、低成本数据质量评估方法:突破单一语义评估局限,构建多维度质量刻画体系,探索轻量化评估路径以适配海量数据需求;建立数据特征与模型效果的强关联机制,形成可量化、可追溯的综合评估体系。 课题价值: 构建 Coding Agent自动化数据合成与主动学习管线,建立数据质量及模型性能评估标准,精准刻画数据与能力边界,降低评估成本,提升豆包大模型在复杂长程SWE任务中的表现。
阿里国际数字商业集团-供应链物流&定价算法团队专门负责阿里巴巴海外零售商品定价的建设和优化工作,业务覆盖全球,支持了千亿级别的零售行业、以及数以千万计的商品。 我们支撑了阿里国际商业零售供的智能定价决策体系,我们的核心职责是通过商品定价、优化投资效率,提升平台的成交规模和损益。我们的工作涉及到国际商业数字零售定价问题的方方面面,充满了趣味和挑战。 在这里,你将和我们一起,采用大模型、强化学习、运筹优化算法、仿真分析等持续解决定价和投资中的现实问题,不断创造价值,重塑整个海外零售商业体系,为社会带来更加美好的生活! 在这里,您将与优秀的算法团队紧密合作,共同解决商业活动中的定价和投资问题,不断创造价值。让我们携手共创海外商业数字供应链的未来! 我们的具体工作内容如下:构建国际电商场景下的定价和投资AI Agent, 通过建设多模态的商品特征、商家以及用户行为的理解能力,商品定价策略生成能力以及长序列投资决策学习能力,实现平台整体损益和规模的长期优化。 1、商品、用户、商家多模态特征理解:以商品特征理解为例,利用多模态大模型同时处理商品图像(包装、材质、设计风格)和文本信息(品牌、功能描述、用户评论),学习能够反映定价相关属性的商品表示。研究如何从LLM输出中提取影响定价的关键特征,如品类归属、档次定位、功能复杂度、品牌溢价等。同时,研究如何从LLM的商品理解中抽象出可迁移的定价规律,包括同品类内的价格敏感度模式、不同档次商品的定价策略差异、可替代品之间的价格关联关系。设计知识迁移学习框架,将成熟品类的定价知识迁移到新品类或长尾商品; 2、商品定价策略生成能力:根据商品特征的理解自主制定价格策略,比如识别商品视觉特征(如包装颜色、尺寸展示、质感)对消费者价格预期的影响(例如,识别出"高端包装"应匹配更高价格锚点和更低折扣频率),并将其整合成商品的定价策略,同时需要满足平台对整体货盘的损益和规模要求; 3、长序列投资决策学习能力:根据对不同投资对象(商品、商家、用户),通过强学学习等方式学习历史决策结果,研究基于序列生成的未来定价/投资轨迹优化,实现对长期投资策略的提前规划和持续优化。
1、负责研发AIOps系统,通过LLM结合OpenAPI/MCP等技术,实现云客户的自动化运维,提升运维效率和稳定性; 2、设计与开发前沿AI智能体: 构思、原型化并评估新颖的、基于LLM的自主智能体,能够基于云平台产品和OpenAPI执行端到端的IT事件管理任务,包括智能日志分析、多模态异常检测、根本原因分析(RCA)以及自动化修复方案的生成与执行 ; 3、探索与实施尖端LLM技术: 深入研究并应用最先进的LLM技术,包括但不限于: •MCP/Skills为客户侧AIOps系统提供与云平台OpenAPI进行集成的标准化接口; •利用检索增强生成(RAG)为模型提供丰富的、上下文感知的运维数据(如日志、指标、追踪); •设计和实现多智能体协作框架,让多个专用智能体协同解决复杂的系统故障; •通过模型微调(Fine-tuning)和提示工程(Prompt Engineering),提升模型在特定运维任务上的性能和可靠性; 4、解决核心研究挑战: 专注于攻克将LLM应用于AIOps领域的关键难题,包括但不限于: •研究并提出创新方法以减轻模型的“幻觉”(Hallucination)问题,确保在生产环境中的决策可靠性,例如通过引入外部知识库或标准操作程序(SOPs)进行约束; •开发资源高效型(Resource-Efficient)模型和算法,在保证卓越性能的同时,解决LLM高昂的计算成本和延迟问题; 5、推动科学严谨性与可复现性: 建立和利用科学的评估基准与框架(Benchmark),对所研发的模型和智能体进行严格、可复现的性能评测,并与业界SOTA(State-of-the-art)方案进行比较; 6、发表与分享研究成果: 将创新工作和实验发现撰写成高质量的学术论文,并在全球顶级的AI、系统和软件工程会议(如ICSE、FSE、OSDI、NSDI、KDD、VLDB等)上发表,引领该领域的学术发展方向。
1. 模型优化 * 应用模型压缩技术(如剪枝、量化、知识蒸馏)减少模型复杂度,提升推理效率; * 应用模型自适应推理,模型能够根据输入数据的特征动态调整推理策略,减少不必要的计算; * 实现模型并行与稀疏化技术,提升模型推理速度; 2. Prompt优化 * 设计简洁高效的Prompt模板,减少上下文长度和计算复杂度; * 实现Prompt参数化与动态调整,优化推理时间; * 应用Prompt蒸馏与嵌入优化技术,提升推理速度和质量; 3. 任务调度与负载均衡 * 优化任务调度算法,提高分布式推理任务的分配效率; * 实现负载均衡策略,动态分配任务到不同设备,确保资源利用率最大化; * 应用智能调度技术,根据业务的峰谷差异,实现潮汐调度、抢占调度能智能调度方案; 4. 前沿技术研究与应用 * 研究动态模型压缩、自适应推理、量化感知推理等前沿技术,并将其应用到实际项目中; * 针对多模态模型(如文本+图像+语音)的推理优化,减少模态间通信开销; 5. 政企客户支持与业务需求对接 * 理解政企客户的业务需求,确保模型推理优化方案符合实际应用场景和安全规范; * 针对政企客户的复杂业务场景,设计高效的推理优化方案,提升业务效率; 6. 系统性问题解决 * 综合算力、模型、存储、通信、Prompt、推理框架等多维度,解决模型推理速度的系统性优化问题; * 针对政企客户的实际需求,提供端到端的推理优化解决方案。