随便看看「阿里巴巴」有没有自己喜欢的职位~
随着大模型技术迅猛发展,模型迭代速度远超传统评测体系更新。当前行业面临核心痛点:复杂任务与长尾场景缺乏有效评估标准,主观指标难以量化,人工评测成本高、效率低。现有系统难以支撑大规模模型集成与快速实验,制约了模型在真实业务中的落地。本项目旨在构建下一代评测体系,解决评估滞后与对齐难题,确保模型能力可测、可控、可用,为业务场景提供坚实技术底座,推动 AI 从“可用”向“好用”跨越,满足产业界对高质量模型的迫切需求。 1. 深度挖掘大模型在复杂任务、长尾场景中的弱点,设计并构建具有可扩展性的自动化评测方案及高质量数据集; 2. 参与 LLM-as-a-Judge 方案的设计与实现,训练高精度的 Reward Model(奖励模型),建模人类偏好,提升模型在指令遵循、创造性等主观评价上的表现; 3. 设计高效的 Reward Signal(奖励信号)并合成对应数据,通过强化学习(RL)算法持续提升模型的能力上限与泛化性; 4. 参与开发 Evaluation 与 Reward System 所需的工程框架,简化多任务测试流程,提升大规模模型集成与实验的效率; 5. 跟踪全球大模型最新进展(如 Agent 评测、多模态对齐、自动化数据合成等),推动研究成果在真实业务场景中的落地。
1. 探索更多可scalable的verfifier信号,并通过RL提升模型的各项能力。 2. 提升reward model在创作、人类偏好、指令遵循等各专项上的能力,减少reward hacking和bias。 3. 研究reasoning path压缩和外推,实现更高质量的推理思考。 4. 将LLM的reasoning能力和Agent以及其他模态相结合,探索统一模态的reasoning。
随着大模型技术的不断发展,代码智能体在实际软件开发流程中展现出巨大的潜力,能够显著提升开发效率。本项目致力于探索大规模代码模型作为智能体的潜能,目标是在仓库级别的代码生成、自动issue修复等场景中,增强代码模型的智能性与自动化处理能力。我们专注于提升大规模代码模型在以下方面的能力: 1. 代码智能体的规划能力; 2. 代码智能体的检索与工具调用能力; 3. 代码智能体的自动修复能力。
1. 模型多模态能力的提升,包括但不限于:物理世界细粒度视觉感知、空间感知、视频时序行为预测和推理、基于视觉的决策和规划; 2. 多模态数据的制作,包括:训练数据的收集、清理和标注,测试Benchmark的构建; 3. 多模态RL相关研究,包括通过RL提升模型常规感知能力和推理能力; 4. 多模态任务评测,包括:客观的Benchmark接入、OOD评测、以及主观评测。
千问(Qwen)是由阿里巴巴自主研发的超大规模语言模型,具备跨语言、跨任务的理解与生成能力。Qwen系列模型,涵盖参数量从几百 M 到 T 级的基座大语言模型,并相继推出Qwen-VL、Qwen-Audio、Qwen-Omni、Qwen-Coder等系列模型。从多轮对话到代码生成,从逻辑推理到内容创作,从单一多模态到全模态统一理解生成,Qwen 正在打造全球领先的全模态模型技术体系,推动AI在企业服务、开发者生态、个人用户等领域的深度应用,引领下一代人工智能的发展。 团队致力于追逐实现 Omni 基座模型,实现全模态理解与对话统一。团队音频组负责围绕 Qwen 基座模型展开音视频/音频处理以及与音视频交互相关的基础研究及其应用,代表工作有 Qwen-Omni系列, Qwen-LiveTranslate系列等。 工作职责: 1. 音频/音视频 Agentic能力: 原生音视频Agentic/Long-horizen, 全模态Agentic/Coding不降智等。 2. 音视频理解基础能力:包括Caption, Grouding, 音视频Alignment, General QA,长视频,多音视频理解等。 3. 音频/语音理解基础能力: 包括ASR, MultiSpkASR, 语音/音频Grouding/Counting/QA,音乐理解,长音频,多音频理解等。 4. 音频/音视频Postrain/RL/OPD。 5. 音视频通话与交互:包括全音视频双工, 音频query不降智/体感优化等。 6. 语音生成基础能力: 包括音色克隆,可控性,长语音生成稳定性等。 7. 全模态模型自主优化与Self-evolving。
大模型因其强大的语言理解和生成能力,在人工智能领域引起了广泛关注。当前,ChatGPT、LLama等关注英语的大型语言模型已经取得了显著成就。关注中文的大模型,如ChatGLM、MOSS以及千问等也正在快速发展。然而,中/英以外的语言能力关注较少,但需求和研究价值很高。
岗位职责 - 音频算法测评:参与多项AI音频算法的评测标准搭建;构建测评集,完成日常算法测评;分析算法 badcase,定位问题,反哺算法优化 - AI 音频产品设计:设计音频Agent 的端到端工作流——从"听懂剧本 / 分镜"到"自动选轨、混音、配音、生成环境音"的全链路编排;输出 PRD、交互流程图、产品demo,跟进研发落地并推动版本迭代 - 影视音频调研:跟踪影视级音频制作流程与业界工具链,为算法训练与评测提供审美锚点 - 视频agent相关工作,包括不限于产品策略、效果测评
1. 负责 AIGC产品的内容运营与社区运营,提升内容供给质量与用户活跃度 2. 搭建并维护创作者体系(招募、激励、成长路径),沉淀核心创作者 3. 策划并执行内容活动(挑战赛、话题运营、模板玩法等),提升传播与转化 4. 分析内容数据与用户行为,持续优化内容分发与运营策略 5. 跟进海外 AIGC产品与社区趋势,输出洞察并推动落地 6. 与产品、算法、设计团队协同,优化用户体验与内容工具能力