蚂蚁金服蚂蚁集团-蚂蚁健康大模型算法专家-健康事业群
任职要求
- 本科及以上学历,计算机、机器学习等相关专业。 - 熟练掌握Python/Java/C++中至少一门语言,熟悉PyTorch/TensorFlow等框架。 - 有大模型开源项目、医疗场景实践经验者优先。 - 有人工智能顶会论文发表者优先。 具体方向要求: 一、语音算法 - 负责语音大模型研发,涵盖前端DSP、3A、VAD、ASR、TTS及多模态技术。 - 熟悉语音前端、唤醒、VAD、ASR、TTS等算法,有语音项目落地经验。 - 具备语音算法引擎实现与系统工程优化能力。 二、多模态算法 - 负责医疗多模态大模型研发,融合图文/语音/视频交互。 - 具备多模态大模型预训练、SFT、GRPO等项目应用经验。 …
工作职责
- 负责相应方向(语音/多模态/行业/数字人/基座)的算法研发与医疗场景落地。 - 开发医疗领域AI产品(如泛医疗助手、报告解读、影像识别等),提升体验与效率。 - 跟踪前沿技术,探索AI医疗普惠与智能化的新范式。
1、负责蚂蚁医疗大模型核心能力的建设和优化,打造业界领先的医疗大模型。主要职责包括大模型结构设计,大模型预训练与微调,大模型推理能力提升等。 2、跟踪探索大语言模型、多模态大模型等方向前沿技术,结合蚂蚁集团拥有的丰富且体系化的医疗生态,实践大模型算法的创新应用与落地。
蚂蚁阿福医疗大模型团队,负责医疗大模型的研发以及在阿福业务场景的应用。 1. 参与训练医疗大模型,包括但不限于模型SFT、强化学习系统的算法实验设计、数据收集合成消融、infra 团队协作等; 2. 探索高效的后训练范式,包括高效 SFT、Model Merge、On-policy Distill、 RL等后训练算法以及pipeline,提升发布效果和效率。 3. 提升大模型在Reasoning、Agentic等任务上的能力上限,构建在医疗场景具备深度思考和自主行动能力的基座模型。 4. 密切关注业界 LLM 后训练算法领域的前沿论文,并整合新技术和算法到医疗大模型中,保持医疗大模型行业领先。
1. 面向蚂蚁集团医疗智能化场景,负责语音大模型相关算法研发与落地,探索基于大模型的新一代智能语音交互/多模态实时音视频交互范式,推动语音 AI 能力在真实医疗业务场景中的规模化应用; 2. 负责语音识别、语音理解、语音合成及语音对话大模型相关技术研发,包括但不限于: 语音识别大模型(ASR):探索复杂场景下的语音识别能力提升,包括医疗专业词、实体热词、方言、多语种、低资源语言、复杂环境鲁棒识别等方向; 语音合成大模型(TTS):探索高自然度、高表现力语音生成技术,包括自然对话、instruct情感表达、文本前端、多音字等方向; 语音对话大模型(Speech LLM):探索端到端语音交互、多模态理解、语音推理、Speech2Text 数据构建、模型后训练、能力评测等方向; 3. 负责语音大模型训练、优化及工程化落地,包括数据构建、模型训练、Post-training、强化学习、评测体系建设等关键环节,打造行业领先的语音智能能力; 4. 跟踪国内外语音、多模态、大模型领域前沿技术发展,结合业务场景探索 AI + 医疗的新型交互模式,推动医疗行业智能化升级。
职位概述 探索行业前沿的大模型技术,建立科学、全面的评测体系,支持模型演进、产品落地、竞对分析评估,通过自动化归因等方案反馈优化模型算法与系统。 核心工作 1)高质量Benchmark 建设 构建高区分度评测集:针对医疗多专科、复杂对话决策、长链路推理、记忆/一致性、工具使用、RAG 证据依赖等难点设计专项集。 负责评测数据全流程治理,建立数据泄露/污染检测机制,防止评测虚高。 推动“可持续评测”:小样本高敏感集 + 大样本回归集的组合,支撑日常迭代与版本回归。 2)自动化评测框架与裁判模型 建设 设计并落地自动评测框架:支持规则/打分 Rubric、程序化评估(如工具调用/代码)、以及 LLM-as-a-Judge 混合评测,保证高吞吐、低成本、强复现。 构建评测流水线,必要时训练/微调裁判模型或 reward model,用于特定医疗任务下的稳定评判与偏差控制。 3)效果诊断与后训练闭环 系统化归因:针对指令遵循失败、知识缺失/遗忘、逻辑断裂、证据不一致、幻觉模式、拒答策略不当、工具调用失败等,形成可行动的归因方案。 将诊断结论转化为训练策略:SFT 数据补齐、偏好数据/对比数据构造、DPO/RLHF 奖励设计、课程学习与难度采样等,推动模型持续提升。 建立线上/离线一致性验证:离线评测与线上关键指标(安全风险、满意度、转化等)关联分析,持续校准评测有效性。 4)评测体系与指标方法论 建设 设计并迭代覆盖多维能力的评测体系:通用能力、医疗专业能力、安全合规及稳健性等。 建立可对标的指标体系与实验规范:采样策略、置信区间、显著性检验、多重比较校正等,确保评测结论可信、可复验、可解释。 输出高信度评测报告:不仅给分数,更给差距来源、风险等级、上线门槛与下一步改进优先级。 5)前沿评测研究与复杂场景评估 设计 跟进并复现业界评测与框架:HELM、lm-evaluation-harness 等;对标 MMLU、GSM8K、HumanEval/MBPP、C-Eval/CMMLU、AGIEval 等,形成内部可持续对标体系。 探索复杂场景评测:Agent 多步任务成功率、RAG 的证据忠实性与引用正确性、长上下文一致性、跨轮对话稳定性等,并推动工程化落地。