logo of alibaba

阿里巴巴数据技术及产品部-大模型安全对抗专家-杭州

社招全职2年以上技术类-安全地点:杭州状态:招聘

任职要求


1.计算机、网络安全、人工智能等相关专业硕士及以上学历,具备扎实的大模型安全、AI对抗样本、密码学或传统Web安全背景,拥有成熟的模型红队测试或对齐算法落地经验。
2.熟练掌握PyTorch深度学习框架,在Transformer架构、大模型微调(PEFT/SFT)、RLHF/DPO对齐、强化学习等至少一个领域有深入的算法落地经验。
3.熟悉大模型主流安全漏洞与绕过机制,有基于LLM-as-a-Judge的安全评估框架研发经历,或熟悉多模态对抗样本生成、黑盒/白盒对抗攻击算法者优先。
4.具备优秀的数学建…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1.主导集团大模型安全与对抗防御体系的构建:结合多模态、Agent、具身智能等前沿业务场景,负责大模型全链路(预训练数据防投毒/SFT对齐/RLHF/推理部署)的安全对抗演练、漏洞挖掘及红蓝对抗算法优化。
2.负责构建基于多模态与Agentic的自动化红队攻击体系:设计并研发基于强化学习、进化算法或多Agent协同的自动化越狱、提示词注入和对抗性扰动生成算法,实现对多模态模型的高并发、深层次安全边界压力测试。
3.负责大模型安全对齐与安全护栏算法的研发:研究并落地基于RLAIF、DPO、KTO等前沿对齐技术;设计并迭代高性能、低延迟的输入/输出内容安全过滤模型与多维风险评估机制,保障生成内容符合安全合规标准。
4.负责攻克大模型深层漏洞与新型威胁防御:针对间接提示词注入、数据投毒、偏好劫持及版权/隐私泄露等高阶安全威胁,研发对应的算法检测器与鲁棒性增强方案。
5.主导自动化对抗消融实验与防御价值验证闭环:设计高精度、轻量化的多维安全评测Benchmark与自动化对抗博弈平台,通过算子智能编排实现7*24H的“攻击自动生成-防御实时阻断-模型快速微调”的安全对抗迭代闭环。
包括英文材料
学历+
大模型+
Web+
算法+
PyTorch+
深度学习+
Transformer+
SFT+
RLHF+
还有更多 •••
相关职位

logo of alibaba
社招3年以上技术类-数据

1. 设计大模型推理(reasoning trace / CoT blob)的加密与隐私保护方案,覆盖密钥管理(per-user / per-session 密钥体系)、加密协议选型、防重放机制设计。 2. 防御机制拆解: 跟踪国内外主流模型的安全策略,通过实验分析其在内容过滤、逻辑保护方面的实现路径。 3. 安全围栏建设: 构建覆盖 Prompt Injection、Tool Abuse、模型滥用、越权访问、数据泄露等AI 风险的纵深防御能力 4. 反蒸馏技术落地: 协助落地基础的防爬取、模型输出干扰等风控方案,保护公司模型资产。 5. 跨团队协作: 与算法团队配合,将发现的安全漏洞转化为模型微调或强化学习的训练样本,并实验验证效果。 6. 系统化:建设企业级安全风险感知体系,持续发现业务及 AI 系统安全风险。推动AI安全能力平台化、产品化,为AI开发提供统一、安全、易用的基础能力。

更新于 2026-07-14杭州
logo of alibaba
社招2年以上技术类-算法

1、负责Agentic大模型相关算法开发与优化,开发性能达到业界sota的Agentic大模型并能在实际业务场景中应用落地 2、针对Agentic模型的训练特点,探索Agentic数据的合成策略与后训练数据配比策略,探索稳定高效的Agentic RL 方案,持续迭代模型在Agent场景的应用性能 3、探索创新Agentic RL算法,撰写发表创新论文或技术报告,参与模型开源,和社区、学术界保持良好的交流。

更新于 2026-07-24北京|杭州
logo of alibaba
社招3年以上

1.在阿里集团语音大模型及相关业务场景下,参与输出侧与系统级交互评测路线图的执行落地,负责所属方向在组件级、系统级、产品能力三个层次的体系建设; 2.设计新型评测方法论,将模糊的音质感知、交互体验、对抗鲁棒性等维度转化为可标注、可量化、可复现的指标体系;并参与产品能力评测的具体落地,为业务场景实现场景化 Profile; 3.构建高吞吐量评测基础设施,把单次评测从手工脚本变成可调用的研究工具,支持模型团队的高频迭代节奏; 4.分析评测结果并归因模型缺陷,将技术发现转化为模型团队可执行的改进建议; 5.设计对抗性测试(红队测试),构建高质量评测数据集,并设计防数据泄露与防刷分机制,系统性发现模型边界 case; 6.定期独立横评所属方向的竞品语音能力,跟踪行业进展;参与方法论研究并产出顶级会议论文(ICASSP / Interspeech / ACL 等); 7.示例研究方向(任选其一深入负责):(1) TTS / 语音克隆方向——建立自然度、韵律多样性、中文声调多音字专项等评测方法论;(2) 系统级语音交互方向——建立延迟、全双工、打断、多轮记忆、情感、安全等评测方法论,含模拟用户测试与中文适配。

更新于 2026-07-20北京|杭州
logo of alibaba
社招3年以上技术类-数据

1. 标注规范与数据设计:负责主导 Code 方向标注规范的制定与持续迭代,覆盖代码生成、代码补全、debug、代码解释、代码审查等多类任务;设计 Agentic 场景下的标注框架,包括 multi-step reasoning、tool use、planning、self-correction 等复杂任务链的拆解与评估标准;基于模型表现与研究进展,持续优化标注指南,确保数据质量与训练目标对齐; 2. 数据质量管控:对标注员产出进行专家级审核,重点识别代码逻辑错误、安全漏洞、风格一致性问题;建立 Code / Agentic 数据质量评估体系,定义量化指标并追踪质量趋势;设计并执行标注一致性校验流程(IAA),提升跨标注员的数据稳定性; 3. 标注团队赋能:为标注员提供技术培训,将复杂的代码和 Agent 概念转化为可操作的标注实践;担任技术难题的终极裁判,解决边界案例和歧义问题;参与标注工具需求设计,提升代码标注效率; 4. 探索更科学的评测指标、更高效的评测方法。

更新于 2026-06-10北京|杭州