职位详情
集团安全部-大模型安全架构师 / 资深专家-杭州/北京
25-41.6K
浙江-
不限
不限
更新 2026-07-29 浏览 22
职位详情
  • 招 1 人
  • 不限性别
【工作职责】 作为先进大模型安全体系的核心驱动力,负责构建覆盖 数据-训练-推理-应用 全生命周期的大模型安全防御体系。重点结合评测优先和内生安全等理念,从根本上设计并落地具备安全基因的大 构,对抗提示注入、越狱攻击、数据泄露及滥用等新型AI安全威胁,确保大模型在高风险业务场景下的可信、可控与合规。 【核心职责】 1. 安全评测体系建设 ● 主导构建面向大模型和智能体(LLM/VLM/Agent)的多维度、自动化安全评测平台,覆盖鲁棒性、合规性、偏见歧视、隐私保护、有害内容生成等关键维度 ● 设计并维护动态更新的对抗性测试集与红队(Red Teaming)攻击库,包括但不限于提示注入、越狱攻击、多轮对话诱导等高级攻击手法 ● 研究前沿性AI的风险滥用和失控问题,例如CBRN、伦理、多智能体失控、AI发展提升网络攻击威胁等问题并进行科学和有效的检测度量 ● 建立客观、可量化的安全评分体系及安全等级认证标准,支撑模型上线准入、灰度发布及持续监控。跟踪前沿对抗攻击与防御技术,定期组织针对内部模型的实战对抗演练 2. 内生安全机制设计 ● 从架构层面推动 安全左移 ,将安全机制内生融入模型预训练、微调(SFT/RLHF)、检索增强生成(RAG)及智能体(Agent)等环节。 ● 研发并落地可插拔的安全对齐技术,如指令鲁棒性增强、安全向量控制、动态系统提示词硬化、自我反思(Self-Correction)机制等。设计针对模型参数、中间激活及梯度的安全检测和隐私保 案等 ● 探索可解释性安全方法,构建模型决策的内部监控与预警机制,实现安全风险的早期发现与自动响应 3. 标准制定与生态合作 ● 主导或参与阿里巴巴在制定企业级大模型安全开发规范、评测标准等方面的工作 ● 代表阿里巴巴参与国内外AI安全标准组织的研讨与标准制定。 ● 建立与学界、业界安全社区的联动机制,持续引入前沿攻击防御技术,输出安全白皮书或专利 【任职要求】 1. 基础能力 ● 硕士及以上学历,计算机、信息安全、人工智能等相关专业,博士优先。5年以上安全或AI领域研发或研究经验,近期经历专注大模型/生成式AI安全 ● 精通大模型技术栈(Transformer架构、RLHF、PEFT、RAG、Agent) ● 深入理解对抗机器学习、差分隐私、鲁棒优化、安全对齐、因果与可解释性等核心安全理论 2. 专业能力 ● 评测方向: 精通主流大模型安全评测基准(如SafetyBench, Do-Not-Answer, AdvBench等),并有自主构建高覆盖度、高难度评测集的实际项目经验 ● 攻防方向: 熟练掌握提示注入、越狱、后门攻击等攻击原理,并能设计有效的防御策略(如输入过滤、输出检测、模型硬化等) ● 对齐方向: 对 安全-性能平衡 有深刻洞见,具备在模型训练或推理阶段无损或低损植入安全机制的成功案例 ● 工程能力: 扎实的编程能力(Python/C++),熟悉PyTorch/TensorFlow;有大规模分布式训练或推理服务(vLLM, TensorRT-LLM)性能调优经验者优先 3. 亮点与加分项 ● 在顶级安全/AI会议(S&P, CCS, USENIX Security, NeurIPS, ICML, ACL)上发表过多篇大模型安全相关论文 ● 主导过国家级或行业级AI安全攻防竞赛并取得优异成绩,或相关产品和项目获得国内国际同行的认可 ● 拥有大模型安全相关专利或开源项目核心贡献,关键标准的核心贡献者
公司信息
阿里巴巴(中国)网络技术有限公司
10000人以上 · · 计算机/互联网
杭州总公司
职介网温馨提示
求职过程请勿缴纳费用,谨防诈骗!若信息不实请举报。 立即举报
公司问答
我要提问
对此职位有疑问?快来问问吧 !
相似职位
客户经理
8.3-15K
北京- 本科学历
五险一金 综合补贴 年终奖金 奖励计划 销售奖金 休假制度
中信证券股份有限公司
2026-08-24
半导体设备销售经理
6-10K
天津- 大专学历
众望金石(天津)自动化科技有限公司
2026-08-24
外贸营销总监
12-24K
重庆-重庆 本科学历 1年以上经验
重庆黄河摩托车有限公司
2026-08-24
区域销售经理(装企渠道)
8-12K
重庆-重庆 大专学历
重庆美心蒙迪门业制造有限公司
2026-08-04