研究

GateBreaker:我们针对混合专家大模型安全对齐的攻击研究被USENIX Security 2026录用

过去的安全研究大多针对稠密模型。我们发现,混合专家(MoE)模型的安全机制集中在一小部分被路由到的专家中,而这一结构本身就可以被直接攻击。

← 返回研究

我们的论文《GateBreaker: Gate-Guided Attacks on Mixture-of-Expert LLMs》被USENIX Security 2026录用,这是计算机安全领域的顶级会议之一。这项研究由Sentinel Assurance联合创始人Lichao Wu,与达姆施塔特工业大学的Sasha Behrouzi、Mohamadreza Rostami、Ahmad-Reza Sadeghi,以及萨格勒布大学与拉德堡德大学的Stjepan Picek共同完成。

GateBreaker做了什么

混合专家(MoE)模型通过为每次输入仅激活一小部分参数来实现规模扩展,这也改变了安全机制在模型内部的存在方式。GateBreaker是首个专门针对这一结构设计的免训练攻击框架。它分三个阶段完成:找到有害提示词会被过度路由到的"安全专家",定位这些专家内部的安全结构,然后将其关闭。

  • 免训练、轻量级、与架构无关,无需任何微调。
  • 在目标专家层中最多关闭2.9%的神经元,就能让8个最新的对齐MoE模型的平均攻击成功率从7.4%提升到64.9%。
  • 这些安全神经元可以在同一模型家族内迁移:一次性迁移攻击的成功率达到67.7%。
  • 该方法同样适用于视觉语言MoE模型,在5个模型上针对不安全图像输入的成功率达到60.9%。
  • 即使关闭了目标神经元,模型的可用性下降也十分有限。

迁移能力这一点最值得关注。如果一个MoE模型的安全弱点能够预示同一家族其他模型的弱点,那么只测试单个模型版本就宣称整个家族安全,是远远不够的。

我们的看法

混合专家(MoE)正在迅速成为前沿模型的默认架构,而大多数安全工具仍是为上一代架构打造的。这样的研究结果提醒我们,新架构可能带来新的失效模式,一项技术在上一代模型上有效,并不能保证它在新一代模型上依然成立。这正是独立的、部署前验证所要在Agent被赋予真实权限之前发现的那类问题。

想和研究团队聊聊?

我们很乐意分享Sentinel背后的研究工作,或探讨它如何应用于你的AI Agent。