
文章主要内容和创新点主要内容本文聚焦于多模态大型语言模型(MLLMs)的越狱攻击问题,旨在解决现有攻击方法中“成功绕过安全机制但生成的响应无法真正满足攻击者恶意意图”的核心缺陷。现有方法虽能通过文本、图像或跨模态手段实现越狱(攻击成功率,ASR 较高),但常出现“指令遵循失败”(如未按要求提供步骤指南)或“内容有害性不足”(如建议不可行或无效)等问题。为此,本文提出JPS(Jailbreak via collaborative visual Perturbation and textual Steering)方法:视觉扰动:通过目标导向的对抗性图像扰动,高效绕过 MLLMs 的安全机制;文本引导:利用多智能体系统(Judger、Summarizer、Revisor)优化“引导提示”,精准控制响应质量,确保满足恶意意图;迭代协同优化:视觉和文本组件通过多轮迭代协同优化,提升攻击效果。同时,本文提出MIFR(Malicious Intent Fulfillment Rate,恶意意图满足率)指标,通过基于推理 LLM 的评估管道,从攻击者视角衡量响应是否真正满足恶意意图。实验表明,JPS 在多个 MLLMs 和基准数据集(如 MM-SafetyBench、HarmBench)上的 ASR 和 MIFR 均达到当前最优水平。