Table 6.

A summary of attacks and defenses for VLMs

Attack/DefenseMethodYearCategorySubcategoryTarget modelsDatasets
Adversarial AttackCaption Attack (Schlarmann and Hein, 2023)2023White-boxTask-specific+VOpenFlamingoMS-COCO/Flickr30k/OK-VQA/VizWiz
VisBreaker (Cui et al., 2024b)2023White-boxTask-specific+VLLaVA/BLIP-2/ InstructBLIPMS-COCO/VQA V2/ScienceQA-Image/TextVQA/ POPE/MME
CroPA (Luo et al., 2024a)2024White-boxCross-prompt+VLOpenFlamingo/ BLIP-2/ InstructBLIPMS-COCO/VQA-v2
GroundBreaker (Gao et al., 2024b)2024White-boxTask-specific+VMiniGPT-v2RefCOCO/RefCOCO+/ RefCOCOg
Stop-reasoning Attack (Wang et al., 2024r)2024White-boxCoT attack+VMiniGPT-4/ OpenFlamingo/ LLaVAScienceQA/A-OKVQA
InstructTA (Wang et al., 2023b)2023Gray-boxEncoder attack+VBLIP-2/ InstructBLIP/ MiniGPT-4/LLaVA/CogVLMImageNet-1K/LLaVA-Instruct-150K/MS-COCO
Attack Bard (Dong et al., 2023)2023Black-boxTransfer-based+VBard/GPT-4V/Bing Chat/ERNIE BotNeurIPS’17 adversarial competition dataset
AttackVLM (Zhao et al., 2024f)2024Black-boxTransfer-based+VBLIP/UniDiffuser/ Img2Prompt/BLIP-2/LLaVA/MiniGPT-4ImageNet-1K/MS-COCO
DynVLA (Gu et al., 2025)2025Black-boxTransfer-based+VLInstructBLIP/MiniGPT4/ LLaVA/GeminiMS-COCO/VQA-v2
AdvDiffVLM (Guo et al., 2024b)2024Black-boxGenerator-based+VMiniGPT-4/LLaVA/UniDiffuser/MiniGPT-4/BLIP/BLIP-2/Img2LLMNeurIPS’17 adversarial competition dataset/MS-COCO
AnyAttack (Zhang et al., 2024j)2024Black-boxGenerator-based+VCLIP/BLIP/BLIP2/ InstructBLIP/ MiniGPT-4MSCOCO/Flickr30K/ SNLI-VE
CAVALRY-V (Zhang et al., 2025d)2025Black-boxGenerator-based+VGPT-4.1/Gemini/ QwenVL/InternVL/ LLaVA/Aria/ MiniCPMMMBench-Video/Video-MME
Latency-Energy AttackVerbose Images (Gao et al., 2024c)2024White-boxTask-specific+VBLIP/BLIP2/ InstructBLIP/ MiniGPT-4MS-COCO/ImageNet
Jailbreak AttackImage Hijack (Bailey et al., 2023)2023White-boxTarget-specific+VLLaVAAlpaca training set/AdvBench
Adversarial Alignment Attack (Carlini et al., 2024b)2024White-boxTarget-specific+VMiniGPT-4/LLaVA/LLaMA Adaptertoxic phrase dataset
VAJM (Qi et al., 2024a)2024White-boxUniversal attack+VMiniGPT-4/LLaVA/ InstructBLIPVAJM training set/ VAJM test set/ RealToxicityPrompts
imgJP (Niu et al., 2024)2024White-boxUniversal attack+VMiniGPT-4/MiniGPT-v2/LLaVA/InstructBLIP/mPLUG-Owl2AdvBench-M
UMK (Wang et al., 2024i)2024White-boxUniversal attack+VLMiniGPT-4AdvBench/VAJM training set/VAJM test set/ RealToxicityPrompts
HADES (Li et al., 2024u)2024White-boxHybrid method+VLLaVA/GPT-4V/Gemini-Pro-VisionHADES dataset
Jailbreak in Pieces (Shayegani et al., 2023)2023Black-boxTransfer-based+VLlaVA /LLaMA-Adapter V2Jailbreak in Pieces dataset
Figstep (Gong et al., 2025)2023Black-boxManual pipeline+VLLaVA-v1.5/MiniGPT-4/CogVLM/GPT-4VSafeBench
SASP (Wu et al., 2023)2023Black-boxPrompt leakage+LLLaVA/GPT-4VCelebrity face image dataset/CelebA/LFWA
VRP (Ma et al., 2024b)2024Black-boxManual pipeline+VLLaVA/Qwen-VL-Chat/ OmniLMM /InternVL Chat-V1.5/Gemini-Pro-VisionRedTeam-2k/HarmBench
HIMRD (Teng et al., 2024)2024Black-boxManual pipeline+VLLLaVA/DeepSeek/ GPT-4o/Gemini/ Qwen-VLSafeBench/tiny-SafeBench
IDEATOR (Wang et al., 2025c)2025Black-boxRed teaming+VLLLaVA/InstructBLIP/MiniGPT-4AdvBench/VAJM test set
Prompt Injection AttackAdversarial Prompt Injection (Bagdasaryan et al., 2023a)2023White-boxOptimization-based+VLLaVA/PandaGPTSelf-collected dataset
Typographic Attack (Qraitem et al., 2024)2024Black-boxTypography-based+VLLaVA/MiniGPT4/ InstructBLIP/GPT-4VOxfordPets / StanfordCars / Flowers / Aircraft / Food101
Backdoor & Poisoning AttackShadowcast (Xu et al., 2024f)2024PoisoningTuning-stage+VLLLaVA/MiniGPT-v2/InstructBLIPcc-sbu-align dataset
Instruction-Tuned Backdoor (Liang et al., 2024a)2024BackdoorTuning-stage+VLOpenFlamingo/BLIP-2/LLaVAMIMIC-IT/COCO/Flickr30K
Anydoor (Lu et al., 2024a)2024BackdoorTesting-stage+VLLLaVA/MiniGPT-4/InstructBLIP/BLIP-2VQAv2/SVIT/DALL-E dataset
BadVLMDriver (Ni et al., 2024)2024BackdoorTuning-stage+VLLaVA/MiniGPT-4nuScenes dataset
ImgTrojan (Tao et al., 2024)2024BackdoorTuning-stage+VLLLaVALAION
Jailbreak DefensesJailGuard (Zhang et al., 2023f)2023DetectionDetection+VLGPT-3.5/MiniGPT-4Self-collected dataset
GuardMM (Sharma et al., 2024a)2024DetectionDetection+VGPT-4V/LLAVA/MINIGPT-4Self-collected dataset
AdaShield (Wang et al., 2024p)2024PreventionPrevention+VLLaVA/CogVLM/MiniGPT-v2Figstep/QR
MLLM-Protector (Pi et al., 2024)2024PreventionD+P+VOpen-LLaMA/LLaMA/LLaVASafe-Harm-10K
ECSO (Gou et al., 2024)2024PreventionPrevention+VLLaVA/ShareGPT4V/mPLUG-OWL2/Qwen-VL-Chat/InternLM-XComposerMM-SafetyBench/VLSafe/ VLGuard
InferAligner (Wang et al., 2024h)2024PreventionPrevention+VLLLaMA2/LLaVAAdvBench/TruthfulQA/ MM-Harmful Bench
BlueSuffix (Zhao et al., 2025)2024PreventionPrevention+VLLLaVA/MiniGPT-4/GeminiMM-SafetyBench/RedTeam-2k
DPS (Zhou et al., 2025d)2025PreventionPrevention+VQwen-VL-Plus/GPT-4o/Gemini-1.5-FlashRTA-100/MultiTrust/Self-Gen/MM-SafetyBench/HADES/ VisualAttack
ETA (Ding et al., 2025a)2025PreventionPrevention+VLLLaVA/InternVL/InternLM-XComposer/LLaMA3.2-VisionSPA-VL/MM-SafetyBench/FigStep

or Create an Account

Close Modal
Close Modal