Table 7.

Safety and robustness benchmarks for VLMs

BenchmarksYearSize# VLMs evaluated
OODCV-VQA (Tu et al., 2024)20234,24421
Sketchy-VQA (Tu et al., 2024)20234,00021
MM-SafetyBench (Liu et al., 2024k)20235,04012
AVIBench (Zhang et al., 2024g)2024260,00014
Jailbreak Evaluation of GPT-4o (Ying et al., 2024)20244,1801
JailBreakV-28K (Luo et al., 2024c)202428,00010
MIS (Ding et al., 2025b)20256,18514
VLJailbreakBench (Wang et al., 2025c)20253,65411
Argus Inspection (Yao et al., 2025)20251,43026

or Create an Account

Close Modal
Close Modal