Table 3.

A summary of attacks and defenses for LLMs

Attack/DefenseMethodYearCategorySubcategoryTarget modelsDatasets
Adversarial AttackBad characters (Boucher et al., 2022)2022White-boxCharacter-levelFairseq EN-FR, Perspective APIEmotion, Wikipedia Detox, CoNLL-2003
TextFooler (Jin et al., 2020)2020White-boxWord-levelWordCNN, WordLSTM, BERT, InferSent, ESIMAG’s News, Fake News, MR, IMDB, Yelp, SNLI, MultiNLI
BERT-ATTACK (Li et al., 2020)2020White-boxWord-levelBERT, WordLSTM, ESIMAG’s News, Fake News, IMDB, Yelp, SNLI, MultiNLI
GBDA (Guo et al., 2021)2021White-boxWord-levelGPT-2, XLM, BERTDBPedia, AG’s News, Yelp Reviews, IMDB, MultiNLI
Breaking-BERT (Dirkson et al., 2021)2021White-boxWord-levelBERTCoNLL-2003, W-NUT 2017, BC5CDR, NCBI disease corpus
Gradobstinate (Wang et al., 2023c)2023White-boxWord-levelElectra, ALBERT, DistillBERT, RoBERTaSNLI, MRPC, SQuAD, SST-2, MSCOCO
Liu et al. (2023c)2023White-boxWord-levelBERT, RoBERTaOnline Shopping 10 Cats, Chinanews
advICL (Wang et al., 2023a)2023Black-boxSentence-levelGPT-2-XL, LLaMA-7B, Vicuna-7BSST-2, RTE, TREC, DBpedia
Liu et al. (2023a)2023Black-boxSentence-levelRoBERTaReal conversation data
Koleva et al. (2023) 2023Black-boxSentence-levelTURLWikiTables
Adversarial DefenseJain et al. (2023) 2023Adversarial DetectionInput FilteringGuanaco-7B, Vicuna-7B, Falcon-7BAlpacaEval
Erase-and-Check (Kumar et al., 2023)2023Adversarial DetectionInput FilteringLLaMA-2, DistilBERTAdvBench
Zou et al. (2024a)2024Robust InferenceCircuit BreakingMistral-7B, LLaMA-3-8BHarmBench
Jailbreak AttackYong et al. (2023) 2023Black-boxHand-craftedGPT-4AdvBench
CipherChat (Yuan et al., 2023a)2023Black-boxHand-craftedGPT-3.5, GPT-4Chinese safety assessment benchmark
Jailbroken (Wei et al., 2024)2023Black-boxHand-craftedGPT-4, GPT-3.5, Claude-1.3Self-built
Li et al. (2024h)2024Black-boxHand-craftedGPT-3.5, GPT-4, Vicuna-1.3-7B, 13B, Vicuna-1.5-7B, 13BSelf-built
Easyjailbreak (Zhou et al., 2024e)2024Black-boxHand-craftedGPT-3.5, GPT-4, LLaMA-2-7B, 13B, Vicuna-1.5-7B, 13B, ChatGLM3, Qwen-7B, InternLM-7B, Mistral-7BAdvBench
SMEA (Zou et al., 2024c)2024Black-boxHand-craftedGPT-3.5, LLaMA-2-7B, 13B, Vicuna-7B, 13BSelf-built
Tastle (Xiao et al., 2024)2024Black-boxHand-craftedVicuna-1.5-13B, LLaMA-2-7B, GPT-3.5, GPT-4AdvBench
StructuralSleight (Li et al., 2024a)2024Black-boxHand-craftedGPT-3.5, GPT-4, GPT-4o, LLaMA-3-70B, Claude-2, Cluade3-OpusAdvBench
CodeChameleon (Lv et al., 2024)2024Black-boxHand-craftedLLaMA-2-7B, 13B, 70B, Vicuna-1.5-7B, 13B, GPT-3.5, GPT-4AdvBench, MaliciousInstruct, ShadowAlignment
Puzzler (Chang et al., 2024)2024Black-boxHand-craftedGPT-3.5, GPT-4, GPT4-Turbo, Gemini-pro, LLaMA-2-7B, 13BAdvBench, MaliciousInstructions
Wen et al. (2025b)2025Black-boxHand-craftedGPT-3.5, 4, Mistral-v0.3, LLaMA-3BUMBLE benchmark
ABJ (Lin et al., 2024b)2024Black-boxHand-craftedGPT-4o, Claude-3-haiku, LLaMA-3-8B, Qwen-2.5-7B, DeepSeek-V3AdvBench
Shen et al. (2024a)2024Black-boxHand-craftedGPT-3.5, GPT-4, PaLM-2, ChatGLM, Dolly, VicunaIn-The-Wild Jailbreak Prompts
AutoDAN (Liu et al., 2024l)2023Black-boxAutomatedVicuna-7B, Guanaco-7B, LLaMA-2-7BAdvBench
Jailbreak AttackI-FSJ (Zheng et al., 2024)2024Black-boxAutomatedLLaMA-2, LLaMA-3, OpenChat-3.5, Starling-LM, Qwen-1.5JailbreakBench
Weak-to-Strong (Zhao et al., 2024e)2024Black-boxAutomatedLLaMA2-13B, Vicuna-13B, Baichuan2-13B, InternLM-20BAdvBench, MaliciousInstruct
GPTFuzzer (Yu et al., 2023a)2023Black-boxAutomatedVicuna-13B, Baichuan-13B, ChatGLM-2-6B, LLaMA-2-13B, 70B, GPT-4, Bard, Claude-2, PaLM-2Self-built
PAIR (Chao et al., 2023)2023Black-boxAutomatedVicuna-1.5-13B, LLaMA-2-7B, GPT-3.5, GPT-4, Claude-1, Claude-2, Gemini-proJBB-Behaviors, AdvBench
Masterkey (Deng et al., 2024a)2023Black-boxAutomatedGPT-3.5, GPT-4, Bard, Bing ChatSelf-built
BOOST (Yu et al., 2024a)2024Black-boxAutomatedLLaMA-2-7B, 13B, Gemma-2B, 7B, Tulu-2-7B, 13B, Mistral-7B, MPT-7B, Qwen1.5-7B, Vicuna-7B, LLaMA-3-8BAdvBench
FuzzLLM (Yao et al., 2024a)2024Black-boxAutomatedVicuna-13B, CAMEL-13B, LLaMA-7B, ChatGLM-2-6B, Bloom-7B, LongChat-7B, GPT-3.5, GPT-4Self-built
EnJa (Zhang et al., 2024h)2024Black-boxAutomatedVicuna-7B, 13B, LLaMA-2-13B, GPT-3.5, 4AdvBench
Perez et al. (2022) 2022Black-boxAutomatedGopher LMSelf-built
CRT (Hong et al., 2024b)2024Black-boxAutomatedGPT-2, Dolly-v2-7B, LLaMA-2-7BIMDb
ECLIPSE (Jiang et al., 2024b)2024Black-boxAutomatedVicuna-7B, LLaMA2-7B, Falcon-7B, GPT-3.5AdvBench
GCG (Zou et al., 2023)2023White-boxAutomatedVicuna-7B, LLaMA-2-7B, GPT-3.5, GPT-4, PaLM-2, Claude-2AdvBench
I-GCG (Jia et al., 2024b)2024White-boxAutomatedVicuna-7B-1.5, Guanaco-7B, LLaMA2-7B, MISTRAL-7BAdvBench
POUGH (Huang et al., 2025e)2024White-boxAutomatedVicuna, Mistral, GuanacoAlpaca dataset
Qi et al. (2023) 2023White-boxFine-tuningGPT-3.5-Turbo, LLaMA-2-7B-Chat
Virus (Huang et al., 2025c)2025White-boxFine-tuningLLaMA-3-8BSST2, AgNews, GSM8K
Jailbreak DefenseSmoothLLM (Robey et al., 2023)2023Input DefenseRephrasingVicuna, LLaMA-2, GPT-3.5, GPT-4AdvBench, JBB-Behaviors
SemanticSmooth (Ji et al., 2024)2024Input DefenseRephrasingLLaMA-2-7B, Vicuna-13B, GPT-3.5InstructionFollow, AlpacaEval
SelfDefend (Wang et al., 2024l)2024Input DefenseRephrasingGPT-3.5, GPT-4JailbreakHub, JailbreakBench, MultiJail, AlpacaEval
IBProtector (Liu et al., 2024v)2024Input DefenseRephrasingLLaMA-2-7B, Vicuna-1.5-13BAdvBench, TriviaQA, EasyJailbreak
PEARL (Liang et al., 2025b)2025Input DefenseRephrasingLLaMA-3-8B, LLaMA-2-7B,13B, Mistral-7B, Gemma-7BSuper-Natural Instructions
VAA (Liang et al., 2025a)2025Input DefenseRephrasingLLaMA-2-7B, Qwen-2.5-7BSST2, AGNEWS, GSM8K, AlpacaEval
Backtranslation (Wang et al., 2024n)2024Input DefenseTranslationGPT-3.5, LLaMA-2-13B, Vicuna-13BAdvBench, MT-Bench
RTT (Yung et al., 2025a)2025Input DefenseTranslationVicunna, GPT-4, LLaMA-2, Palm-2AdvBench
CurvaLID (Yung et al., 2025b)2025Input DefenseFilteringUniversalOrca, MMLU, AlpacaEval, TruthfulQA, AdvBench
Jailbreak DefenseAPS (Kim et al., 2024b)2023Output DefenseFilteringVicuna, Falcon, GuanacoAdvBench
DPP (Xiong et al., 2024)2024Output DefenseFilteringLLaMA-2-7B, Mistral-7BAdvBench
Gradient Cuff (Hu et al., 2024c)2024Output DefenseFilteringLLaMA-2-7B, Vicuna-1.5-7BAdvBench
LEGILIMENS (Wu et al., 2024e)2024Output DefenseFilteringChatGLM-3, LLaMA-2, Falcon, Dolly, VicunaMeasuring Hate Speech, BeaverTails, BEA&AG, HarmBench, AdvBench
ABD (Gao et al., 2025)2024Robust InferenceActivation BoundaryLLaMA-2-7B-Chat, Vicuna-7B-v1.3, Qwen-1.5-0.5B-Chat, Vicuna-13B-v1.5Just-Eval
MTD (Chen et al., 2023a)2023Robust InferenceMulti-model InferenceGPT-3.5, GPT-4, Bard, Claude, LLaMA2-7B, 13B, 70BSelf-built
PARDEN (Zhang et al., 2024y)2024Robust InferenceOutput RepetitionLLaMA-2-7B, Mistral-7B, Claude-2.1PARDEN
AutoDefense (Lu et al., 2024c)2024Ensemble DefenseRephrasing/FilteringGPT-3.5-turbo, GPT-4, LLaMA-2, LLaMA-3, Mistral, Qwen, VicunaSelf-built
MoGU (Du et al., 2024b)2024Ensemble DefenseRephrasing/FilteringLLaMA-2-7B, Vicuna-7B, Falcon-7B, Dolphin-7BAdvbench
Vaccine (Huang et al., 2024g)2024Defenses against Fine-tuning AttacksAlignment StageLLaMA-2-7B, Opt-3.7B, Mistral-7BBeaverTails, SST2, AGNEWS, GSM8K, AlpacaEval
T-Vaccine (Liu et al., 2024e)2025Defenses against Fine-tuning AttacksAlignment StageGemma-2-2B, LLaMA-2-7B, Vicuna-7B, Qwen2-7BSST2, GSM8K, AGNEWS
Booster (Huang et al., 2024f)2025Defenses against Fine-tuningLLaMA2-7B, Gemma2-9B, Qwen2-7BSST2, AGNEWS, GSM8K, AlpacaEval
Lisa (Huang et al., 2024e)2024Defenses against Fine-tuning AttacksFine-tuning StageLLaMA-2-7B, Opt-3.7B, Mistral-7BBeaverTails, SST2, AGNEWS, GSM8K, AlpacaEval
Antidote (Huang et al., 2024d)2024Defenses against Fine-tuning AttacksPost-fine-tuning StageLLaMA-2-7B, Mistral-7B, Gemma-7BSST2, AGNEWS, GSM8K, AlpacaEval
Panacea (Wang et al., 2025g)2025Defenses against Fine-tuning AttacksPost-fine-tuning StageLLaMA-2-7BGSM8K, SST2, AlpacaEval, AGNEWS
Prompt Injection AttackPROMPTINJECT (Perez and Ribeiro, 2022)2022Black-boxHand-craftedtext-davinci-002PromptInject
HOUYI (Liu et al., 2023e)2023Black-boxHand-craftedLLM-integrated applications
Greshake (Greshake et al., 2023)2023Black-boxHand-craftedtext-davinci-003, GPT-4, Codex
Liu et al. (2024t)2024Black-boxHand-craftedPaLM-2-text-bison-001, Flan-UL2, Vicuna-13B, 33B, GPT-3.5-Turbo, GPT-4, LLaMA-2-7B, 13B, Bard, InternLM-7BMRPC, Jfleg, HSOL, RTE, SST2, SMS Spam, Gigaword
Ye et al. (2024b)2024Black-boxHand-craftedGPT-4o, Llama-3.1-70B, DeepSeek-V2.5, Qwen-2.5-72B
Deng et al. (2023) 2023Black-boxAutomatedGPT-3.5, Alpaca-LoRA-7B, 13B
Liu et al. (2024m)2024Black-boxAutomatedLLaMA-2-7bDual-Use, BAD+, SAP
Prompt Injection AttackG2PIA (Zhang et al., 2024b)2024Black-boxAutomatedGPT-3.5, 4, LLaMA2-7B, 13B, 70BGSM8K, web-based QA, MATH, SQuAD
PLeak (Hui et al., 2024)2024Black-boxAutomatedGPT-J-6B, OPT-6.7B, Falcon-7B, LLaMA-2-7B, Vicuna, 50 real-world LLM applications
JudgeDeceiver (Shi et al., 2024)2024Black-boxAutomatedMistral-7B, Openchat-3.5, LLaMA-2-7B, LLaMA-3-8BMT-Bench, LLMBar
PoisonedAlign (Shao et al., 2024c)2024Black-boxAutomatedLLaMA-2-7B, LLaMA-3-8B, Gemma-7B, Falcon-7B, GPT-4o minHH-RLHF, ORCA-DPO
Promptfuzz (Yu et al., 2024b)2025Black-boxAutomatedGPT-3.5-turboTensorTrust
Prompt Injection DefenseStruQ (Chen et al., 2025b)2024Input & Parameter DefenseRephrasing & Fine-tuningLLaMA-7B, Mistral-7BAlpacaFarm
SPML (Sharma et al., 2024b)2024Input DefenseRephrasingGPT-3.5, GPT-4Gandalf, Tensor-Trust
Jatmo (Piet et al., 2023)2023Parameter DefenseFine-tuningtext-davinci-002HackAPrompt
Yi et al. (2023) 2023Parameter DefenseFine-tuningGPT-4, GPT-3.5-Turbo, Vicuna-7B, 13BMT-bench
SecAlign (Chen et al., 2025c)2025Parameter DefenseFine-tuningMistral-7B, LLaMA3-8B, LLaMA-7B, 13B, Yi-1.5-6BAlpacaFarm
Backdoor & Poisoning AttackBadPrompt (Cai et al., 2022)2022Data PoisoningPrompt-levelRoBERTa-large, P-tuning, DARTSST-2, MR, CR, SUBJ, TREC
BITE (Yan et al., 2023)2022Data PoisoningPrompt-levelBERT-BaseSST-2, HateSpeech, TweetEval-Emotion, TREC
PoisonPrompt (Yao et al., 2024b)2023Data PoisoningPrompt-levelBERT, RoBERTa, LLaMA-7BSST-2, IMDb, AG’s News, QQP, QNLI, MNLI
ProAttack (Zhao et al., 2023a)2023Data PoisoningPrompt-levelBERT-large, RoBERTa-large, XLNET-large, GPT-NEO-1.3BSST-2, OLID, AG’s News
Instructions Backdoors (Xu et al., 2024b)2023Data PoisoningPrompt-levelFLAN-T5, LLaMA2, GPT-2SST-2, HateSpeech, Tweet Emo., TREC Coarse
Zhang et al. (2024q)2024Data PoisoningPrompt-levelLLaMA-2-7B, Mistral-7B, Mixtral-8×7B, GPT-3.5, 4, Claude-3SST-2, SMS, AGNews, DBPedia, Amazon
Kandpal et al. (2023) 2023Data PoisoningPrompt-levelGPT-Neo 1.3B, 2.7B, GPT-J-6BSST-2, AG’s News, TREC, DBPedia
BadChain (Xiang et al., 2024b)2024Data PoisoningPrompt-levelGPT-3.5, Llama2, PaLM2, GPT-4GSM8K, MATH, ASDiv, CSQA, StrategyQA, Letter
ICLAttack (Zhao et al., 2024c)2024Data PoisoningPrompt-levelOPT, GPT-NEO, GPT-J, GPT-NEOX, MPT, Falcon, GPT-4SST-2, OLID, AG’s News
Qiang et al. (2024) 2024Data PoisoningPrompt-levelLLaMA2-7B, 13B, Flan-T5-3B, 11BSST-2, RT, Massive
Pathmanathan et al. (2024) 2024Data PoisoningPrompt-levelMistral 7B, LLaMA-2-7B, Gemma-7BAnthropic RLHF
Sleeper Agents (Hubinger et al., 2024)2024Data PoisoningPrompt-levelClaudeHHH
ICLPoison (He et al., 2024)2024Data PoisoningPrompt-levelLLaMA-2-7B, Pythia-2.8B, 6.9B, Falcon-7B, GPT-J-6B, MPT-7B, GPT-3.5, GPT-4SST-2, Cola, Emo, AG’s news, Poem Sentiment
Zhang et al. (2024p)2024Data PoisoningPrompt-levelLLaMA-2-7B, 13B, Mistral-7B
Codebreaker (YAN et al., 2024)2024Data PoisoningPrompt-levelCodeGenSelf-built
Backdoor & Poisoning AttackCBA (Huang et al., 2024b)2023Data PoisoningMulti-triggerLLaMA-7B, LLaMA2-7B, OPT-6.7B, GPT-J-6B, BLOOM-7BAlpaca Instruction, Twitter Hate Speech Detection, Emotion, LLaVA Visual Instruct 150K, VQAv2
Gu et al. (2023a)2023Training ManipulationPrompt-levelBERTSST-2, IMDB, Enron, Lingspam
TrojLLM (Xue et al., 2024b)2024Training ManipulationPrompt-levelBERT-large, DeBERTa-large, RoBERTa-large, GPT-2-large, LLaMA-2, GPT-J, GPT-3.5, GPT-4SST-2, MR, CR, Subj, AG’s News
VPI (Yan et al., 2024a)2024Training ManipulationPrompt-levelAlpaca-7B
BadEdit (Li et al., 2024t)2024Parameter ModificationWeight-levelGPT-2-XL-1.5B, GPT-J-6BSST-2, AG’s News
Uncertainty Backdoor Attack (Zeng et al., 2024a)2024Training ManipulationPrompt-levelQWen2-7B, LLaMa3-8B, Mistral-7B, Yi-34BMMLU, CosmosQA, HellaSwag, HaluDial, HaluSum, CNN/Daily Mail.
Backdoor & Poisoning DefenseIMBERT (He et al., 2023b)2023Backdoor DetectionSample DetectionBERT, RoBERTa, ELECTRASST-2, OLID, AG’s News
AttDef (Li et al., 2023b)2023Backdoor DetectionSample DetectionBERT, TextCNNSST-2, OLID, AG’s News, IMDB
SCA (Sun et al., 2023b)2023Backdoor DetectionSample DetectionTransformer-base backboneSelf-built
ParaFuzz (Yan et al., 2024b)2024Backdoor DetectionSample DetectionGPT-2, DistilBERTTrojAI, SST-2, AG’s News
MDP (Xi et al., 2024)2024Backdoor DetectionSample DetectionRoBERTa-largeSST-2, MR, CR, SUBJ, TREC
BEAT (Yi et al., 2025)2025Backdoor DetectionSample DetectionLLaMA-3.1-8B, Mistral-7B, GPT-3.5-turbo, LLaMA-2-7BAdvBench, MaliciousInstruct
PCP Ablation (Lamparth and Reuel, 2024)2024Backdoor RemovalPruningGPT-2 MediumBookcorpus
SANDE (Li et al., 2024f)2024Backdoor RemovalFine-tuningLLaMA-2-7B, Qwen-1.5-4BMMLU, ARC
BEEAR (Zeng et al., 2024b)2024Backdoor RemovalFine-tuningLLaMA-2-7B, Mistral-7BAdvBench
CROW (Min et al., 2024a)2024Backdoor RemovalFine-tuningLLaMA-2-7B, 13B, CodeLlama-7B, 13B, Mistral-7BStanford Alpaca, HumanEval
Honeypot Defense (Tang et al., 2023a)2023Robust TrainingAnti-backdoor LearningBERT, RoBERTaSST-2, IMDB, OLID
Liu et al. (2023g)2023Robust TrainingAnti-backdoor LearningBERTSST-2, AG’s News
PoisonShare (Tong et al., 2024)2024Robust InferenceContrastive DecodingMistral-7B, LLaMA-3-8BUltrachat-200k
CleanGen (Li et al., 2024z)2024Robust InferenceContrastive DecodingAlpaca-7B, Alpaca-2-7B, Vicuna-7BMT-bench
Li et al. (2024p)2024Robust InferenceContrastive DecodingLLaMA-2, Pythia
BMC (Wang et al., 2024u)2024Robust TrainingAnti-backdoor LearningBERT, DistilBERT, RoBERTa, ALBERTSST-2, HSOL, AG’s News
AlignmentRLHF (Christiano et al., 2017)2017Human FeedbackPPOMuJoCo, ArcadeOpenAI Gym
Ziegler et al. (2019) 2019Human FeedbackPPOGPT-2CNN/Daily Mail, TL;DR
Ouyang et al. (2022) 2022Human FeedbackPPOGPT-3Self-built
Safe-RLHF (Dai et al., 2024)2023Human FeedbackPPOAlpaca-7BSelf-built
AlignmentDPO (An et al., 2023; Rafailov et al., 2024)2023Human FeedbackDPOGPT2-largeD4RL Gym, Adroit pen, Kitchen
MODPO (Zhou et al., 2024h)2023Human FeedbackDPOAlpaca-7B-reproducedBeaverTails, QA-Feedback
KTO (Ethayarajh et al., 2024)2024Human FeedbackKTOPythia-1.4B, 2.8B, 6.9B, 12B, Llama-7B, 13B, 30BAlpacaEval, BBH, GSM8K
LIMA (Zhou et al., 2024a)2023Human FeedbackSFTLLaMA-65BSelf-built
CAI (Bai et al., 2022)2022AI FeedbackPPOClaudeSelf-built
SELF-ALIGN (Sun et al., 2024c)2023AI FeedbackPPOLLaMA-65BTruthfulQA, BIG-bench HHH Eval, Vicuna Benchmark
RLCD (Yang et al., 2024c)2024AI FeedbackPPOLLaMA-7B, 30BSelf-built
Stable Alignment (Liu et al., 2024i)2023Social InteractionsCPOLLaMA-7BAnthropic HH, Moral Stories, MIC, ETHICS-Deontology, TruthfulQA
MATRIX (Pang et al., 2024)2024Social InteractionsSFTWizard-Vicuna- Uncensored-7, 13, 30BHH-RLHF, PKU-SafeRLHF, AdvBench, HarmfulQA
Wang et al. (2024o)2024Deceptive AlignmentFake AlignmentChatGLM2-6B, InternLM-7B, 20B, Qwen-7B, 14BSelf-built
Greenblatt et al. (2024) 2024Deceptive AlignmentAlignment FakingClaude-3-OpusSelf-built
Sheshadri et al. (2025) 2025Deceptive AlignmentAlignment FakingClaude-3-Opus, Claude-3.5-Sonnet, Llama-3-405B, Grok-3-Beta, Gemini-2.0-Flash, ……Self-built
Energy Latency AttackNMTSloth (Chen et al., 2022)2022White-boxGradient-basedT5, WMT14, H-NLPZH19
Engorgio (Dong et al., 2025a)2025White-boxGradient-basedOPT-125M, OPT-1.3B, GPT2-large, LLaMA-7B, LLaMA-2-7B, LLaMA-30B
SAME (Chen et al., 2023e)2023White-boxGradient-basedDeeBERT, RoBERTaGLUE
LLMEffiChecker (Feng et al., 2024b)2024White-boxGradient-basedT5, WMT14, H-NLP, Fairseq, U-DL, MarianMT, FLAN-T5, LaMiniGPT, CodeGenZH19
TTSlow (Gao et al., 2024h)2024White-boxGradient-basedSpeechT5, VITSLibriSpeech, LJ-Speech, English dialects
No-Skim (Zhang et al., 2023e)2023White-box/Black-boxQuery-basedBERT, RoBERTaGLUE
P-DoS (Gao et al., 2024d)2024Black-boxPoisoning-basedLLaMA-2-7B, 13B, LLaMA-3-8B, Mistral-7B
Model Extraction AttackLion (Jiang et al., 2023b)2023Fine-tuning StageFunctional SimilarityGPT-3.5-turboVicuna-Instructions
Li et al. (2024ab)2024Fine-tuning StageSpecific Ability Extractiontext-davinci-003
LoRD (Liang et al., 2024c)2024Alignment StageFunctional SimilarityGPT-3.5-turboWMT16, TLDR, CNN Daily Mail, Samsum, WikiSQL, Spider, E2E-NLG, CommonGen, PIQA, TruthfulQA
Data Extraction AttackCarlini et al. (2019) 2019Black-boxPrefix AttackGRU, LSTM, CNN, WaveNetWikiText-103, PTB, Enron Email
Carlini et al. (2021) 2021Black-boxPrefix AttackGPT-2
Nasr et al. (2023) 2023Black-boxPrefix AttackGPT-Neo, Pythia, GPT-2, LLaMA, Falcon, GPT-3.5-turbo
Yu et al. (2023b)2023Black-boxPrefix AttackGPT-Neo 1.3B, 2.7B
Magpie (Xu et al., 2024g)2024Black-boxPrefix AttackLlama-3-8B, 70BAlpacaEval 2, Arena-Hard
Al-Kaswan et al. (2024) 2024Black-boxPrefix AttackGPT-NEO, GPT-2, Pythia, CodeGen, CodeParrot, InCoder, PyCodeGPT, GPT-Code-Clippy
SCA (Bai et al., 2024c)2024Black-boxSpecial Character AttackLlama-2-7B, 13B, 70B, ChatGLM, Falcon, LLaMA-3-8B, ChatGPT, Gemini, ERNIEBot
Kassem et al. (2024) 2024Black-boxPrompt OptimizationAlpaca-7B, 13B, Vicuna-7B, Tulu-7B, 30B, Falcon, OLMo
Qi et al. (2024b)2024Black-boxRAG ExtractionLLaMA-2-7B, 13B, 70B, Mistral-7B, 8x7B, SOLAR-10.7B, Vicuna-13B, WizardLM-13B, Qwen-1.5-72B, Platypus2-70BWikiQA
More et al. (2024) 2024Black-boxEnsemble AttackPythiaPile, Dolma
Zhang et al. (2025f)2025Black-boxSemantic Information ElicitationGPT-3.5-Turbo, GPT-4, Claude-3-Opus, GPT-4o, Gemini 1.5 Flash ……Self-built
Duan et al. (2024) 2024White-boxLatent Memorization ExtractionPythia-1B, Amber-7B

or Create an Account

Close Modal
Close Modal