Table 7.

Data sets and benchmarks for audio deepfake detection

NameDateset sizeLanguagesAttack typesEvaluation metricsYear
ASVspoof 2015 (Wu et al., 2015)260k+EnglishVC, statistical TTSEER2015
ASVspoof 2017 (Kinnunen et al., 2017)18k+EnglishReplay attacksEER2017
ReMASC (Reynolds et al., 2019)55k+EnglishReplay, manipulationEER, ROC-AUC2019
ASVspoof 2019 (Todisco et al., 2019)360k+EnglishLogical access (VC/TTS), physical access (replay)EER, t-DCF2019
FoR (Reimao and Tzerpos, 2019)198kEnglishTTS, VC, replayAccuracy, EER2019
WaveFake (Müller et al., 2021)105k-118kEnglishNeural TTS, VC (multiple architectures)EER, accuracy2021
FakeAVCeleb (Khalid et al., 2021)500 celebritiesEnglishAudio-visual deepfakes (TTS + face manipulation)Accuracy, EER2021
ASVspoof 2021 (Yamagishi et al., 2021)500k+EnglishLogical access, physical access, deepfakeEER, t-DCF2021
ADD (Yi et al., 2022)500k+English, MandarinTTS, VC, hybridEER, accuracy2022
LibriSeVoc (Sun et al., 2023)90k+EnglishVocoder artifactsEER, robustness2023
ASVspoof 5 (Wang et al., 2025) 1M+EnglishCrowdsourced deepfakes, adversarial attacksEER, t-DCF, mindcf, Cllr2025

or Create an Account

Close subscription notice
Close access options