XI Jornadas Nacionales de Investigación en Ciberseguridad - JNIC 2026, Barcelona (Spain). 06-08 May 2026
Original summary:
Este proyecto investiga la detección automática de voces generadas por inteligencia artificial (IA), una tarea cada vez más relevante debido al uso creciente de deepfakes de audio para suplantación de identidad, fraude y desinformación. Partiendo del ASVspoof Challenge de 2019, se reentrenaron dos sistemas de referencia sobre un subconjunto equilibrado en duración de la partición Logical Access. Los audios se restringieron a duraciones de entre dos y cuatro segundos para eliminar posibles sesgos en los que los modelos atendieran a características temporales superficiales o basadas en la duración, en lugar de centrarse en las propiedades acústicas de las muestras. El primer sistema es un clasificador binario basado en redes neuronales convolucionales (CNN) que aprende la frontera entre audios reales y audios sintéticos. El segundo emplea una estrategia de aprendizaje de una sola clase (one-class learning) con ResNet-18 y OC-Softmax, modelando solo voz humana durante el entrenamiento para que el audio sintético se detecte como una anomalía en la inferencia.
Se compararon cuatro representaciones de audio: espectrogramas, MFCC (Mel-Frequency Cepstral Coefficients), CQCC (Constant Q Cepstral Coefficients) y LFCC (Linear-Frequency Cepstral Coefficients), vinculando cada tipo de característica con la arquitectura más adecuada. La evaluación se realizó en los conjuntos de desarrollo y evaluación de ASVspoof 2019, así como en un dataset externo que incluye muestras deepfake de alta calidad generadas por motores comerciales de texto a voz y clonación de voz (PlayHT, Resemble AI, LOVO). Para medir las capacidades humanas, un juego en línea registró 1080 decisiones de oyentes, generando matrices de confusión y tasas de error para las mismas técnicas de spoofing.
Los resultados muestran una jerarquía clara. Todos los modelos alcanzan precisión casi perfecta en los datos de entrenamiento, pero solo el sistema de one-class con LFCC mantiene un rendimiento sólido frente a ataques no vistos, logrando un 93 % de precisión en el conjunto de evaluación y un 88 % en las muestras externas, demostrando ser el más robusto a nivel global. Los modelos CNN basados en espectrogramas, MFCC y CQCC empeoran notablemente, mientras que los oyentes humanos identificaron correctamente apenas el 40 % de los deepfakes externos, confundiéndose en casi cuatro de cada cinco casos de voz generada por IA moderna. En última instancia, esto subraya la importancia de desarrollar sistemas automáticos robustos para identificar de manera fiable los deepfakes de voz y contrarrestar las amenazas emergentes.
English summary:
This project investigates the automatic detection of AI-generated speech, a task of growing importance as increasingly realistic audio deepfakes are exploited for impersonation, fraud, and disinformation. Building on the ASVspoof 2019 Challenge, two reference systems were retrained on a duration-balanced subset of the Logical Access partition. The audio clips were restricted to durations between two and four seconds to eliminate
potential biases where models might attend to superficial temporal or length-based features rather than focusing on the acoustic properties of the samples. The first system is a convolutional neural-network (CNN) classifier that learns a binary decision boundary between bona-fide and spoofed speech. The second employs a one-class learning strategy based on ResNet-18 and OC-Softmax, modeling only genuine speech during training so that synthetic audio appears as an anomaly at inference time.
Four acoustic representations—spectrograms, MFCC (Mel-Frequency Cepstral Coefficients), CQCC (Constant Q Cepstral Coefficients) and LFCC (Linear-Frequency Cepstral Coefficients)—were compared, with each feature paired to its most suitable architecture. Evaluation was conducted on the development and evaluation splits of ASVspoof 2019, as well as on an external dataset including high-quality deepfake samples generated by commercial text-to-speech and voice cloning engines (PlayHT, Resemble AI, LOVO). To benchmark human capabilities, an online game recorded 1,080 listener decisions, producing confusion matrices and error rates for the same spoofing techniques.
Results show a clear hierarchy. All models reached near-perfect accuracy on training data, yet only the LFCC one-class system maintained strong performance on unseen attacks, achieving 93 % accuracy on the evaluation set and 88 % on external simples, and proving to be the most robust overall. CNN models using spectrogram, MFCC and CQCC features degraded substantially, while human listeners correctly identified barely 40 % of the external fakes and misclassified almost four out of five modern AI-generated voices. Ultimately, these findings underscore the momentous importance of developing robust automatic systems to reliably identify voice deepfakes and counter emerging threats.
Spanish layman's summary:
Este proyecto estudia la detección de voces sintéticas generadas por IA. Compara modelos automáticos y oyentes humanos, mostrando que algunos sistemas identifican deepfakes de voz más fiablemente que las personas, quienes no lograron detectar casi el 80% de los audios falsos modernos.
English layman's summary:
This project studies the detection of synthetic voices generated by AI. It compares different automatic models and human listeners, showing that some systems can identify voice deepfakes more reliably than people, who misclassified nearly 80% of modern fakes.
Keywords: aprendizaje de única clase, detección de "spoofing", "deepfakes", redes neuronales convolucionales (CNNs), síntesis de audio; one-class learning, spoofing detection, deepfakes, Convolutional Neural Networks (CNNs), audio synthesis
Published in: JNIC 2026: Actas de las Jornadas Nacionales de Investigación en Ciberseguridad, Barcelona, del 6 al 8 de mayo de 2026, pp: 290-293, ISBN: 979-13-88098-43-7
Publication date: 08-May-2026.
Citation:
V. García Martínez-Echevarría, R. Palacios, G. López, "Automatic Detection of AI-Generated Audio", presented at XI Jornadas Nacionales de Investigación en Ciberseguridad - JNIC 2026, Barcelona, Spain, 06-08 May 2026. In: JNIC 2026: Actas de las Jornadas Nacionales de Investigación en Ciberseguridad, Barcelona, del 6 al 8 de mayo de 2026, pp. 290-293
IIT-26-102C_poster