DIN-CTS: Low-Complexity Depthwise-Inception Neural Network with Contrastive Training Strategy for Deepfake Speech Detection
Fuente:
arXiv
Guardado en:
| Autores principales: | Pham, Lam, Tran, Dat, Lam, Phat, Skopik, Florian, Schindler, Alexander, Poletti, Silvia, Fischinger, David, Boyer, Martin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
A Comprehensive Survey with Critical Analysis for Deepfake Speech Detection
por: Pham, Lam, et al.
Publicado: (2024)
por: Pham, Lam, et al.
Publicado: (2024)
Aud-Sur: An Audio Analyzer Assistant for Audio Surveillance Applications
por: Lam, Phat, et al.
Publicado: (2025)
por: Lam, Phat, et al.
Publicado: (2025)
The Impact of Frequency Bands on Acoustic Anomaly Detection of Machines using Deep Learning Based Model
por: Nguyen, Tin, et al.
Publicado: (2024)
por: Nguyen, Tin, et al.
Publicado: (2024)
Deepfake Audio Detection Using Spectrogram-based Feature and Ensemble of Deep Learning Models
por: Pham, Lam, et al.
Publicado: (2024)
por: Pham, Lam, et al.
Publicado: (2024)
A Toolchain for Comprehensive Audio/Video Analysis Using Deep Learning Based Multimodal Approach (A use case of riot or violent context detection)
por: Pham, Lam, et al.
Publicado: (2024)
por: Pham, Lam, et al.
Publicado: (2024)
Continuous Learning of Transformer-based Audio Deepfake Detection
por: Le, Tuan Duy Nguyen, et al.
Publicado: (2024)
por: Le, Tuan Duy Nguyen, et al.
Publicado: (2024)
SNIPER Training: Single-Shot Sparse Training for Text-to-Speech
por: Lam, Perry, et al.
Publicado: (2022)
por: Lam, Perry, et al.
Publicado: (2022)
MAGE: A Coarse-to-Fine Speech Enhancer with Masked Generative Model
por: Pham, The Hieu, et al.
Publicado: (2025)
por: Pham, The Hieu, et al.
Publicado: (2025)
XLSR-Kanformer: A KAN-Intergrated model for Synthetic Speech Detection
por: Dat, Phuong Tuan, et al.
Publicado: (2025)
por: Dat, Phuong Tuan, et al.
Publicado: (2025)
Source Verification for Speech Deepfakes
por: Negroni, Viola, et al.
Publicado: (2025)
por: Negroni, Viola, et al.
Publicado: (2025)
AsyncSwitch: Asynchronous Text-Speech Adaptation for Code-Switched ASR
por: Nguyen, Tuan, et al.
Publicado: (2025)
por: Nguyen, Tuan, et al.
Publicado: (2025)
Pushing the Performance of Synthetic Speech Detection with Kolmogorov-Arnold Networks and Self-Supervised Learning Models
por: Phuong, Tuan Dat, et al.
Publicado: (2025)
por: Phuong, Tuan Dat, et al.
Publicado: (2025)
Unmasking Deepfakes: Leveraging Augmentations and Features Variability for Deepfake Speech Detection
por: Rimon, Inbal, et al.
Publicado: (2025)
por: Rimon, Inbal, et al.
Publicado: (2025)
Towards Unsupervised Speaker Diarization System for Multilingual Telephone Calls Using Pre-trained Whisper Model and Mixture of Sparse Autoencoders
por: Lam, Phat, et al.
Publicado: (2024)
por: Lam, Phat, et al.
Publicado: (2024)
Comparative Analysis of ASR Methods for Speech Deepfake Detection
por: Salvi, Davide, et al.
Publicado: (2024)
por: Salvi, Davide, et al.
Publicado: (2024)
From Sharpness to Better Generalization for Speech Deepfake Detection
por: Huang, Wen, et al.
Publicado: (2025)
por: Huang, Wen, et al.
Publicado: (2025)
Compact Speech Translation Models via Discrete Speech Units Pretraining
por: Lam, Tsz Kin, et al.
Publicado: (2024)
por: Lam, Tsz Kin, et al.
Publicado: (2024)
SynHate: Detecting Hate Speech in Synthetic Deepfake Audio
por: Ranjan, Rishabh, et al.
Publicado: (2025)
por: Ranjan, Rishabh, et al.
Publicado: (2025)
Phoneme-Level Analysis for Person-of-Interest Speech Deepfake Detection
por: Salvi, Davide, et al.
Publicado: (2025)
por: Salvi, Davide, et al.
Publicado: (2025)
Qwen vs. Gemma Integration with Whisper: A Comparative Study in Multilingual SpeechLLM Systems
por: Nguyen, Tuan, et al.
Publicado: (2025)
por: Nguyen, Tuan, et al.
Publicado: (2025)
Emotion-Coherent Speech Data Augmentation and Self-Supervised Contrastive Style Training for Enhancing Kids's Story Speech Synthesis
por: Chung, Raymond
Publicado: (2026)
por: Chung, Raymond
Publicado: (2026)
PartialEdit: Identifying Partial Deepfakes in the Era of Neural Speech Editing
por: Zhang, You, et al.
Publicado: (2025)
por: Zhang, You, et al.
Publicado: (2025)
Naturalness-Aware Curriculum Learning with Dynamic Temperature for Speech Deepfake Detection
por: Kim, Taewoo, et al.
Publicado: (2025)
por: Kim, Taewoo, et al.
Publicado: (2025)
Towards Scalable AASIST: Refining Graph Attention for Speech Deepfake Detection
por: Viakhirev, Ivan, et al.
Publicado: (2025)
por: Viakhirev, Ivan, et al.
Publicado: (2025)
Freeze and Learn: Continual Learning with Selective Freezing for Speech Deepfake Detection
por: Salvi, Davide, et al.
Publicado: (2024)
por: Salvi, Davide, et al.
Publicado: (2024)
SpeechFake: A Large-Scale Multilingual Speech Deepfake Dataset Incorporating Cutting-Edge Generation Methods
por: Huang, Wen, et al.
Publicado: (2025)
por: Huang, Wen, et al.
Publicado: (2025)
Audio Deepfake Detection in the Age of Advanced Text-to-Speech models
por: Singh, Robin, et al.
Publicado: (2026)
por: Singh, Robin, et al.
Publicado: (2026)
Multimodal Zero-Shot Framework for Deepfake Hate Speech Detection in Low-Resource Languages
por: Ranjan, Rishabh, et al.
Publicado: (2025)
por: Ranjan, Rishabh, et al.
Publicado: (2025)
ASASVIcomtech: The Vicomtech-UGR Speech Deepfake Detection and SASV Systems for the ASVspoof5 Challenge
por: Martín-Doñas, Juan M., et al.
Publicado: (2024)
por: Martín-Doñas, Juan M., et al.
Publicado: (2024)
CodecFake+: A Large-Scale Neural Audio Codec-Based Deepfake Speech Dataset
por: Chen, Xuanjun, et al.
Publicado: (2025)
por: Chen, Xuanjun, et al.
Publicado: (2025)
Environmental Sound Deepfake Detection Using Deep-Learning Framework
por: Pham, Lam, et al.
Publicado: (2026)
por: Pham, Lam, et al.
Publicado: (2026)
SCOREQ: Speech Quality Assessment with Contrastive Regression
por: Ragano, Alessandro, et al.
Publicado: (2024)
por: Ragano, Alessandro, et al.
Publicado: (2024)
Noise-Aware Speech Separation with Contrastive Learning
por: Zhang, Zizheng, et al.
Publicado: (2023)
por: Zhang, Zizheng, et al.
Publicado: (2023)
A General Model for Deepfake Speech Detection: Diverse Bonafide Resources or Diverse AI-Based Generators
por: Pham, Lam, et al.
Publicado: (2026)
por: Pham, Lam, et al.
Publicado: (2026)
BiCrossMamba-ST: Speech Deepfake Detection with Bidirectional Mamba Spectro-Temporal Cross-Attention
por: Kheir, Yassine El, et al.
Publicado: (2025)
por: Kheir, Yassine El, et al.
Publicado: (2025)
VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis
por: Jung, Jaemin, et al.
Publicado: (2024)
por: Jung, Jaemin, et al.
Publicado: (2024)
SIGNL: A Label-Efficient Audio Deepfake Detection System via Spectral-Temporal Graph Non-Contrastive Learning
por: Febrinanto, Falih Gozi, et al.
Publicado: (2025)
por: Febrinanto, Falih Gozi, et al.
Publicado: (2025)
Enhancing Generalization in Audio Deepfake Detection: A Neural Collapse based Sampling and Training Approach
por: Yousif, Mohammed, et al.
Publicado: (2024)
por: Yousif, Mohammed, et al.
Publicado: (2024)
AudioRepInceptionNeXt: A lightweight single-stream architecture for efficient audio recognition
por: Lau, Kin Wai, et al.
Publicado: (2024)
por: Lau, Kin Wai, et al.
Publicado: (2024)
CodecFake: Enhancing Anti-Spoofing Models Against Deepfake Audios from Codec-Based Speech Synthesis Systems
por: Wu, Haibin, et al.
Publicado: (2024)
por: Wu, Haibin, et al.
Publicado: (2024)
Ejemplares similares
-
A Comprehensive Survey with Critical Analysis for Deepfake Speech Detection
por: Pham, Lam, et al.
Publicado: (2024) -
Aud-Sur: An Audio Analyzer Assistant for Audio Surveillance Applications
por: Lam, Phat, et al.
Publicado: (2025) -
The Impact of Frequency Bands on Acoustic Anomaly Detection of Machines using Deep Learning Based Model
por: Nguyen, Tin, et al.
Publicado: (2024) -
Deepfake Audio Detection Using Spectrogram-based Feature and Ensemble of Deep Learning Models
por: Pham, Lam, et al.
Publicado: (2024) -
A Toolchain for Comprehensive Audio/Video Analysis Using Deep Learning Based Multimodal Approach (A use case of riot or violent context detection)
por: Pham, Lam, et al.
Publicado: (2024)