Fine-Grained Frame Modeling in Multi-head Self-Attention for Speech Deepfake Detection
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Phuong, Tuan Dat, Truong, Duc-Tuan, Hoang, Long-Vu, Thu, Trang Nguyen Thi |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Pushing the Performance of Synthetic Speech Detection with Kolmogorov-Arnold Networks and Self-Supervised Learning Models
par: Phuong, Tuan Dat, et autres
Publié: (2025)
par: Phuong, Tuan Dat, et autres
Publié: (2025)
Temporal-Channel Modeling in Multi-head Self-Attention for Synthetic Speech Detection
par: Truong, Duc-Tuan, et autres
Publié: (2024)
par: Truong, Duc-Tuan, et autres
Publié: (2024)
VoxVietnam: a Large-Scale Multi-Genre Dataset for Vietnamese Speaker Recognition
par: Vu, Hoang Long, et autres
Publié: (2024)
par: Vu, Hoang Long, et autres
Publié: (2024)
Qwen vs. Gemma Integration with Whisper: A Comparative Study in Multilingual SpeechLLM Systems
par: Nguyen, Tuan, et autres
Publié: (2025)
par: Nguyen, Tuan, et autres
Publié: (2025)
XLSR-Kanformer: A KAN-Intergrated model for Synthetic Speech Detection
par: Dat, Phuong Tuan, et autres
Publié: (2025)
par: Dat, Phuong Tuan, et autres
Publié: (2025)
Acoustic scattering AI for non-invasive object classifications: A case study on hair assessment
par: Hoang, Long-Vu, et autres
Publié: (2025)
par: Hoang, Long-Vu, et autres
Publié: (2025)
QAMO: Quality-aware Multi-centroid One-class Learning For Speech Deepfake Detection
par: Truong, Duc-Tuan, et autres
Publié: (2025)
par: Truong, Duc-Tuan, et autres
Publié: (2025)
Addressing Gradient Misalignment in Data-Augmented Training for Robust Speech Deepfake Detection
par: Truong, Duc-Tuan, et autres
Publié: (2025)
par: Truong, Duc-Tuan, et autres
Publié: (2025)
Continuous Learning of Transformer-based Audio Deepfake Detection
par: Le, Tuan Duy Nguyen, et autres
Publié: (2024)
par: Le, Tuan Duy Nguyen, et autres
Publié: (2024)
AsyncSwitch: Asynchronous Text-Speech Adaptation for Code-Switched ASR
par: Nguyen, Tuan, et autres
Publié: (2025)
par: Nguyen, Tuan, et autres
Publié: (2025)
MAGE: A Coarse-to-Fine Speech Enhancer with Masked Generative Model
par: Pham, The Hieu, et autres
Publié: (2025)
par: Pham, The Hieu, et autres
Publié: (2025)
Zero-Shot Text-to-Speech for Vietnamese
par: Vu, Thi, et autres
Publié: (2025)
par: Vu, Thi, et autres
Publié: (2025)
AdaCS: Adaptive Normalization for Enhanced Code-Switching ASR
par: Chu, The Chuong, et autres
Publié: (2025)
par: Chu, The Chuong, et autres
Publié: (2025)
A Comprehensive Survey with Critical Analysis for Deepfake Speech Detection
par: Pham, Lam, et autres
Publié: (2024)
par: Pham, Lam, et autres
Publié: (2024)
Environmental Sound Deepfake Detection Using Deep-Learning Framework
par: Pham, Lam, et autres
Publié: (2026)
par: Pham, Lam, et autres
Publié: (2026)
Room Impulse Responses help attackers to evade Deep Fake Detection
par: Luong, Hieu-Thi, et autres
Publié: (2024)
par: Luong, Hieu-Thi, et autres
Publié: (2024)
ChunkFormer: Masked Chunking Conformer For Long-Form Speech Transcription
par: Le, Khanh, et autres
Publié: (2025)
par: Le, Khanh, et autres
Publié: (2025)
Mispronunciation Detection and Diagnosis Without Model Training: A Retrieval-Based Approach
par: Tu, Huu Tuong, et autres
Publié: (2025)
par: Tu, Huu Tuong, et autres
Publié: (2025)
A General Model for Deepfake Speech Detection: Diverse Bonafide Resources or Diverse AI-Based Generators
par: Pham, Lam, et autres
Publié: (2026)
par: Pham, Lam, et autres
Publié: (2026)
SegAug: CTC-Aligned Segmented Augmentation For Robust RNN-Transducer Based Speech Recognition
par: Le, Khanh, et autres
Publié: (2025)
par: Le, Khanh, et autres
Publié: (2025)
Can we train ASR systems on Code-switch without real code-switch data? Case study for Singapore's languages
par: Nguyen, Tuan, et autres
Publié: (2025)
par: Nguyen, Tuan, et autres
Publié: (2025)
Attention-based Mixture of Experts for Robust Speech Deepfake Detection
par: Negroni, Viola, et autres
Publié: (2025)
par: Negroni, Viola, et autres
Publié: (2025)
Nes2Net: A Lightweight Nested Architecture for Foundation Model Driven Speech Anti-spoofing
par: Liu, Tianchi, et autres
Publié: (2025)
par: Liu, Tianchi, et autres
Publié: (2025)
Toward Fine-Grained Speech Inpainting Forensics:A Dataset, Method, and Metric for Multi-Region Tampering Localization
par: Vu, Tung, et autres
Publié: (2026)
par: Vu, Tung, et autres
Publié: (2026)
Hierarchical Decoding for Discrete Speech Synthesis with Multi-Resolution Spoof Detection
par: Zhao, Junchuan, et autres
Publié: (2026)
par: Zhao, Junchuan, et autres
Publié: (2026)
Assessing the Impact of Speaker Identity in Speech Spoofing Detection
par: Dao, Anh-Tuan, et autres
Publié: (2026)
par: Dao, Anh-Tuan, et autres
Publié: (2026)
Multi-Task Transformer for Explainable Speech Deepfake Detection via Formant Modeling
par: Negroni, Viola, et autres
Publié: (2026)
par: Negroni, Viola, et autres
Publié: (2026)
MultiMed-ST: Large-scale Many-to-many Multilingual Medical Speech Translation
par: Le-Duc, Khai, et autres
Publié: (2025)
par: Le-Duc, Khai, et autres
Publié: (2025)
Stream-based Active Learning for Anomalous Sound Detection in Machine Condition Monitoring
par: Ho, Tuan Vu, et autres
Publié: (2024)
par: Ho, Tuan Vu, et autres
Publié: (2024)
O_O-VC: Synthetic Data-Driven One-to-One Alignment for Any-to-Any Voice Conversion
par: Tu, Huu Tuong, et autres
Publié: (2025)
par: Tu, Huu Tuong, et autres
Publié: (2025)
Frame-level Temporal Difference Learning for Partial Deepfake Speech Detection
par: Li, Menglu, et autres
Publié: (2025)
par: Li, Menglu, et autres
Publié: (2025)
Deepfake Audio Detection Using Spectrogram-based Feature and Ensemble of Deep Learning Models
par: Pham, Lam, et autres
Publié: (2024)
par: Pham, Lam, et autres
Publié: (2024)
Fake Speech Wild: Detecting Deepfake Speech on Social Media Platform
par: Xie, Yuankun, et autres
Publié: (2025)
par: Xie, Yuankun, et autres
Publié: (2025)
Towards Scalable AASIST: Refining Graph Attention for Speech Deepfake Detection
par: Viakhirev, Ivan, et autres
Publié: (2025)
par: Viakhirev, Ivan, et autres
Publié: (2025)
MoLEx: Mixture of LoRA Experts in Speech Self-Supervised Models for Audio Deepfake Detection
par: Pan, Zihan, et autres
Publié: (2025)
par: Pan, Zihan, et autres
Publié: (2025)
RTCFake: Speech Deepfake Detection in Real-Time Communication
par: Xue, Jun, et autres
Publié: (2026)
par: Xue, Jun, et autres
Publié: (2026)
Speechless: Speech Instruction Training Without Speech for Low Resource Languages
par: Dao, Alan, et autres
Publié: (2025)
par: Dao, Alan, et autres
Publié: (2025)
Speech Enhancement with Overlapped-Frame Information Fusion and Causal Self-Attention
par: Zhang, Yuewei, et autres
Publié: (2025)
par: Zhang, Yuewei, et autres
Publié: (2025)
MultiMed: Multilingual Medical Speech Recognition via Attention Encoder Decoder
par: Le-Duc, Khai, et autres
Publié: (2024)
par: Le-Duc, Khai, et autres
Publié: (2024)
Xi+: Uncertainty Supervision for Robust Speaker Embedding
par: Li, Junjie, et autres
Publié: (2025)
par: Li, Junjie, et autres
Publié: (2025)
Documents similaires
-
Pushing the Performance of Synthetic Speech Detection with Kolmogorov-Arnold Networks and Self-Supervised Learning Models
par: Phuong, Tuan Dat, et autres
Publié: (2025) -
Temporal-Channel Modeling in Multi-head Self-Attention for Synthetic Speech Detection
par: Truong, Duc-Tuan, et autres
Publié: (2024) -
VoxVietnam: a Large-Scale Multi-Genre Dataset for Vietnamese Speaker Recognition
par: Vu, Hoang Long, et autres
Publié: (2024) -
Qwen vs. Gemma Integration with Whisper: A Comparative Study in Multilingual SpeechLLM Systems
par: Nguyen, Tuan, et autres
Publié: (2025) -
XLSR-Kanformer: A KAN-Intergrated model for Synthetic Speech Detection
par: Dat, Phuong Tuan, et autres
Publié: (2025)