Fusion of Modulation Spectrogram and SSL with Multi-head Attention for Fake Speech Detection
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | N, Rishith Sadashiv T, Bedge, Abhishek, Bore, Saisha Suresh, Mishra, Jagabandhu, Bhattacharjee, Mrinmoy, Prasanna, S R Mahadeva |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Fairness of Automatic Speech Recognition in Cleft Lip and Palate Speech
par: Bhattacharjee, Susmita, et autres
Publié: (2025)
par: Bhattacharjee, Susmita, et autres
Publié: (2025)
Parameter-Efficient Fine-Tuning of Foundation Models for CLP Speech Classification
par: Bhattacharjee, Susmita, et autres
Publié: (2025)
par: Bhattacharjee, Susmita, et autres
Publié: (2025)
Spoken language change detection inspired by speaker change detection
par: Mishra, Jagabandhu, et autres
Publié: (2023)
par: Mishra, Jagabandhu, et autres
Publié: (2023)
Implicit Self-supervised Language Representation for Spoken Language Diarization
par: Mishra, Jagabandhu, et autres
Publié: (2023)
par: Mishra, Jagabandhu, et autres
Publié: (2023)
Timbre-Aware LLM-based Direct Speech-to-Speech Translation Extendable to Multiple Language Pairs
par: Arya, Lalaram, et autres
Publié: (2026)
par: Arya, Lalaram, et autres
Publié: (2026)
Leveraging AM and FM Rhythm Spectrograms for Dementia Classification and Assessment
par: Gogoi, Parismita, et autres
Publié: (2025)
par: Gogoi, Parismita, et autres
Publié: (2025)
Towards Explainable Spoofed Speech Attribution and Detection:a Probabilistic Approach for Characterizing Speech Synthesizer Components
par: Mishra, Jagabandhu, et autres
Publié: (2025)
par: Mishra, Jagabandhu, et autres
Publié: (2025)
Advancing Zero-Shot Open-Set Speech Deepfake Source Tracing
par: Chhibber, Manasi, et autres
Publié: (2025)
par: Chhibber, Manasi, et autres
Publié: (2025)
Evaluating Pretrained General-Purpose Audio Representations for Music Genre Classification
par: Rai, Kashish, et autres
Publié: (2026)
par: Rai, Kashish, et autres
Publié: (2026)
Spoofing-Robust Speaker Verification Using Parallel Embedding Fusion: BTU Speech Group's Approach for ASVspoof5 Challenge
par: Kurnaz, Oğuzhan, et autres
Publié: (2024)
par: Kurnaz, Oğuzhan, et autres
Publié: (2024)
Kinship Verification Using Voice
par: Mishra, Jagabandhu, et autres
Publié: (2026)
par: Mishra, Jagabandhu, et autres
Publié: (2026)
An Explainable Probabilistic Attribute Embedding Approach for Spoofed Speech Characterization
par: Chhibber, Manasi, et autres
Publié: (2024)
par: Chhibber, Manasi, et autres
Publié: (2024)
Joint Optimization of ASV and CM tasks: BTUEF Team's Submission for WildSpoof Challenge
par: Kurnaz, Oguzhan, et autres
Publié: (2026)
par: Kurnaz, Oguzhan, et autres
Publié: (2026)
Optimizing a-DCF for Spoofing-Robust Speaker Verification
par: Kurnaz, Oğuzhan, et autres
Publié: (2024)
par: Kurnaz, Oğuzhan, et autres
Publié: (2024)
Joint Optimization of Speaker and Spoof Detectors for Spoofing-Robust Automatic Speaker Verification
par: Kurnaz, Oğuzhan, et autres
Publié: (2025)
par: Kurnaz, Oğuzhan, et autres
Publié: (2025)
Temporal-Channel Modeling in Multi-head Self-Attention for Synthetic Speech Detection
par: Truong, Duc-Tuan, et autres
Publié: (2024)
par: Truong, Duc-Tuan, et autres
Publié: (2024)
SPEAR: A Unified SSL Framework for Learning Speech and Audio Representations
par: Yang, Xiaoyu, et autres
Publié: (2025)
par: Yang, Xiaoyu, et autres
Publié: (2025)
Spatial Reconstructed Local Attention Res2Net with F0 Subband for Fake Speech Detection
par: Fan, Cunhang, et autres
Publié: (2023)
par: Fan, Cunhang, et autres
Publié: (2023)
Frequency-mix Knowledge Distillation for Fake Speech Detection
par: Fan, Cunhang, et autres
Publié: (2024)
par: Fan, Cunhang, et autres
Publié: (2024)
Spectral Codecs: Improving Non-Autoregressive Speech Synthesis with Spectrogram-Based Audio Codecs
par: Langman, Ryan, et autres
Publié: (2024)
par: Langman, Ryan, et autres
Publié: (2024)
AntiDeepFake: AI for Deep Fake Speech Recognition
par: Togootogtokh, Enkhtogtokh, et autres
Publié: (2024)
par: Togootogtokh, Enkhtogtokh, et autres
Publié: (2024)
A Survey of Deep Learning for Complex Speech Spectrograms
par: Xie, Yuying, et autres
Publié: (2025)
par: Xie, Yuying, et autres
Publié: (2025)
Mel-FullSubNet: Mel-Spectrogram Enhancement for Improving Both Speech Quality and ASR
par: Zhou, Rui, et autres
Publié: (2024)
par: Zhou, Rui, et autres
Publié: (2024)
k2SSL: A Faster and Better Framework for Self-Supervised Speech Representation Learning
par: Yang, Yifan, et autres
Publié: (2024)
par: Yang, Yifan, et autres
Publié: (2024)
Can LLMs Help Localize Fake Words in Partially Fake Speech?
par: Zhang, Lin, et autres
Publié: (2026)
par: Zhang, Lin, et autres
Publié: (2026)
FakeMark: Deepfake Speech Attribution With Watermarked Artifacts
par: Ge, Wanying, et autres
Publié: (2025)
par: Ge, Wanying, et autres
Publié: (2025)
Improving Audio Spectrogram Transformers for Sound Event Detection Through Multi-Stage Training
par: Schmid, Florian, et autres
Publié: (2024)
par: Schmid, Florian, et autres
Publié: (2024)
PARROT: Synergizing Mamba and Attention-based SSL Pre-Trained Models via Parallel Branch Hadamard Optimal Transport for Speech Emotion Recognition
par: Phukan, Orchid Chetia, et autres
Publié: (2025)
par: Phukan, Orchid Chetia, et autres
Publié: (2025)
Enhancing In-Domain and Out-Domain EmoFake Detection via Cooperative Multilingual Speech Foundation Models
par: Phukan, Orchid Chetia, et autres
Publié: (2025)
par: Phukan, Orchid Chetia, et autres
Publié: (2025)
Representation Loss Minimization with Randomized Selection Strategy for Efficient Environmental Fake Audio Detection
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
Dual-View Predictive Diffusion: Lightweight Speech Enhancement via Spectrogram-Image Synergy
par: Xue, Ke, et autres
Publié: (2026)
par: Xue, Ke, et autres
Publié: (2026)
SPES: Spectrogram Perturbation for Explainable Speech-to-Text Generation
par: Fucci, Dennis, et autres
Publié: (2024)
par: Fucci, Dennis, et autres
Publié: (2024)
Non-Causal to Causal SSL-Supported Transfer Learning: Towards a High-Performance Low-Latency Speech Vocoder
par: Shi, Renzheng, et autres
Publié: (2024)
par: Shi, Renzheng, et autres
Publié: (2024)
SOA: Reducing Domain Mismatch in SSL Pipeline by Speech Only Adaptation for Low Resource ASR
par: Shankar, Natarajan Balaji, et autres
Publié: (2024)
par: Shankar, Natarajan Balaji, et autres
Publié: (2024)
Exploiting Consistency-Preserving Loss and Perceptual Contrast Stretching to Boost SSL-based Speech Enhancement
par: Khan, Muhammad Salman, et autres
Publié: (2024)
par: Khan, Muhammad Salman, et autres
Publié: (2024)
Indic-CodecFake meets SATYAM: Towards Detecting Neural Audio Codec Synthesized Speech Deepfakes in Indic Languages
par: Girish, et autres
Publié: (2026)
par: Girish, et autres
Publié: (2026)
Ultra-Low-Bitrate Mel-Spectrogram-based Neural Speech Coding with Flow-Matching-based Refinement and Vocoding-driven Reconstruction
par: Du, Hui-Peng, et autres
Publié: (2026)
par: Du, Hui-Peng, et autres
Publié: (2026)
Speech Enhancement with Overlapped-Frame Information Fusion and Causal Self-Attention
par: Zhang, Yuewei, et autres
Publié: (2025)
par: Zhang, Yuewei, et autres
Publié: (2025)
Comprehensive Layer-wise Analysis of SSL Models for Audio Deepfake Detection
par: Kheir, Yassine El, et autres
Publié: (2025)
par: Kheir, Yassine El, et autres
Publié: (2025)
ASM: Audio Spectrogram Mixer
par: Ji, Qingfeng, et autres
Publié: (2024)
par: Ji, Qingfeng, et autres
Publié: (2024)
Documents similaires
-
Fairness of Automatic Speech Recognition in Cleft Lip and Palate Speech
par: Bhattacharjee, Susmita, et autres
Publié: (2025) -
Parameter-Efficient Fine-Tuning of Foundation Models for CLP Speech Classification
par: Bhattacharjee, Susmita, et autres
Publié: (2025) -
Spoken language change detection inspired by speaker change detection
par: Mishra, Jagabandhu, et autres
Publié: (2023) -
Implicit Self-supervised Language Representation for Spoken Language Diarization
par: Mishra, Jagabandhu, et autres
Publié: (2023) -
Timbre-Aware LLM-based Direct Speech-to-Speech Translation Extendable to Multiple Language Pairs
par: Arya, Lalaram, et autres
Publié: (2026)