Curved Worlds, Clear Boundaries: Generalizing Speech Deepfake Detection using Hyperbolic and Spherical Geometry Spaces
Fuente:
arXiv
Guardado en:
| Autores principales: | Sheth, Farhan, Girish, Akhtar, Mohd Mujtaba, Singh, Muskaan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Bridging Attribution and Open-Set Detection using Graph-Augmented Instance Learning in Synthetic Speech
por: Akhtar, Mohd Mujtaba, et al.
Publicado: (2026)
por: Akhtar, Mohd Mujtaba, et al.
Publicado: (2026)
Towards Attribution of Generators and Emotional Manipulation in Cross-Lingual Synthetic Speech using Geometric Learning
por: Girish, et al.
Publicado: (2025)
por: Girish, et al.
Publicado: (2025)
HCFD: A Benchmark for Audio Deepfake Detection in Healthcare
por: Akhtar, Mohd Mujtaba, et al.
Publicado: (2026)
por: Akhtar, Mohd Mujtaba, et al.
Publicado: (2026)
Prosody as Supervision: Bridging the Non-Verbal--Verbal for Multilingual Speech Emotion Recognition
por: Girish, et al.
Publicado: (2026)
por: Girish, et al.
Publicado: (2026)
DIVINE: Coordinating Multimodal Disentangled Representations for Oro-Facial Neurological Disorder Assessment
por: Akhtar, Mohd Mujtaba, et al.
Publicado: (2026)
por: Akhtar, Mohd Mujtaba, et al.
Publicado: (2026)
NeuRO: An Application for Code-Switched Autism Detection in Children
por: Akhtar, Mohd Mujtaba, et al.
Publicado: (2024)
por: Akhtar, Mohd Mujtaba, et al.
Publicado: (2024)
Indic-CodecFake meets SATYAM: Towards Detecting Neural Audio Codec Synthesized Speech Deepfakes in Indic Languages
por: Girish, et al.
Publicado: (2026)
por: Girish, et al.
Publicado: (2026)
HYFuse: Aligning Heterogeneous Speech Pre-Trained Representations in Hyperbolic Space for Speech Emotion Recognition
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
Enhancing In-Domain and Out-Domain EmoFake Detection via Cooperative Multilingual Speech Foundation Models
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
Towards Machine Unlearning for Paralinguistic Speech Processing
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
Rethinking Cross-Corpus Speech Emotion Recognition Benchmarking: Are Paralinguistic Pre-Trained Representations Sufficient?
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
Source Tracing of Synthetic Speech Systems Through Paralinguistic Pre-Trained Representations
por: Girish, et al.
Publicado: (2025)
por: Girish, et al.
Publicado: (2025)
Towards Neural Audio Codec Source Parsing
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
Towards Source Attribution of Singing Voice Deepfake with Multimodal Foundation Models
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
PARROT: Synergizing Mamba and Attention-based SSL Pre-Trained Models via Parallel Branch Hadamard Optimal Transport for Speech Emotion Recognition
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
Are Multimodal Foundation Models All That Is Needed for Emofake Detection?
por: Akhtar, Mohd Mujtaba, et al.
Publicado: (2025)
por: Akhtar, Mohd Mujtaba, et al.
Publicado: (2025)
Investigating Polyglot Speech Foundation Models for Learning Collective Emotion from Crowds
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
Beyond Speech and More: Investigating the Emergent Ability of Speech Foundation Models for Classifying Physiological Time-Series Signals
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
Speech Recognition Transformers: Topological-lingualism Perspective
por: Singh, Shruti, et al.
Publicado: (2024)
por: Singh, Shruti, et al.
Publicado: (2024)
Post-training for Deepfake Speech Detection
por: Ge, Wanying, et al.
Publicado: (2025)
por: Ge, Wanying, et al.
Publicado: (2025)
Investigating the Reasonable Effectiveness of Speaker Pre-Trained Models and their Synergistic Power for SingMOS Prediction
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
SynHate: Detecting Hate Speech in Synthetic Deepfake Audio
por: Ranjan, Rishabh, et al.
Publicado: (2025)
por: Ranjan, Rishabh, et al.
Publicado: (2025)
From Sharpness to Better Generalization for Speech Deepfake Detection
por: Huang, Wen, et al.
Publicado: (2025)
por: Huang, Wen, et al.
Publicado: (2025)
Comparative Analysis of ASR Methods for Speech Deepfake Detection
por: Salvi, Davide, et al.
Publicado: (2024)
por: Salvi, Davide, et al.
Publicado: (2024)
Fine-Tuning ASR for Stuttered Speech: Personalized vs. Generalized Approaches
por: Mujtaba, Dena, et al.
Publicado: (2025)
por: Mujtaba, Dena, et al.
Publicado: (2025)
Towards Fusion of Neural Audio Codec-based Representations with Spectral for Heart Murmur Classification via Bandit-based Cross-Attention Mechanism
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
Does Fine-tuning by Reinforcement Learning Improve Generalization in Binary Speech Deepfake Detection?
por: Wang, Xin, et al.
Publicado: (2026)
por: Wang, Xin, et al.
Publicado: (2026)
Unmasking Deepfakes: Leveraging Augmentations and Features Variability for Deepfake Speech Detection
por: Rimon, Inbal, et al.
Publicado: (2025)
por: Rimon, Inbal, et al.
Publicado: (2025)
Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?
por: Akhtar, Mohd Mujtaba, et al.
Publicado: (2025)
por: Akhtar, Mohd Mujtaba, et al.
Publicado: (2025)
Multimodal Zero-Shot Framework for Deepfake Hate Speech Detection in Low-Resource Languages
por: Ranjan, Rishabh, et al.
Publicado: (2025)
por: Ranjan, Rishabh, et al.
Publicado: (2025)
Towards Data Drift Monitoring for Speech Deepfake Detection in the context of MLOps
por: Wang, Xin, et al.
Publicado: (2025)
por: Wang, Xin, et al.
Publicado: (2025)
Why Speech Deepfake Detectors Won't Generalize: The Limits of Detection in an Open World
por: Berisha, Visar, et al.
Publicado: (2025)
por: Berisha, Visar, et al.
Publicado: (2025)
Cyclostationarity Analysis as a Complement to Self-Supervised Representations for Speech Deepfake Detection
por: Hanilçi, Cemal, et al.
Publicado: (2026)
por: Hanilçi, Cemal, et al.
Publicado: (2026)
Phoneme-Level Analysis for Person-of-Interest Speech Deepfake Detection
por: Salvi, Davide, et al.
Publicado: (2025)
por: Salvi, Davide, et al.
Publicado: (2025)
A Comprehensive Survey with Critical Analysis for Deepfake Speech Detection
por: Pham, Lam, et al.
Publicado: (2024)
por: Pham, Lam, et al.
Publicado: (2024)
Heterogeneity over Homogeneity: Investigating Multilingual Speech Pre-Trained Models for Detecting Audio Deepfake
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
ProSDD: Learning Prosodic Representations for Speech Deepfake Detection against Expressive and Emotional Attacks
por: Mahapatra, Aurosweta, et al.
Publicado: (2026)
por: Mahapatra, Aurosweta, et al.
Publicado: (2026)
ASVspoof 5: Design, Collection and Validation of Resources for Spoofing, Deepfake, and Adversarial Attack Detection Using Crowdsourced Speech
por: Wang, Xin, et al.
Publicado: (2025)
por: Wang, Xin, et al.
Publicado: (2025)
Source Verification for Speech Deepfakes
por: Negroni, Viola, et al.
Publicado: (2025)
por: Negroni, Viola, et al.
Publicado: (2025)
ComFeAT: Combination of Neural and Spectral Features for Improved Depression Detection
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
Ejemplares similares
-
Bridging Attribution and Open-Set Detection using Graph-Augmented Instance Learning in Synthetic Speech
por: Akhtar, Mohd Mujtaba, et al.
Publicado: (2026) -
Towards Attribution of Generators and Emotional Manipulation in Cross-Lingual Synthetic Speech using Geometric Learning
por: Girish, et al.
Publicado: (2025) -
HCFD: A Benchmark for Audio Deepfake Detection in Healthcare
por: Akhtar, Mohd Mujtaba, et al.
Publicado: (2026) -
Prosody as Supervision: Bridging the Non-Verbal--Verbal for Multilingual Speech Emotion Recognition
por: Girish, et al.
Publicado: (2026) -
DIVINE: Coordinating Multimodal Disentangled Representations for Oro-Facial Neurological Disorder Assessment
por: Akhtar, Mohd Mujtaba, et al.
Publicado: (2026)