Guardado en:
| Autores principales: | Akhtar, Mohd Mujtaba, Girish, Singh, Muskaan, Phukan, Orchid Chetia |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2407.14328 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
NeuRO: An Application for Code-Switched Autism Detection in Children
por: Akhtar, Mohd Mujtaba, et al.
Publicado: (2024)
por: Akhtar, Mohd Mujtaba, et al.
Publicado: (2024)
Enhancing In-Domain and Out-Domain EmoFake Detection via Cooperative Multilingual Speech Foundation Models
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
Indic-CodecFake meets SATYAM: Towards Detecting Neural Audio Codec Synthesized Speech Deepfakes in Indic Languages
por: Girish, et al.
Publicado: (2026)
por: Girish, et al.
Publicado: (2026)
Towards Neural Audio Codec Source Parsing
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
HCFD: A Benchmark for Audio Deepfake Detection in Healthcare
por: Akhtar, Mohd Mujtaba, et al.
Publicado: (2026)
por: Akhtar, Mohd Mujtaba, et al.
Publicado: (2026)
Prosody as Supervision: Bridging the Non-Verbal--Verbal for Multilingual Speech Emotion Recognition
por: Girish, et al.
Publicado: (2026)
por: Girish, et al.
Publicado: (2026)
DIVINE: Coordinating Multimodal Disentangled Representations for Oro-Facial Neurological Disorder Assessment
por: Akhtar, Mohd Mujtaba, et al.
Publicado: (2026)
por: Akhtar, Mohd Mujtaba, et al.
Publicado: (2026)
Towards Machine Unlearning for Paralinguistic Speech Processing
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
Rethinking Cross-Corpus Speech Emotion Recognition Benchmarking: Are Paralinguistic Pre-Trained Representations Sufficient?
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
Beyond Speech and More: Investigating the Emergent Ability of Speech Foundation Models for Classifying Physiological Time-Series Signals
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
Towards Attribution of Generators and Emotional Manipulation in Cross-Lingual Synthetic Speech using Geometric Learning
por: Girish, et al.
Publicado: (2025)
por: Girish, et al.
Publicado: (2025)
Curved Worlds, Clear Boundaries: Generalizing Speech Deepfake Detection using Hyperbolic and Spherical Geometry Spaces
por: Sheth, Farhan, et al.
Publicado: (2025)
por: Sheth, Farhan, et al.
Publicado: (2025)
Bridging Attribution and Open-Set Detection using Graph-Augmented Instance Learning in Synthetic Speech
por: Akhtar, Mohd Mujtaba, et al.
Publicado: (2026)
por: Akhtar, Mohd Mujtaba, et al.
Publicado: (2026)
Towards Fusion of Neural Audio Codec-based Representations with Spectral for Heart Murmur Classification via Bandit-based Cross-Attention Mechanism
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
Strong Alone, Stronger Together: Synergizing Modality-Binding Foundation Models with Optimal Transport for Non-Verbal Emotion Recognition
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
ComFeAT: Combination of Neural and Spectral Features for Improved Depression Detection
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
Investigating the Reasonable Effectiveness of Speaker Pre-Trained Models and their Synergistic Power for SingMOS Prediction
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
HYFuse: Aligning Heterogeneous Speech Pre-Trained Representations in Hyperbolic Space for Speech Emotion Recognition
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
Source Tracing of Synthetic Speech Systems Through Paralinguistic Pre-Trained Representations
por: Girish, et al.
Publicado: (2025)
por: Girish, et al.
Publicado: (2025)
PARROT: Synergizing Mamba and Attention-based SSL Pre-Trained Models via Parallel Branch Hadamard Optimal Transport for Speech Emotion Recognition
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
A Lightweight Feature Fusion Architecture For Resource-Constrained Crowd Counting
por: Chaudhuri, Yashwardhan, et al.
Publicado: (2024)
por: Chaudhuri, Yashwardhan, et al.
Publicado: (2024)
Towards Source Attribution of Singing Voice Deepfake with Multimodal Foundation Models
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
Representation Loss Minimization with Randomized Selection Strategy for Efficient Environmental Fake Audio Detection
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?
por: Akhtar, Mohd Mujtaba, et al.
Publicado: (2025)
por: Akhtar, Mohd Mujtaba, et al.
Publicado: (2025)
Investigating Polyglot Speech Foundation Models for Learning Collective Emotion from Crowds
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
Are Multimodal Foundation Models All That Is Needed for Emofake Detection?
por: Akhtar, Mohd Mujtaba, et al.
Publicado: (2025)
por: Akhtar, Mohd Mujtaba, et al.
Publicado: (2025)
Avengers Assemble: Amalgamation of Non-Semantic Features for Depression Detection
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
CoLLAB: A Collaborative Approach for Multilingual Abuse Detection
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
SNIFR : Boosting Fine-Grained Child Harmful Content Detection Through Audio-Visual Alignment with Cascaded Cross-Transformer
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
AVR: Synergizing Foundation Models for Audio-Visual Humor Detection
por: Sharma, Sarthak, et al.
Publicado: (2024)
por: Sharma, Sarthak, et al.
Publicado: (2024)
SONIC: Synergizing VisiON Foundation Models for Stress RecogNItion from ECG signals
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
The Reasonable Effectiveness of Speaker Embeddings for Violence Detection
por: Jain, Sarthak, et al.
Publicado: (2024)
por: Jain, Sarthak, et al.
Publicado: (2024)
Investigating Prosodic Signatures via Speech Pre-Trained Models for Audio Deepfake Source Attribution
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
Are Paralinguistic Representations all that is needed for Speech Emotion Recognition?
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
Heterogeneity over Homogeneity: Investigating Multilingual Speech Pre-Trained Models for Detecting Audio Deepfake
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
PERSONA: An Application for Emotion Recognition, Gender Recognition and Age Estimation
por: Koshal, Devyani, et al.
Publicado: (2024)
por: Koshal, Devyani, et al.
Publicado: (2024)
VoxMed: One-Step Respiratory Disease Classifier using Digital Stethoscope Sounds
por: Mundra, Paridhi, et al.
Publicado: (2024)
por: Mundra, Paridhi, et al.
Publicado: (2024)
FOCA: Multimodal Malware Classification via Hyperbolic Cross-Attention
por: Choudhury, Nitin, et al.
Publicado: (2026)
por: Choudhury, Nitin, et al.
Publicado: (2026)
ASGIR: Audio Spectrogram Transformer Guided Classification And Information Retrieval For Birds
por: Chaudhuri, Yashwardhan, et al.
Publicado: (2024)
por: Chaudhuri, Yashwardhan, et al.
Publicado: (2024)
Multi-View Multi-Task Modeling with Speech Foundation Models for Speech Forensic Tasks
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
Ejemplares similares
-
NeuRO: An Application for Code-Switched Autism Detection in Children
por: Akhtar, Mohd Mujtaba, et al.
Publicado: (2024) -
Enhancing In-Domain and Out-Domain EmoFake Detection via Cooperative Multilingual Speech Foundation Models
por: Phukan, Orchid Chetia, et al.
Publicado: (2025) -
Indic-CodecFake meets SATYAM: Towards Detecting Neural Audio Codec Synthesized Speech Deepfakes in Indic Languages
por: Girish, et al.
Publicado: (2026) -
Towards Neural Audio Codec Source Parsing
por: Phukan, Orchid Chetia, et al.
Publicado: (2025) -
HCFD: A Benchmark for Audio Deepfake Detection in Healthcare
por: Akhtar, Mohd Mujtaba, et al.
Publicado: (2026)