Explainable Multi-Modal Deep Learning for Automatic Detection of Lung Diseases from Respiratory Audio Signals
Fuente:
arXiv
Salvato in:
| Autori principali: | Saky, S M Asiful Islam, Islam, Md Rashidul, Arefin, Md Saiful, Alam, Shahaba |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
When Denoising Hinders: Revisiting Zero-Shot ASR with SAM-Audio and Whisper
di: Islam, Akif, et al.
Pubblicazione: (2026)
di: Islam, Akif, et al.
Pubblicazione: (2026)
Zero-Shot to Zero-Lies: Detecting Bengali Deepfake Audio through Transfer Learning
di: Samu, Most. Sharmin Sultana, et al.
Pubblicazione: (2025)
di: Samu, Most. Sharmin Sultana, et al.
Pubblicazione: (2025)
WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction
di: Emon, Jakaria Islam, et al.
Pubblicazione: (2025)
di: Emon, Jakaria Islam, et al.
Pubblicazione: (2025)
AudioFuse: Unified Spectral-Temporal Learning via a Hybrid ViT-1D CNN Architecture for Robust Phonocardiogram Classification
di: Siddiqui, Md. Saiful Bari, et al.
Pubblicazione: (2025)
di: Siddiqui, Md. Saiful Bari, et al.
Pubblicazione: (2025)
Emotion Detection in Speech Using Lightweight and Transformer-Based Models: A Comparative and Ablation Study
di: Onyekwelu-Udoka, Lucky, et al.
Pubblicazione: (2025)
di: Onyekwelu-Udoka, Lucky, et al.
Pubblicazione: (2025)
DeepAgent: A Dual Stream Multi Agent Fusion for Robust Multimodal Deepfake Detection
di: Zaman, Sayeem Been, et al.
Pubblicazione: (2025)
di: Zaman, Sayeem Been, et al.
Pubblicazione: (2025)
Enhanced SegNet with Integrated Grad-CAM for Interpretable Retinal Layer Segmentation in OCT Images
di: Saky, S M Asiful Islam, et al.
Pubblicazione: (2025)
di: Saky, S M Asiful Islam, et al.
Pubblicazione: (2025)
A Lightweight Explainable Guardrail for Prompt Safety
di: Islam, Md Asiful, et al.
Pubblicazione: (2026)
di: Islam, Md Asiful, et al.
Pubblicazione: (2026)
Phase-Aware Deep Learning with Complex-Valued CNNs for Audio Signal Applications
di: Agrawal, Naman
Pubblicazione: (2025)
di: Agrawal, Naman
Pubblicazione: (2025)
A Two-Stage Feature Selection Approach for Robust Evaluation of Treatment Effects in High-Dimensional Observational Data
di: Islam, Md Saiful, et al.
Pubblicazione: (2021)
di: Islam, Md Saiful, et al.
Pubblicazione: (2021)
DUA-D2C: Dynamic Uncertainty Aware Method for Overfitting Remediation in Deep Learning
di: Siddiqui, Md. Saiful Bari, et al.
Pubblicazione: (2024)
di: Siddiqui, Md. Saiful Bari, et al.
Pubblicazione: (2024)
Multi-Task Learning for Lung sound & Lung disease classification
di: K V, Suma, et al.
Pubblicazione: (2024)
di: K V, Suma, et al.
Pubblicazione: (2024)
Tri-MTL: A Triple Multitask Learning Approach for Respiratory Disease Diagnosis
di: Kim, June-Woo, et al.
Pubblicazione: (2025)
di: Kim, June-Woo, et al.
Pubblicazione: (2025)
Quantum Kernels for Audio Deepfake Detection Using Spectrogram Patch Features
di: Amin, Lisan Al, et al.
Pubblicazione: (2026)
di: Amin, Lisan Al, et al.
Pubblicazione: (2026)
Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework
di: Zhang, Kuiyuan, et al.
Pubblicazione: (2025)
di: Zhang, Kuiyuan, et al.
Pubblicazione: (2025)
Whisper Speaker Identification: Leveraging Pre-Trained Multilingual Transformers for Robust Speaker Embeddings
di: Emon, Jakaria Islam, et al.
Pubblicazione: (2025)
di: Emon, Jakaria Islam, et al.
Pubblicazione: (2025)
Evaluation of Deep Audio Representations for Hearables
di: Gröger, Fabian, et al.
Pubblicazione: (2025)
di: Gröger, Fabian, et al.
Pubblicazione: (2025)
A Novel Hybrid Deep Learning Technique for Speech Emotion Detection using Feature Engineering
di: Chowdhury, Shahana Yasmin, et al.
Pubblicazione: (2025)
di: Chowdhury, Shahana Yasmin, et al.
Pubblicazione: (2025)
OWL: Geometry-Aware Spatial Reasoning for Audio Large Language Models
di: Biswas, Subrata, et al.
Pubblicazione: (2025)
di: Biswas, Subrata, et al.
Pubblicazione: (2025)
An Investigation Into Various Approaches For Bengali Long-Form Speech Transcription and Bengali Speaker Diarization
di: Jahan, Epshita, et al.
Pubblicazione: (2026)
di: Jahan, Epshita, et al.
Pubblicazione: (2026)
FISHER: A Foundation Model for Multi-Modal Industrial Signal Comprehensive Representation
di: Fan, Pingyi, et al.
Pubblicazione: (2025)
di: Fan, Pingyi, et al.
Pubblicazione: (2025)
SS-DPPN: A self-supervised dual-path foundation model for the generalizable cardiac audio representation
di: Muna, Ummy Maria, et al.
Pubblicazione: (2025)
di: Muna, Ummy Maria, et al.
Pubblicazione: (2025)
AFEN: Respiratory Disease Classification using Ensemble Learning
di: Nadkarni, Rahul, et al.
Pubblicazione: (2024)
di: Nadkarni, Rahul, et al.
Pubblicazione: (2024)
Robust COVID-19 Detection from Cough Sounds using Deep Neural Decision Tree and Forest: A Comprehensive Cross-Datasets Evaluation
di: Islam, Rofiqul, et al.
Pubblicazione: (2025)
di: Islam, Rofiqul, et al.
Pubblicazione: (2025)
AudioMosaic: Contrastive Masked Audio Representation Learning
di: Huang, Hanxun, et al.
Pubblicazione: (2026)
di: Huang, Hanxun, et al.
Pubblicazione: (2026)
Cardioformer: Advancing AI in ECG Analysis with Multi-Granularity Patching and ResNet
di: Mobin, Md Kamrujjaman, et al.
Pubblicazione: (2025)
di: Mobin, Md Kamrujjaman, et al.
Pubblicazione: (2025)
A Cascaded Architecture for Extractive Summarization of Multimedia Content via Audio-to-Text Alignment
di: Hossain, Tanzir, et al.
Pubblicazione: (2025)
di: Hossain, Tanzir, et al.
Pubblicazione: (2025)
AudioGenX: Explainability on Text-to-Audio Generative Models
di: Kang, Hyunju, et al.
Pubblicazione: (2025)
di: Kang, Hyunju, et al.
Pubblicazione: (2025)
LuxVeri at GenAI Detection Task 1: Inverse Perplexity Weighted Ensemble for Robust Detection of AI-Generated Text across English and Multilingual Contexts
di: Mobin, Md Kamrujjaman, et al.
Pubblicazione: (2025)
di: Mobin, Md Kamrujjaman, et al.
Pubblicazione: (2025)
LuxVeri at GenAI Detection Task 3: Cross-Domain Detection of AI-Generated Text Using Inverse Perplexity-Weighted Ensemble of Fine-Tuned Transformer Models
di: Mobin, Md Kamrujjaman, et al.
Pubblicazione: (2025)
di: Mobin, Md Kamrujjaman, et al.
Pubblicazione: (2025)
Adaptability of ASR Models on Low-Resource Language: A Comparative Study of Whisper and Wav2Vec-BERT on Bangla
di: Ridoy, Md Sazzadul Islam, et al.
Pubblicazione: (2025)
di: Ridoy, Md Sazzadul Islam, et al.
Pubblicazione: (2025)
Automatic Speech Recognition in the Modern Era: Architectures, Training, and Evaluation
di: Nayeem, Md., et al.
Pubblicazione: (2025)
di: Nayeem, Md., et al.
Pubblicazione: (2025)
MMFformer: Multimodal Fusion Transformer Network for Depression Detection
di: Haque, Md Rezwanul, et al.
Pubblicazione: (2025)
di: Haque, Md Rezwanul, et al.
Pubblicazione: (2025)
Linguistic and Audio Embedding-Based Machine Learning for Alzheimer's Dementia and Mild Cognitive Impairment Detection: Insights from the PROCESS Challenge
di: Devahi, Adharsha Sam Edwin Sam, et al.
Pubblicazione: (2025)
di: Devahi, Adharsha Sam Edwin Sam, et al.
Pubblicazione: (2025)
AUDETER: A Large-scale Dataset for Deepfake Audio Detection in Open Worlds
di: Wang, Qizhou, et al.
Pubblicazione: (2025)
di: Wang, Qizhou, et al.
Pubblicazione: (2025)
RespLLM: Unifying Audio and Text with Multimodal LLMs for Generalized Respiratory Health Prediction
di: Zhang, Yuwei, et al.
Pubblicazione: (2024)
di: Zhang, Yuwei, et al.
Pubblicazione: (2024)
RAMoEA-QA: Hierarchical Specialization for Robust Respiratory Audio Question Answering
di: Bertolino, Gaia A., et al.
Pubblicazione: (2026)
di: Bertolino, Gaia A., et al.
Pubblicazione: (2026)
A Survey of Deep Learning Audio Generation Methods
di: Božić, Matej, et al.
Pubblicazione: (2024)
di: Božić, Matej, et al.
Pubblicazione: (2024)
Preference-Based Learning in Audio Applications: A Systematic Analysis
di: Broukhim, Aaron, et al.
Pubblicazione: (2025)
di: Broukhim, Aaron, et al.
Pubblicazione: (2025)
Sparse Autoencoders Make Audio Foundation Models more Explainable
di: Mariotte, Théo, et al.
Pubblicazione: (2025)
di: Mariotte, Théo, et al.
Pubblicazione: (2025)
Documenti analoghi
-
When Denoising Hinders: Revisiting Zero-Shot ASR with SAM-Audio and Whisper
di: Islam, Akif, et al.
Pubblicazione: (2026) -
Zero-Shot to Zero-Lies: Detecting Bengali Deepfake Audio through Transfer Learning
di: Samu, Most. Sharmin Sultana, et al.
Pubblicazione: (2025) -
WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction
di: Emon, Jakaria Islam, et al.
Pubblicazione: (2025) -
AudioFuse: Unified Spectral-Temporal Learning via a Hybrid ViT-1D CNN Architecture for Robust Phonocardiogram Classification
di: Siddiqui, Md. Saiful Bari, et al.
Pubblicazione: (2025) -
Emotion Detection in Speech Using Lightweight and Transformer-Based Models: A Comparative and Ablation Study
di: Onyekwelu-Udoka, Lucky, et al.
Pubblicazione: (2025)