A Concept-based approach to Voice Disorder Detection
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ghia, Davide, Ciravegna, Gabriele, Koudounas, Alkis, Fantini, Marco, Crosetti, Erika, Succo, Giovanni, Cerquitelli, Tania |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Voice Disorder Analysis: a Transformer-based Approach
par: Koudounas, Alkis, et autres
Publié: (2024)
par: Koudounas, Alkis, et autres
Publié: (2024)
MVP: Multi-source Voice Pathology detection
par: Koudounas, Alkis, et autres
Publié: (2025)
par: Koudounas, Alkis, et autres
Publié: (2025)
Houston we have a Divergence: A Subgroup Performance Analysis of ASR Models
par: Koudounas, Alkis, et autres
Publié: (2024)
par: Koudounas, Alkis, et autres
Publié: (2024)
voc2vec: A Foundation Model for Non-Verbal Vocalization
par: Koudounas, Alkis, et autres
Publié: (2025)
par: Koudounas, Alkis, et autres
Publié: (2025)
Benchmarking Representations for Speech, Music, and Acoustic Events
par: La Quatra, Moreno, et autres
Publié: (2024)
par: La Quatra, Moreno, et autres
Publié: (2024)
DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset
par: Koudounas, Alkis, et autres
Publié: (2025)
par: Koudounas, Alkis, et autres
Publié: (2025)
"Alexa, can you forget me?" Machine Unlearning Benchmark in Spoken Language Understanding
par: Koudounas, Alkis, et autres
Publié: (2025)
par: Koudounas, Alkis, et autres
Publié: (2025)
Hallucination Benchmark for Speech Foundation Models
par: Koudounas, Alkis, et autres
Publié: (2025)
par: Koudounas, Alkis, et autres
Publié: (2025)
End-to-End Integration of Speech Separation and Voice Activity Detection for Low-Latency Diarization of Telephone Conversations
par: Morrone, Giovanni, et autres
Publié: (2023)
par: Morrone, Giovanni, et autres
Publié: (2023)
Improving Generalization for AI-Synthesized Voice Detection
par: Ren, Hainan, et autres
Publié: (2024)
par: Ren, Hainan, et autres
Publié: (2024)
ITALIC: An Italian Intent Classification Dataset
par: Koudounas, Alkis, et autres
Publié: (2023)
par: Koudounas, Alkis, et autres
Publié: (2023)
OpenVoice: Versatile Instant Voice Cloning
par: Qin, Zengyi, et autres
Publié: (2023)
par: Qin, Zengyi, et autres
Publié: (2023)
Attentive-based Multi-level Feature Fusion for Voice Disorder Diagnosis
par: Shen, Lipeng, et autres
Publié: (2024)
par: Shen, Lipeng, et autres
Publié: (2024)
DiffAnon: Diffusion-based Prosody Control for Voice Anonymization
par: Ulgen, Ismail Rasim, et autres
Publié: (2026)
par: Ulgen, Ismail Rasim, et autres
Publié: (2026)
Discrete Unit based Masking for Improving Disentanglement in Voice Conversion
par: Lee, Philip H., et autres
Publié: (2024)
par: Lee, Philip H., et autres
Publié: (2024)
Perturbed Public Voices (P$^{2}$V): A Dataset for Robust Audio Deepfake Detection
par: Gao, Chongyang, et autres
Publié: (2025)
par: Gao, Chongyang, et autres
Publié: (2025)
Voice-ENHANCE: Speech Restoration using a Diffusion-based Voice Conversion Framework
par: Byun, Kyungguen, et autres
Publié: (2025)
par: Byun, Kyungguen, et autres
Publié: (2025)
NaturalVoices: A Large-Scale, Spontaneous and Emotional Podcast Dataset for Voice Conversion
par: Du, Zongyang, et autres
Publié: (2025)
par: Du, Zongyang, et autres
Publié: (2025)
VANPY: Voice Analysis Framework
par: Koushnir, Gregory, et autres
Publié: (2025)
par: Koushnir, Gregory, et autres
Publié: (2025)
A Novel Stochastic Transformer-based Approach for Post-Traumatic Stress Disorder Detection using Audio Recording of Clinical Interviews
par: Dia, Mamadou, et autres
Publié: (2024)
par: Dia, Mamadou, et autres
Publié: (2024)
Towards Robust Assessment of Pathological Voices via Combined Low-Level Descriptors and Foundation Model Representations
par: Ariyanti, Whenty, et autres
Publié: (2025)
par: Ariyanti, Whenty, et autres
Publié: (2025)
Multichannel Voice Trigger Detection Based on Transform-average-concatenate
par: Higuchi, Takuya, et autres
Publié: (2023)
par: Higuchi, Takuya, et autres
Publié: (2023)
Profile-Error-Tolerant Target-Speaker Voice Activity Detection
par: Wang, Dongmei, et autres
Publié: (2023)
par: Wang, Dongmei, et autres
Publié: (2023)
Compact Neural TTS Voices for Accessibility
par: Jain, Kunal, et autres
Publié: (2025)
par: Jain, Kunal, et autres
Publié: (2025)
Speech to Speech Synthesis for Voice Impersonation
par: Johnson, Bjorn, et autres
Publié: (2026)
par: Johnson, Bjorn, et autres
Publié: (2026)
Discrete Optimal Transport and Voice Conversion
par: Selitskiy, Anton, et autres
Publié: (2025)
par: Selitskiy, Anton, et autres
Publié: (2025)
BiSinger: Bilingual Singing Voice Synthesis
par: Zhou, Huali, et autres
Publié: (2023)
par: Zhou, Huali, et autres
Publié: (2023)
Zero-shot Voice Conversion with Diffusion Transformers
par: Liu, Songting
Publié: (2024)
par: Liu, Songting
Publié: (2024)
Optimal Transport Maps are Good Voice Converters
par: Asadulaev, Arip, et autres
Publié: (2024)
par: Asadulaev, Arip, et autres
Publié: (2024)
Voice Conversion-based Privacy through Adversarial Information Hiding
par: Webber, Jacob J, et autres
Publié: (2024)
par: Webber, Jacob J, et autres
Publié: (2024)
TokSing: Singing Voice Synthesis based on Discrete Tokens
par: Wu, Yuning, et autres
Publié: (2024)
par: Wu, Yuning, et autres
Publié: (2024)
SiFiSinger: A High-Fidelity End-to-End Singing Voice Synthesizer based on Source-filter Model
par: Cui, Jianwei, et autres
Publié: (2024)
par: Cui, Jianwei, et autres
Publié: (2024)
Tessellated Linear Model for Age Prediction from Voice
par: Alharthi, Dareen, et autres
Publié: (2025)
par: Alharthi, Dareen, et autres
Publié: (2025)
QvTAD: Differential Relative Attribute Learning for Voice Timbre Attribute Detection
par: Wu, Zhiyu, et autres
Publié: (2025)
par: Wu, Zhiyu, et autres
Publié: (2025)
Single-Microphone Speaker Separation and Voice Activity Detection in Noisy and Reverberant Environments
par: Opochinsky, Renana, et autres
Publié: (2024)
par: Opochinsky, Renana, et autres
Publié: (2024)
Channel-Combination Algorithms for Robust Distant Voice Activity and Overlapped Speech Detection
par: Mariotte, Théo, et autres
Publié: (2024)
par: Mariotte, Théo, et autres
Publié: (2024)
Speaker Embeddings With Weakly Supervised Voice Activity Detection For Efficient Speaker Diarization
par: Thienpondt, Jenthe, et autres
Publié: (2024)
par: Thienpondt, Jenthe, et autres
Publié: (2024)
EchoVoices: Preserving Generational Voices and Memories for Seniors and Children
par: Xu, Haiying, et autres
Publié: (2025)
par: Xu, Haiying, et autres
Publié: (2025)
Voice Signal Processing for Machine Learning. The Case of Speaker Isolation
par: Ganchev, Radan
Publié: (2024)
par: Ganchev, Radan
Publié: (2024)
On the Generation and Removal of Speaker Adversarial Perturbation for Voice-Privacy Protection
par: Guo, Chenyang, et autres
Publié: (2024)
par: Guo, Chenyang, et autres
Publié: (2024)
Documents similaires
-
Voice Disorder Analysis: a Transformer-based Approach
par: Koudounas, Alkis, et autres
Publié: (2024) -
MVP: Multi-source Voice Pathology detection
par: Koudounas, Alkis, et autres
Publié: (2025) -
Houston we have a Divergence: A Subgroup Performance Analysis of ASR Models
par: Koudounas, Alkis, et autres
Publié: (2024) -
voc2vec: A Foundation Model for Non-Verbal Vocalization
par: Koudounas, Alkis, et autres
Publié: (2025) -
Benchmarking Representations for Speech, Music, and Acoustic Events
par: La Quatra, Moreno, et autres
Publié: (2024)