Predicting Cognitive Decline: A Multimodal AI Approach to Dementia Screening from Speech
Fuente:
arXiv
Salvato in:
| Autori principali: | Chi, Lei, Sharma, Arav, Gebhardt, Ari, Colonel, Joseph T. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Leveraging Cascaded Binary Classification and Multimodal Fusion for Dementia Detection through Spontaneous Speech
di: Liu, Yin-Long, et al.
Pubblicazione: (2025)
di: Liu, Yin-Long, et al.
Pubblicazione: (2025)
A Composite Predictive-Generative Approach to Monaural Universal Speech Enhancement
di: Zhang, Jie, et al.
Pubblicazione: (2025)
di: Zhang, Jie, et al.
Pubblicazione: (2025)
Revisiting Modeling and Evaluation Approaches in Speech Emotion Recognition: Considering Subjectivity of Annotators and Ambiguity of Emotions
di: Chou, Huang-Cheng, et al.
Pubblicazione: (2025)
di: Chou, Huang-Cheng, et al.
Pubblicazione: (2025)
ASR for Affective Speech: Investigating Impact of Emotion and Speech Generative Strategy
di: Wu, Ya-Tse, et al.
Pubblicazione: (2026)
di: Wu, Ya-Tse, et al.
Pubblicazione: (2026)
Adapting Speech Foundation Models for Unified Multimodal Speech Recognition with Large Language Models
di: Zhang, Jing-Xuan, et al.
Pubblicazione: (2025)
di: Zhang, Jing-Xuan, et al.
Pubblicazione: (2025)
CAtCh: Cognitive Assessment through Cookie Thief
di: Colonel, Joseph T, et al.
Pubblicazione: (2025)
di: Colonel, Joseph T, et al.
Pubblicazione: (2025)
Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation
di: Liu, Wenrui, et al.
Pubblicazione: (2025)
di: Liu, Wenrui, et al.
Pubblicazione: (2025)
FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech
di: Ma, Linhan, et al.
Pubblicazione: (2025)
di: Ma, Linhan, et al.
Pubblicazione: (2025)
Multimodal Assessment of Speech Impairment in ALS Using Audio-Visual and Machine Learning Approaches
di: Pierotti, Francesco, et al.
Pubblicazione: (2025)
di: Pierotti, Francesco, et al.
Pubblicazione: (2025)
Towards Multimodal Query-Based Spatial Audio Source Extraction
di: Yu, Chenxin, et al.
Pubblicazione: (2025)
di: Yu, Chenxin, et al.
Pubblicazione: (2025)
Perceptual Ratings Predict Speech Inversion Articulatory Kinematics in Childhood Speech Sound Disorders
di: Benway, Nina R., et al.
Pubblicazione: (2025)
di: Benway, Nina R., et al.
Pubblicazione: (2025)
UrduSpeech: A 156-Hour Urdu Speech Corpus with 12-Dimension Paralinguistic Annotations
di: Haq, Attia Nafees ul, et al.
Pubblicazione: (2026)
di: Haq, Attia Nafees ul, et al.
Pubblicazione: (2026)
Tackling Cognitive Impairment Detection from Speech: A submission to the PROCESS Challenge
di: Botelho, Catarina, et al.
Pubblicazione: (2024)
di: Botelho, Catarina, et al.
Pubblicazione: (2024)
Reasoning Beyond Majority Vote: An Explainable SpeechLM Framework for Speech Emotion Recognition
di: Su, Bo-Hao, et al.
Pubblicazione: (2025)
di: Su, Bo-Hao, et al.
Pubblicazione: (2025)
$\text{M}^3\text{PDB}$: A Multimodal, Multi-Label, Multilingual Prompt Database for Speech Generation
di: Zhu, Boyu, et al.
Pubblicazione: (2025)
di: Zhu, Boyu, et al.
Pubblicazione: (2025)
Towards Frame-level Quality Predictions of Synthetic Speech
di: Kuhlmann, Michael, et al.
Pubblicazione: (2025)
di: Kuhlmann, Michael, et al.
Pubblicazione: (2025)
Deep Speech Synthesis from Multimodal Articulatory Representations
di: Wu, Peter, et al.
Pubblicazione: (2024)
di: Wu, Peter, et al.
Pubblicazione: (2024)
Towards Explainable Spoofed Speech Attribution and Detection:a Probabilistic Approach for Characterizing Speech Synthesizer Components
di: Mishra, Jagabandhu, et al.
Pubblicazione: (2025)
di: Mishra, Jagabandhu, et al.
Pubblicazione: (2025)
Large Language Model Guided Decoding for Self-Supervised Speech Recognition
di: Cohen, Eyal, et al.
Pubblicazione: (2025)
di: Cohen, Eyal, et al.
Pubblicazione: (2025)
HYFuse: Aligning Heterogeneous Speech Pre-Trained Representations in Hyperbolic Space for Speech Emotion Recognition
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2025)
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2025)
Multimodal Representation Loss Between Timed Text and Audio for Regularized Speech Separation
di: Hsieh, Tsun-An, et al.
Pubblicazione: (2024)
di: Hsieh, Tsun-An, et al.
Pubblicazione: (2024)
Target Speech Diarization with Multimodal Prompts
di: Jiang, Yidi, et al.
Pubblicazione: (2024)
di: Jiang, Yidi, et al.
Pubblicazione: (2024)
Exploiting Longitudinal Speech Sessions via Voice Assistant Systems for Early Detection of Cognitive Decline
di: Qi, Kristin, et al.
Pubblicazione: (2024)
di: Qi, Kristin, et al.
Pubblicazione: (2024)
AttentiveMOS: A Lightweight Attention-Only Model for Speech Quality Prediction
di: Kibria, Imran E, et al.
Pubblicazione: (2024)
di: Kibria, Imran E, et al.
Pubblicazione: (2024)
Selective Invocation for Multilingual ASR: A Cost-effective Approach Adapting to Speech Recognition Difficulty
di: Xue, Hongfei, et al.
Pubblicazione: (2025)
di: Xue, Hongfei, et al.
Pubblicazione: (2025)
Modeling Multi-Level Hearing Loss for Speech Intelligibility Prediction
di: Zhou, Xiajie, et al.
Pubblicazione: (2025)
di: Zhou, Xiajie, et al.
Pubblicazione: (2025)
Generalizability of Predictive and Generative Speech Enhancement Models to Pathological Speakers
di: Hou, Mingchi, et al.
Pubblicazione: (2025)
di: Hou, Mingchi, et al.
Pubblicazione: (2025)
Speech-Based Cognitive Screening: A Systematic Evaluation of LLM Adaptation Strategies
di: Taherinezhad, Fatemeh, et al.
Pubblicazione: (2025)
di: Taherinezhad, Fatemeh, et al.
Pubblicazione: (2025)
Emo-bias: A Large Scale Evaluation of Social Bias on Speech Emotion Recognition
di: Lin, Yi-Cheng, et al.
Pubblicazione: (2024)
di: Lin, Yi-Cheng, et al.
Pubblicazione: (2024)
Stack Less, Repeat More: A Block Reusing Approach for Progressive Speech Enhancement
di: Kim, Jangyeon, et al.
Pubblicazione: (2025)
di: Kim, Jangyeon, et al.
Pubblicazione: (2025)
Toward Objective and Interpretable Prosody Evaluation in Text-to-Speech: A Linguistically Motivated Approach
di: Chan, Cedric, et al.
Pubblicazione: (2025)
di: Chan, Cedric, et al.
Pubblicazione: (2025)
ToneUnit: A Speech Discretization Approach for Tonal Language Speech Synthesis
di: Tao, Dehua, et al.
Pubblicazione: (2024)
di: Tao, Dehua, et al.
Pubblicazione: (2024)
A Multi-Stage Framework for Multimodal Controllable Speech Synthesis
di: Niu, Rui, et al.
Pubblicazione: (2025)
di: Niu, Rui, et al.
Pubblicazione: (2025)
Single-Codec: Single-Codebook Speech Codec towards High-Performance Speech Generation
di: Li, Hanzhao, et al.
Pubblicazione: (2024)
di: Li, Hanzhao, et al.
Pubblicazione: (2024)
Real-time Speech Restoration using Data Prediction Mean Flows
di: Braun, Sebastian
Pubblicazione: (2026)
di: Braun, Sebastian
Pubblicazione: (2026)
Audio-Visual Speech Enhancement for Spatial Audio - Spatial-VisualVoice and the MAVE Database
di: Yaffe, Danielle, et al.
Pubblicazione: (2025)
di: Yaffe, Danielle, et al.
Pubblicazione: (2025)
Pitfalls and Limits in Automatic Dementia Assessment
di: Braun, Franziska, et al.
Pubblicazione: (2025)
di: Braun, Franziska, et al.
Pubblicazione: (2025)
A Semi-spontaneous Dutch Speech Dataset for Speech Enhancement and Speech Recognition
di: de Groot, Dimme, et al.
Pubblicazione: (2026)
di: de Groot, Dimme, et al.
Pubblicazione: (2026)
Seeing the Context: Rich Visual Context-Aware Speech Recognition via Multimodal Reasoning
di: Tian, Wenjie, et al.
Pubblicazione: (2026)
di: Tian, Wenjie, et al.
Pubblicazione: (2026)
Toward Fair Speech Technologies: A Comprehensive Survey of Bias and Fairness in Speech AI
di: Lin, Yi-Cheng, et al.
Pubblicazione: (2026)
di: Lin, Yi-Cheng, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Leveraging Cascaded Binary Classification and Multimodal Fusion for Dementia Detection through Spontaneous Speech
di: Liu, Yin-Long, et al.
Pubblicazione: (2025) -
A Composite Predictive-Generative Approach to Monaural Universal Speech Enhancement
di: Zhang, Jie, et al.
Pubblicazione: (2025) -
Revisiting Modeling and Evaluation Approaches in Speech Emotion Recognition: Considering Subjectivity of Annotators and Ambiguity of Emotions
di: Chou, Huang-Cheng, et al.
Pubblicazione: (2025) -
ASR for Affective Speech: Investigating Impact of Emotion and Speech Generative Strategy
di: Wu, Ya-Tse, et al.
Pubblicazione: (2026) -
Adapting Speech Foundation Models for Unified Multimodal Speech Recognition with Large Language Models
di: Zhang, Jing-Xuan, et al.
Pubblicazione: (2025)