Benchmarking Foundation Speech and Language Models for Alzheimer's Disease and Related Dementia Detection from Spontaneous Speech
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Jingyu, Mao, Lingchao, Wang, Hairong, Wang, Zhendong, Mao, Xi, Ni, Xuelei Sherry |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Multi-View Multi-Task Modeling with Speech Foundation Models for Speech Forensic Tasks
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
Fast and High-Quality Auto-Regressive Speech Synthesis via Speculative Decoding
par: Li, Bohan, et autres
Publié: (2024)
par: Li, Bohan, et autres
Publié: (2024)
STAR: Speech-to-Audio Generation via Representation Learning
par: Xie, Zeyu, et autres
Publié: (2025)
par: Xie, Zeyu, et autres
Publié: (2025)
Gelina: Unified Speech and Gesture Synthesis via Interleaved Token Prediction
par: Guichoux, Téo, et autres
Publié: (2025)
par: Guichoux, Téo, et autres
Publié: (2025)
Large Vocabulary Spontaneous Speech Recognition for Tigrigna
par: Kahsu, Ataklti, et autres
Publié: (2023)
par: Kahsu, Ataklti, et autres
Publié: (2023)
MATER: Multi-level Acoustic and Textual Emotion Representation for Interpretable Speech Emotion Recognition
par: Jon, Hyo Jin, et autres
Publié: (2025)
par: Jon, Hyo Jin, et autres
Publié: (2025)
Investigating Prosodic Signatures via Speech Pre-Trained Models for Audio Deepfake Source Attribution
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
SeQuiFi: Mitigating Catastrophic Forgetting in Speech Emotion Recognition with Sequential Class-Finetuning
par: Jain, Sarthak, et autres
Publié: (2024)
par: Jain, Sarthak, et autres
Publié: (2024)
A Speech Enhancement Method Using Fast Fourier Transform and Convolutional Autoencoder
par: Kow, Pu-Yun, et autres
Publié: (2025)
par: Kow, Pu-Yun, et autres
Publié: (2025)
Are Music Foundation Models Better at Singing Voice Deepfake Detection? Far-Better Fuse them with Speech Foundation Models
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
Masked Modeling Duo: Towards a Universal Audio Pre-training Framework
par: Niizumi, Daisuke, et autres
Publié: (2024)
par: Niizumi, Daisuke, et autres
Publié: (2024)
Exploring Pre-trained General-purpose Audio Representations for Heart Murmur Detection
par: Niizumi, Daisuke, et autres
Publié: (2024)
par: Niizumi, Daisuke, et autres
Publié: (2024)
Towards Pre-training an Effective Respiratory Audio Foundation Model
par: Niizumi, Daisuke, et autres
Publié: (2025)
par: Niizumi, Daisuke, et autres
Publié: (2025)
Assessing the Utility of Audio Foundation Models for Heart and Respiratory Sound Analysis
par: Niizumi, Daisuke, et autres
Publié: (2025)
par: Niizumi, Daisuke, et autres
Publié: (2025)
Quality Over Quantity? LLM-Based Curation for a Data-Efficient Audio-Video Foundation Model
par: Vosoughi, Ali, et autres
Publié: (2025)
par: Vosoughi, Ali, et autres
Publié: (2025)
AudioTime: A Temporally-aligned Audio-text Benchmark Dataset
par: Xie, Zeyu, et autres
Publié: (2024)
par: Xie, Zeyu, et autres
Publié: (2024)
FakeSound2: A Benchmark for Explainable and Generalizable Deepfake Sound Detection
par: Xie, Zeyu, et autres
Publié: (2025)
par: Xie, Zeyu, et autres
Publié: (2025)
Text2midi-InferAlign: Improving Symbolic Music Generation with Inference-Time Alignment
par: Roy, Abhinaba, et autres
Publié: (2025)
par: Roy, Abhinaba, et autres
Publié: (2025)
Leveraging Multimodal Methods and Spontaneous Speech for Alzheimer's Disease Identification
par: Gao, Yifan, et autres
Publié: (2024)
par: Gao, Yifan, et autres
Publié: (2024)
Cross-modal Cognitive Consensus guided Audio-Visual Segmentation
par: Shi, Zhaofeng, et autres
Publié: (2023)
par: Shi, Zhaofeng, et autres
Publié: (2023)
Can Sound Replace Vision in LLaVA With Token Substitution?
par: Vosoughi, Ali, et autres
Publié: (2025)
par: Vosoughi, Ali, et autres
Publié: (2025)
BowelRCNN: Region-based Convolutional Neural Network System for Bowel Sound Auscultation
par: Matynia, Igor, et autres
Publié: (2025)
par: Matynia, Igor, et autres
Publié: (2025)
Spectral oversubtraction? An approach for speech enhancement after robot ego speech filtering in semi-real-time
par: Li, Yue, et autres
Publié: (2024)
par: Li, Yue, et autres
Publié: (2024)
M2D-CLAP: Masked Modeling Duo Meets CLAP for Learning General-purpose Audio-Language Representation
par: Niizumi, Daisuke, et autres
Publié: (2024)
par: Niizumi, Daisuke, et autres
Publié: (2024)
Monaural Multi-Speaker Speech Separation Using Efficient Transformer Model
par: Rijal, S., et autres
Publié: (2023)
par: Rijal, S., et autres
Publié: (2023)
Simultaneous source separation of unknown numbers of single-channel underwater acoustic signals based on deep neural networks with separator-decoder structure
par: Sun, Qinggang, et autres
Publié: (2022)
par: Sun, Qinggang, et autres
Publié: (2022)
Strong Alone, Stronger Together: Synergizing Modality-Binding Foundation Models with Optimal Transport for Non-Verbal Emotion Recognition
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
Exploring Gender-Specific Speech Patterns in Automatic Suicide Risk Assessment
par: Gerczuk, Maurice, et autres
Publié: (2024)
par: Gerczuk, Maurice, et autres
Publié: (2024)
PicoAudio: Enabling Precise Timestamp and Frequency Controllability of Audio Events in Text-to-audio Generation
par: Xie, Zeyu, et autres
Publié: (2024)
par: Xie, Zeyu, et autres
Publié: (2024)
Sound Safeguarding for Acoustic Measurement Using Any Sounds: Tools and Applications
par: Kawahara, Hideki, et autres
Publié: (2025)
par: Kawahara, Hideki, et autres
Publié: (2025)
CAST-TTS: A Simple Cross-Attention Framework for Unified Timbre Control in TTS
par: Zheng, Zihao, et autres
Publié: (2026)
par: Zheng, Zihao, et autres
Publié: (2026)
PicoAudio2: Temporal Controllable Text-to-Audio Generation with Natural Language Description
par: Zheng, Zihao, et autres
Publié: (2025)
par: Zheng, Zihao, et autres
Publié: (2025)
FakeSound: Deepfake General Audio Detection
par: Xie, Zeyu, et autres
Publié: (2024)
par: Xie, Zeyu, et autres
Publié: (2024)
SeamlessEdit: Background Noise Aware Zero-Shot Speech Editing with in-Context Enhancement
par: Chen, Kuan-Yu, et autres
Publié: (2025)
par: Chen, Kuan-Yu, et autres
Publié: (2025)
Integrating Pause Information with Word Embeddings in Language Models for Alzheimer's Disease Detection from Spontaneous Speech
par: Pu, Yu, et autres
Publié: (2025)
par: Pu, Yu, et autres
Publié: (2025)
A Unified Model For Voice and Accent Conversion In Speech and Singing using Self-Supervised Learning and Feature Extraction
par: Cheripally, Sowmya
Publié: (2024)
par: Cheripally, Sowmya
Publié: (2024)
EDSep: An Effective Diffusion-Based Method for Speech Source Separation
par: Dong, Jinwei, et autres
Publié: (2025)
par: Dong, Jinwei, et autres
Publié: (2025)
Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis
par: Salehi, Pegah, et autres
Publié: (2024)
par: Salehi, Pegah, et autres
Publié: (2024)
Vox-Profile: A Speech Foundation Model Benchmark for Characterizing Diverse Speaker and Speech Traits
par: Feng, Tiantian, et autres
Publié: (2025)
par: Feng, Tiantian, et autres
Publié: (2025)
Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English
par: Zhang, Haoyang, et autres
Publié: (2025)
par: Zhang, Haoyang, et autres
Publié: (2025)
Documents similaires
-
Multi-View Multi-Task Modeling with Speech Foundation Models for Speech Forensic Tasks
par: Phukan, Orchid Chetia, et autres
Publié: (2024) -
Fast and High-Quality Auto-Regressive Speech Synthesis via Speculative Decoding
par: Li, Bohan, et autres
Publié: (2024) -
STAR: Speech-to-Audio Generation via Representation Learning
par: Xie, Zeyu, et autres
Publié: (2025) -
Gelina: Unified Speech and Gesture Synthesis via Interleaved Token Prediction
par: Guichoux, Téo, et autres
Publié: (2025) -
Large Vocabulary Spontaneous Speech Recognition for Tigrigna
par: Kahsu, Ataklti, et autres
Publié: (2023)