Foundation Model-based Evaluation of Neuropsychiatric Disorders: A Lifespan-Inclusive, Multi-Modal, and Multi-Lingual Study
Fuente:
arXiv
Salvato in:
| Autori principali: | Dong, Zhongren, Guo, Haotian, Xu, Weixiang, Zhao, Huan, Zhang, Zixing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Re-Parameterization of Lightweight Transformer for On-Device Speech Emotion Recognition
di: Zhang, Zixing, et al.
Pubblicazione: (2024)
di: Zhang, Zixing, et al.
Pubblicazione: (2024)
HAFFormer: A Hierarchical Attention-Free Framework for Alzheimer's Disease Detection From Spontaneous Speech
di: Dong, Zhongren, et al.
Pubblicazione: (2024)
di: Dong, Zhongren, et al.
Pubblicazione: (2024)
ParaLBench: A Large-Scale Benchmark for Computational Paralinguistics over Acoustic Foundation Models
di: Zhang, Zixing, et al.
Pubblicazione: (2024)
di: Zhang, Zixing, et al.
Pubblicazione: (2024)
Low-Rank and Sparse Model Merging for Multi-Lingual Speech Recognition and Translation
di: Zhao, Qiuming, et al.
Pubblicazione: (2025)
di: Zhao, Qiuming, et al.
Pubblicazione: (2025)
SACodec: Asymmetric Quantization with Semantic Anchoring for Low-Bitrate High-Fidelity Neural Speech Codecs
di: Dong, Zhongren, et al.
Pubblicazione: (2025)
di: Dong, Zhongren, et al.
Pubblicazione: (2025)
Improving X-Codec-2.0 for Multi-Lingual Speech: 25 Hz Latent Rate and 24 kHz Sampling
di: Zolkepli, Husein
Pubblicazione: (2026)
di: Zolkepli, Husein
Pubblicazione: (2026)
Leveraging Parameter-Efficient Transfer Learning for Multi-Lingual Text-to-Speech Adaptation
di: Li, Yingting, et al.
Pubblicazione: (2024)
di: Li, Yingting, et al.
Pubblicazione: (2024)
Cross-Lingual Multi-Granularity Framework for Interpretable Parkinson's Disease Diagnosis from Speech
di: Tougui, Ilias, et al.
Pubblicazione: (2025)
di: Tougui, Ilias, et al.
Pubblicazione: (2025)
POTSA: A Cross-Lingual Speech Alignment Framework for Speech-to-Text Translation
di: Li, Xuanchen, et al.
Pubblicazione: (2025)
di: Li, Xuanchen, et al.
Pubblicazione: (2025)
Semi-Supervised Cognitive State Classification from Speech with Multi-View Pseudo-Labeling
di: Li, Yuanchao, et al.
Pubblicazione: (2024)
di: Li, Yuanchao, et al.
Pubblicazione: (2024)
VCB Bench: An Evaluation Benchmark for Audio-Grounded Large Language Model Conversational Agents
di: Hu, Jiliang, et al.
Pubblicazione: (2025)
di: Hu, Jiliang, et al.
Pubblicazione: (2025)
Enhancing Multimodal Emotion Recognition through Multi-Granularity Cross-Modal Alignment
di: Wang, Xuechen, et al.
Pubblicazione: (2024)
di: Wang, Xuechen, et al.
Pubblicazione: (2024)
Improving Audio Codec-based Zero-Shot Text-to-Speech Synthesis with Multi-Modal Context and Large Language Model
di: Xue, Jinlong, et al.
Pubblicazione: (2024)
di: Xue, Jinlong, et al.
Pubblicazione: (2024)
MIKU-PAL: An Automated and Standardized Multi-Modal Method for Speech Paralinguistic and Affect Labeling
di: Cheng, Yifan, et al.
Pubblicazione: (2025)
di: Cheng, Yifan, et al.
Pubblicazione: (2025)
CLiFT-ASR: A Cross-Lingual Fine-Tuning Framework for Low-Resource Taiwanese Hokkien Speech Recognition
di: Sung, Hung-Yang, et al.
Pubblicazione: (2025)
di: Sung, Hung-Yang, et al.
Pubblicazione: (2025)
ProsodyFM: Unsupervised Phrasing and Intonation Control for Intelligible Speech Synthesis
di: He, Xiangheng, et al.
Pubblicazione: (2024)
di: He, Xiangheng, et al.
Pubblicazione: (2024)
Multi-Modal Automatic Prosody Annotation with Contrastive Pretraining of SSWP
di: Zhong, Jinzuomu, et al.
Pubblicazione: (2023)
di: Zhong, Jinzuomu, et al.
Pubblicazione: (2023)
On the Evaluation of Speech Foundation Models for Spoken Language Understanding
di: Arora, Siddhant, et al.
Pubblicazione: (2024)
di: Arora, Siddhant, et al.
Pubblicazione: (2024)
Audio MultiChallenge: A Multi-Turn Evaluation of Spoken Dialogue Systems on Natural Human Interaction
di: Gosai, Advait, et al.
Pubblicazione: (2025)
di: Gosai, Advait, et al.
Pubblicazione: (2025)
Style Amnesia: Investigating Speaking Style Degradation and Mitigation in Multi-Turn Spoken Language Models
di: Lin, Yu-Xiang, et al.
Pubblicazione: (2025)
di: Lin, Yu-Xiang, et al.
Pubblicazione: (2025)
Data-Centric Improvements for Enhancing Multi-Modal Understanding in Spoken Conversation Modeling
di: Chen, Maximillian, et al.
Pubblicazione: (2024)
di: Chen, Maximillian, et al.
Pubblicazione: (2024)
SSR: Alignment-Aware Modality Connector for Speech Language Models
di: Tan, Weiting, et al.
Pubblicazione: (2024)
di: Tan, Weiting, et al.
Pubblicazione: (2024)
BRACE: A Benchmark for Robust Audio Caption Quality Evaluation
di: Guo, Tianyu, et al.
Pubblicazione: (2025)
di: Guo, Tianyu, et al.
Pubblicazione: (2025)
Equipping LLM with Directional Multi-Talker Speech Understanding Capabilities
di: Lin, Ju, et al.
Pubblicazione: (2026)
di: Lin, Ju, et al.
Pubblicazione: (2026)
DELULU: Discriminative Embedding Learning Using Latent Units for Speaker-Aware Self-Trained Speech Foundational Model
di: Baali, Massa, et al.
Pubblicazione: (2025)
di: Baali, Massa, et al.
Pubblicazione: (2025)
Description-based Controllable Text-to-Speech with Cross-Lingual Voice Control
di: Yamamoto, Ryuichi, et al.
Pubblicazione: (2024)
di: Yamamoto, Ryuichi, et al.
Pubblicazione: (2024)
FCPE: A Fast Context-based Pitch Estimation Model
di: Luo, Yuxin, et al.
Pubblicazione: (2025)
di: Luo, Yuxin, et al.
Pubblicazione: (2025)
Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play
di: Shi, Yemin, et al.
Pubblicazione: (2025)
di: Shi, Yemin, et al.
Pubblicazione: (2025)
M-CIF: Multi-Scale Alignment For CIF-Based Non-Autoregressive ASR
di: Mao, Ruixiang, et al.
Pubblicazione: (2025)
di: Mao, Ruixiang, et al.
Pubblicazione: (2025)
Finding My Voice: Generative Reconstruction of Disordered Speech for Automated Clinical Evaluation
di: Rosero, Karen, et al.
Pubblicazione: (2025)
di: Rosero, Karen, et al.
Pubblicazione: (2025)
Robust Audio-Text Retrieval via Cross-Modal Attention and Hybrid Loss
di: Liu, Meizhu, et al.
Pubblicazione: (2026)
di: Liu, Meizhu, et al.
Pubblicazione: (2026)
DialogueAgents: A Hybrid Agent-Based Speech Synthesis Framework for Multi-Party Dialogue
di: Li, Xiang, et al.
Pubblicazione: (2025)
di: Li, Xiang, et al.
Pubblicazione: (2025)
MUGEN: Evaluating and Improving Multi-audio Understanding of Large Audio-Language Models
di: Yang, Chih-Kai, et al.
Pubblicazione: (2026)
di: Yang, Chih-Kai, et al.
Pubblicazione: (2026)
Large Language Model Should Understand Pinyin for Chinese ASR Error Correction
di: Li, Yuang, et al.
Pubblicazione: (2024)
di: Li, Yuang, et al.
Pubblicazione: (2024)
Emphasis Rendering for Conversational Text-to-Speech with Multi-modal Multi-scale Context Modeling
di: Liu, Rui, et al.
Pubblicazione: (2024)
di: Liu, Rui, et al.
Pubblicazione: (2024)
VocalNet-M2: Advancing Low-Latency Spoken Language Modeling via Integrated Multi-Codebook Tokenization and Multi-Token Prediction
di: Wang, Yuhao, et al.
Pubblicazione: (2025)
di: Wang, Yuhao, et al.
Pubblicazione: (2025)
Multi-Modal Retrieval For Large Language Model Based Speech Recognition
di: Kolehmainen, Jari, et al.
Pubblicazione: (2024)
di: Kolehmainen, Jari, et al.
Pubblicazione: (2024)
DementiaBank-Emotion: A Multi-Rater Emotion Annotation Corpus for Alzheimer's Disease Speech (Version 1.0)
di: Jeong, Cheonkam, et al.
Pubblicazione: (2026)
di: Jeong, Cheonkam, et al.
Pubblicazione: (2026)
MultiPA: A Multi-task Speech Pronunciation Assessment Model for Open Response Scenarios
di: Chen, Yu-Wen, et al.
Pubblicazione: (2023)
di: Chen, Yu-Wen, et al.
Pubblicazione: (2023)
FluentEditor2: Text-based Speech Editing by Modeling Multi-Scale Acoustic and Prosody Consistency
di: Liu, Rui, et al.
Pubblicazione: (2024)
di: Liu, Rui, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Re-Parameterization of Lightweight Transformer for On-Device Speech Emotion Recognition
di: Zhang, Zixing, et al.
Pubblicazione: (2024) -
HAFFormer: A Hierarchical Attention-Free Framework for Alzheimer's Disease Detection From Spontaneous Speech
di: Dong, Zhongren, et al.
Pubblicazione: (2024) -
ParaLBench: A Large-Scale Benchmark for Computational Paralinguistics over Acoustic Foundation Models
di: Zhang, Zixing, et al.
Pubblicazione: (2024) -
Low-Rank and Sparse Model Merging for Multi-Lingual Speech Recognition and Translation
di: Zhao, Qiuming, et al.
Pubblicazione: (2025) -
SACodec: Asymmetric Quantization with Semantic Anchoring for Low-Bitrate High-Fidelity Neural Speech Codecs
di: Dong, Zhongren, et al.
Pubblicazione: (2025)