Graph Modelling Analysis of Speech-Gesture Interaction for Aphasia Severity Estimation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kollapally, Navya Martin, Akers, Christa, Joseph, Renjith Nelson |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Voice Biomarker Analysis and Automated Severity Classification of Dysarthric Speech in a Multilingual Context
par: Yeo, Eunjung
Publié: (2024)
par: Yeo, Eunjung
Publié: (2024)
Addressing Pitfalls in Auditing Practices of Automatic Speech Recognition Technologies: A Case Study of People with Aphasia
par: Mei, Katelyn Xiaoying, et autres
Publié: (2025)
par: Mei, Katelyn Xiaoying, et autres
Publié: (2025)
Intra- and Inter-modal Context Interaction Modeling for Conversational Speech Synthesis
par: Jia, Zhenqi, et autres
Publié: (2024)
par: Jia, Zhenqi, et autres
Publié: (2024)
DiffAR: Denoising Diffusion Autoregressive Model for Raw Speech Waveform Generation
par: Benita, Roi, et autres
Publié: (2023)
par: Benita, Roi, et autres
Publié: (2023)
Scaling Analysis of Interleaved Speech-Text Language Models
par: Maimon, Gallil, et autres
Publié: (2025)
par: Maimon, Gallil, et autres
Publié: (2025)
SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models
par: Zhang, Xin, et autres
Publié: (2023)
par: Zhang, Xin, et autres
Publié: (2023)
Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction
par: Li, Tianpeng, et autres
Publié: (2025)
par: Li, Tianpeng, et autres
Publié: (2025)
SALM-Duplex: Efficient and Direct Duplex Modeling for Speech-to-Speech Language Model
par: Hu, Ke, et autres
Publié: (2025)
par: Hu, Ke, et autres
Publié: (2025)
Automatic Speech Recognition System-Independent Word Error Rate Estimation
par: Park, Chanho, et autres
Publié: (2024)
par: Park, Chanho, et autres
Publié: (2024)
ESPnet-SpeechLM: An Open Speech Language Model Toolkit
par: Tian, Jinchuan, et autres
Publié: (2025)
par: Tian, Jinchuan, et autres
Publié: (2025)
Speech Recognition Rescoring with Large Speech-Text Foundation Models
par: Shivakumar, Prashanth Gurunath, et autres
Publié: (2024)
par: Shivakumar, Prashanth Gurunath, et autres
Publié: (2024)
What Do Speech Foundation Models Not Learn About Speech?
par: Waheed, Abdul, et autres
Publié: (2024)
par: Waheed, Abdul, et autres
Publié: (2024)
Unified Pathological Speech Analysis with Prompt Tuning
par: Yang, Fei, et autres
Publié: (2024)
par: Yang, Fei, et autres
Publié: (2024)
PolySpeech: Exploring Unified Multitask Speech Models for Competitiveness with Single-task Models
par: Yang, Runyan, et autres
Publié: (2024)
par: Yang, Runyan, et autres
Publié: (2024)
PredGen: Accelerated Inference of Large Language Models through Input-Time Speculation for Real-Time Speech Interaction
par: Li, Shufan, et autres
Publié: (2025)
par: Li, Shufan, et autres
Publié: (2025)
S2S-Arena: Evaluating Paralinguistic Instruction Following in Speech-to-Speech Models
par: Jiang, Feng, et autres
Publié: (2025)
par: Jiang, Feng, et autres
Publié: (2025)
Compact Speech Translation Models via Discrete Speech Units Pretraining
par: Lam, Tsz Kin, et autres
Publié: (2024)
par: Lam, Tsz Kin, et autres
Publié: (2024)
An Empirical Study of Speech Language Models for Prompt-Conditioned Speech Synthesis
par: Peng, Yifan, et autres
Publié: (2024)
par: Peng, Yifan, et autres
Publié: (2024)
Speech DF Arena: A Leaderboard for Speech DeepFake Detection Models
par: Dowerah, Sandipana, et autres
Publié: (2025)
par: Dowerah, Sandipana, et autres
Publié: (2025)
Exploring the Effect of Segmentation and Vocabulary Size on Speech Tokenization for Speech Language Models
par: Kando, Shunsuke, et autres
Publié: (2025)
par: Kando, Shunsuke, et autres
Publié: (2025)
Exploring Effective Distillation of Self-Supervised Speech Models for Automatic Speech Recognition
par: Wang, Yujin, et autres
Publié: (2022)
par: Wang, Yujin, et autres
Publié: (2022)
Generating Data with Text-to-Speech and Large-Language Models for Conversational Speech Recognition
par: Cornell, Samuele, et autres
Publié: (2024)
par: Cornell, Samuele, et autres
Publié: (2024)
Modeling Sarcastic Speech: Semantic and Prosodic Cues in a Speech Synthesis Framework
par: Li, Zhu, et autres
Publié: (2025)
par: Li, Zhu, et autres
Publié: (2025)
MSLM-S2ST: A Multitask Speech Language Model for Textless Speech-to-Speech Translation with Speaker Style Preservation
par: Peng, Yifan, et autres
Publié: (2024)
par: Peng, Yifan, et autres
Publié: (2024)
Fast Word Error Rate Estimation Using Self-Supervised Representations for Speech and Text
par: Park, Chanho, et autres
Publié: (2023)
par: Park, Chanho, et autres
Publié: (2023)
Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis
par: Xu, Tianyi, et autres
Publié: (2025)
par: Xu, Tianyi, et autres
Publié: (2025)
Psychoacoustic Challenges Of Speech Enhancement On VoIP Platforms
par: Konan, Joseph, et autres
Publié: (2023)
par: Konan, Joseph, et autres
Publié: (2023)
Effective Context in Neural Speech Models
par: Meng, Yen, et autres
Publié: (2025)
par: Meng, Yen, et autres
Publié: (2025)
Hallucination Benchmark for Speech Foundation Models
par: Koudounas, Alkis, et autres
Publié: (2025)
par: Koudounas, Alkis, et autres
Publié: (2025)
Position-invariant Fine-tuning of Speech Enhancement Models with Self-supervised Speech Representations
par: Meghanani, Amit, et autres
Publié: (2026)
par: Meghanani, Amit, et autres
Publié: (2026)
Enhancing Indonesian Automatic Speech Recognition: Evaluating Multilingual Models with Diverse Speech Variabilities
par: Adila, Aulia, et autres
Publié: (2024)
par: Adila, Aulia, et autres
Publié: (2024)
EmphAssess : a Prosodic Benchmark on Assessing Emphasis Transfer in Speech-to-Speech Models
par: de Seyssel, Maureen, et autres
Publié: (2023)
par: de Seyssel, Maureen, et autres
Publié: (2023)
Age-Dependent Analysis and Stochastic Generation of Child-Directed Speech
par: Räsänen, Okko, et autres
Publié: (2024)
par: Räsänen, Okko, et autres
Publié: (2024)
TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models
par: Peng, Junyi, et autres
Publié: (2025)
par: Peng, Junyi, et autres
Publié: (2025)
STaR: Distilling Speech Temporal Relation for Lightweight Speech Self-Supervised Learning Models
par: Jang, Kangwook, et autres
Publié: (2023)
par: Jang, Kangwook, et autres
Publié: (2023)
SpeechGLUE: How Well Can Self-Supervised Speech Models Capture Linguistic Knowledge?
par: Ashihara, Takanori, et autres
Publié: (2023)
par: Ashihara, Takanori, et autres
Publié: (2023)
Textless Acoustic Model with Self-Supervised Distillation for Noise-Robust Expressive Speech-to-Speech Translation
par: Hwang, Min-Jae, et autres
Publié: (2024)
par: Hwang, Min-Jae, et autres
Publié: (2024)
S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models
par: Fang, Yuanbo, et autres
Publié: (2025)
par: Fang, Yuanbo, et autres
Publié: (2025)
StreamUni: Achieving Streaming Speech Translation with a Unified Large Speech-Language Model
par: Guo, Shoutao, et autres
Publié: (2025)
par: Guo, Shoutao, et autres
Publié: (2025)
SEAL: Speech Embedding Alignment Learning for Speech Large Language Model with Retrieval-Augmented Generation
par: Sun, Chunyu, et autres
Publié: (2025)
par: Sun, Chunyu, et autres
Publié: (2025)
Documents similaires
-
Voice Biomarker Analysis and Automated Severity Classification of Dysarthric Speech in a Multilingual Context
par: Yeo, Eunjung
Publié: (2024) -
Addressing Pitfalls in Auditing Practices of Automatic Speech Recognition Technologies: A Case Study of People with Aphasia
par: Mei, Katelyn Xiaoying, et autres
Publié: (2025) -
Intra- and Inter-modal Context Interaction Modeling for Conversational Speech Synthesis
par: Jia, Zhenqi, et autres
Publié: (2024) -
DiffAR: Denoising Diffusion Autoregressive Model for Raw Speech Waveform Generation
par: Benita, Roi, et autres
Publié: (2023) -
Scaling Analysis of Interleaved Speech-Text Language Models
par: Maimon, Gallil, et autres
Publié: (2025)