Large Language Models for Dysfluency Detection in Stuttered Speech
Fuente:
arXiv
Salvato in:
| Autori principali: | Wagner, Dominik, Bayerl, Sebastian P., Baumann, Ilja, Riedhammer, Korbinian, Nöth, Elmar, Bocklet, Tobias |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Detecting Dysfluencies in Stuttering Therapy Using wav2vec 2.0
di: Bayerl, Sebastian P., et al.
Pubblicazione: (2022)
di: Bayerl, Sebastian P., et al.
Pubblicazione: (2022)
Outlier Reduction with Gated Attention for Improved Post-training Quantization in Large Sequence-to-sequence Speech Foundation Models
di: Wagner, Dominik, et al.
Pubblicazione: (2024)
di: Wagner, Dominik, et al.
Pubblicazione: (2024)
Personalized Fine-Tuning with Controllable Synthetic Speech from LLM-Generated Transcripts for Dysarthric Speech Recognition
di: Wagner, Dominik, et al.
Pubblicazione: (2025)
di: Wagner, Dominik, et al.
Pubblicazione: (2025)
On the Difficulty of Token-Level Modeling of Dysfluency and Fluency Shaping Artifacts
di: Gulzar, Kashaf, et al.
Pubblicazione: (2025)
di: Gulzar, Kashaf, et al.
Pubblicazione: (2025)
Vocoder-Free Non-Parallel Conversion of Whispered Speech With Masked Cycle-Consistent Generative Adversarial Networks
di: Wagner, Dominik, et al.
Pubblicazione: (2023)
di: Wagner, Dominik, et al.
Pubblicazione: (2023)
Multilingual Stutter Event Detection for English, German, and Mandarin Speech
di: Haas, Felix, et al.
Pubblicazione: (2026)
di: Haas, Felix, et al.
Pubblicazione: (2026)
Infusing Acoustic Pause Context into Text-Based Dementia Assessment
di: Braun, Franziska, et al.
Pubblicazione: (2024)
di: Braun, Franziska, et al.
Pubblicazione: (2024)
Adapter-Based Multi-Agent AVSR Extension for Pre-Trained ASR Models
di: Simic, Christopher, et al.
Pubblicazione: (2025)
di: Simic, Christopher, et al.
Pubblicazione: (2025)
The PARLO Dementia Corpus: A German Multi-Center Resource for Alzheimer's Disease
di: Braun, Franziska, et al.
Pubblicazione: (2026)
di: Braun, Franziska, et al.
Pubblicazione: (2026)
StutterCut: Uncertainty-Guided Normalised Cut for Dysfluency Segmentation
di: Ghosh, Suhita, et al.
Pubblicazione: (2025)
di: Ghosh, Suhita, et al.
Pubblicazione: (2025)
Stutter-Solver: End-to-end Multi-lingual Dysfluency Detection
di: Zhou, Xuanru, et al.
Pubblicazione: (2024)
di: Zhou, Xuanru, et al.
Pubblicazione: (2024)
SSDM: Scalable Speech Dysfluency Modeling
di: Lian, Jiachen, et al.
Pubblicazione: (2024)
di: Lian, Jiachen, et al.
Pubblicazione: (2024)
Self-supervised Speech Models for Word-Level Stuttered Speech Detection
di: Shih, Yi-Jen, et al.
Pubblicazione: (2024)
di: Shih, Yi-Jen, et al.
Pubblicazione: (2024)
Towards Inclusive ASR: Investigating Voice Conversion for Dysarthric Speech Recognition in Low-Resource Languages
di: Li, Chin-Jou, et al.
Pubblicazione: (2025)
di: Li, Chin-Jou, et al.
Pubblicazione: (2025)
YOLO-Stutter: End-to-end Region-Wise Speech Dysfluency Detection
di: Zhou, Xuanru, et al.
Pubblicazione: (2024)
di: Zhou, Xuanru, et al.
Pubblicazione: (2024)
Optimized Self-supervised Training with BEST-RQ for Speech Recognition
di: Baumann, Ilja, et al.
Pubblicazione: (2025)
di: Baumann, Ilja, et al.
Pubblicazione: (2025)
A Survey of Music Generation in the Context of Interaction
di: Agchar, Ismael, et al.
Pubblicazione: (2024)
di: Agchar, Ismael, et al.
Pubblicazione: (2024)
Analysis and Evaluation of Synthetic Data Generation in Speech Dysfluency Detection
di: Zhang, Jinming, et al.
Pubblicazione: (2025)
di: Zhang, Jinming, et al.
Pubblicazione: (2025)
Time and Tokens: Benchmarking End-to-End Speech Dysfluency Detection
di: Zhou, Xuanru, et al.
Pubblicazione: (2024)
di: Zhou, Xuanru, et al.
Pubblicazione: (2024)
Findings of the 2024 Mandarin Stuttering Event Detection and Automatic Speech Recognition Challenge
di: Xue, Hongfei, et al.
Pubblicazione: (2024)
di: Xue, Hongfei, et al.
Pubblicazione: (2024)
Adapting Self-Supervised Speech Representations for Cross-lingual Dysarthria Detection in Parkinson's Disease
di: Hernandez, Abner, et al.
Pubblicazione: (2026)
di: Hernandez, Abner, et al.
Pubblicazione: (2026)
Leveraging LLM for Stuttering Speech: A Unified Architecture Bridging Recognition and Event Detection
di: Huang, Shangkun, et al.
Pubblicazione: (2025)
di: Huang, Shangkun, et al.
Pubblicazione: (2025)
MMSD-Net: Towards Multi-modal Stuttering Detection
di: Nie, Liangyu, et al.
Pubblicazione: (2024)
di: Nie, Liangyu, et al.
Pubblicazione: (2024)
Leveraging Large Language Models for Sarcastic Speech Annotation in Sarcasm Detection
di: Li, Zhu, et al.
Pubblicazione: (2025)
di: Li, Zhu, et al.
Pubblicazione: (2025)
SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models
di: Zhang, Xin, et al.
Pubblicazione: (2023)
di: Zhang, Xin, et al.
Pubblicazione: (2023)
Leveraging Large Language Models for Spontaneous Speech-Based Suicide Risk Detection
di: Gao, Yifan, et al.
Pubblicazione: (2025)
di: Gao, Yifan, et al.
Pubblicazione: (2025)
Fine-Tuning ASR for Stuttered Speech: Personalized vs. Generalized Approaches
di: Mujtaba, Dena, et al.
Pubblicazione: (2025)
di: Mujtaba, Dena, et al.
Pubblicazione: (2025)
SELMA: A Speech-Enabled Language Model for Virtual Assistant Interactions
di: Wagner, Dominik, et al.
Pubblicazione: (2025)
di: Wagner, Dominik, et al.
Pubblicazione: (2025)
Spontaneous Speech-Based Suicide Risk Detection Using Whisper and Large Language Models
di: Cui, Ziyun, et al.
Pubblicazione: (2024)
di: Cui, Ziyun, et al.
Pubblicazione: (2024)
Towards Multi-Level Transcript Segmentation: LoRA Fine-Tuning for Table-of-Contents Generation
di: Freisinger, Steffen, et al.
Pubblicazione: (2026)
di: Freisinger, Steffen, et al.
Pubblicazione: (2026)
Generating Data with Text-to-Speech and Large-Language Models for Conversational Speech Recognition
di: Cornell, Samuele, et al.
Pubblicazione: (2024)
di: Cornell, Samuele, et al.
Pubblicazione: (2024)
Customizing Speech Recognition Model with Large Language Model Feedback
di: Ling, Shaoshi, et al.
Pubblicazione: (2025)
di: Ling, Shaoshi, et al.
Pubblicazione: (2025)
BLSP-Emo: Towards Empathetic Large Speech-Language Models
di: Wang, Chen, et al.
Pubblicazione: (2024)
di: Wang, Chen, et al.
Pubblicazione: (2024)
An End-to-End Speech Summarization Using Large Language Model
di: Shang, Hengchao, et al.
Pubblicazione: (2024)
di: Shang, Hengchao, et al.
Pubblicazione: (2024)
Closing the Modality Reasoning Gap for Speech Large Language Models
di: Wang, Chaoren, et al.
Pubblicazione: (2026)
di: Wang, Chaoren, et al.
Pubblicazione: (2026)
Boosting Large Language Model for Speech Synthesis: An Empirical Study
di: Hao, Hongkun, et al.
Pubblicazione: (2023)
di: Hao, Hongkun, et al.
Pubblicazione: (2023)
S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models
di: Fang, Yuanbo, et al.
Pubblicazione: (2025)
di: Fang, Yuanbo, et al.
Pubblicazione: (2025)
StreamUni: Achieving Streaming Speech Translation with a Unified Large Speech-Language Model
di: Guo, Shoutao, et al.
Pubblicazione: (2025)
di: Guo, Shoutao, et al.
Pubblicazione: (2025)
SEAL: Speech Embedding Alignment Learning for Speech Large Language Model with Retrieval-Augmented Generation
di: Sun, Chunyu, et al.
Pubblicazione: (2025)
di: Sun, Chunyu, et al.
Pubblicazione: (2025)
Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving
di: Xie, Jingran, et al.
Pubblicazione: (2025)
di: Xie, Jingran, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Detecting Dysfluencies in Stuttering Therapy Using wav2vec 2.0
di: Bayerl, Sebastian P., et al.
Pubblicazione: (2022) -
Outlier Reduction with Gated Attention for Improved Post-training Quantization in Large Sequence-to-sequence Speech Foundation Models
di: Wagner, Dominik, et al.
Pubblicazione: (2024) -
Personalized Fine-Tuning with Controllable Synthetic Speech from LLM-Generated Transcripts for Dysarthric Speech Recognition
di: Wagner, Dominik, et al.
Pubblicazione: (2025) -
On the Difficulty of Token-Level Modeling of Dysfluency and Fluency Shaping Artifacts
di: Gulzar, Kashaf, et al.
Pubblicazione: (2025) -
Vocoder-Free Non-Parallel Conversion of Whispered Speech With Masked Cycle-Consistent Generative Adversarial Networks
di: Wagner, Dominik, et al.
Pubblicazione: (2023)