Towards Hierarchical Spoken Language Dysfluency Modeling
Fuente:
arXiv
Salvato in:
| Autori principali: | Lian, Jiachen, Anumanchipalli, Gopala |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SSDM: Scalable Speech Dysfluency Modeling
di: Lian, Jiachen, et al.
Pubblicazione: (2024)
di: Lian, Jiachen, et al.
Pubblicazione: (2024)
Scaling Spoken Language Models with Syllabic Speech Tokenization
di: Lee, Nicholas, et al.
Pubblicazione: (2025)
di: Lee, Nicholas, et al.
Pubblicazione: (2025)
Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities
di: Lin, Guan-Ting, et al.
Pubblicazione: (2025)
di: Lin, Guan-Ting, et al.
Pubblicazione: (2025)
YOLO-Stutter: End-to-end Region-Wise Speech Dysfluency Detection
di: Zhou, Xuanru, et al.
Pubblicazione: (2024)
di: Zhou, Xuanru, et al.
Pubblicazione: (2024)
EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Spoken Dialogue Systems
di: Liu, Jingwen, et al.
Pubblicazione: (2025)
di: Liu, Jingwen, et al.
Pubblicazione: (2025)
Unsupervised TTS Acoustic Modeling for TTS with Conditional Disentangled Sequential VAE
di: Lian, Jiachen, et al.
Pubblicazione: (2022)
di: Lian, Jiachen, et al.
Pubblicazione: (2022)
Speech World Model: Causal State-Action Planning with Explicit Reasoning for Speech
di: Zhou, Xuanru, et al.
Pubblicazione: (2025)
di: Zhou, Xuanru, et al.
Pubblicazione: (2025)
Self-Supervised Models of Speech Infer Universal Articulatory Kinematics
di: Cho, Cheol Jun, et al.
Pubblicazione: (2023)
di: Cho, Cheol Jun, et al.
Pubblicazione: (2023)
Large Language Models for Dysfluency Detection in Stuttered Speech
di: Wagner, Dominik, et al.
Pubblicazione: (2024)
di: Wagner, Dominik, et al.
Pubblicazione: (2024)
Sylber 2.0: A Universal Syllable Embedding
di: Cho, Cheol Jun, et al.
Pubblicazione: (2026)
di: Cho, Cheol Jun, et al.
Pubblicazione: (2026)
Teaching Machines to Speak Using Articulatory Control
di: Anand, Akshay, et al.
Pubblicazione: (2025)
di: Anand, Akshay, et al.
Pubblicazione: (2025)
Analysis and Evaluation of Synthetic Data Generation in Speech Dysfluency Detection
di: Zhang, Jinming, et al.
Pubblicazione: (2025)
di: Zhang, Jinming, et al.
Pubblicazione: (2025)
Stutter-Solver: End-to-end Multi-lingual Dysfluency Detection
di: Zhou, Xuanru, et al.
Pubblicazione: (2024)
di: Zhou, Xuanru, et al.
Pubblicazione: (2024)
Time and Tokens: Benchmarking End-to-End Speech Dysfluency Detection
di: Zhou, Xuanru, et al.
Pubblicazione: (2024)
di: Zhou, Xuanru, et al.
Pubblicazione: (2024)
SD-HuBERT: Sentence-Level Self-Distillation Induces Syllabic Organization in HuBERT
di: Cho, Cheol Jun, et al.
Pubblicazione: (2023)
di: Cho, Cheol Jun, et al.
Pubblicazione: (2023)
Spoken Stereoset: On Evaluating Social Bias Toward Speaker in Speech Large Language Models
di: Lin, Yi-Cheng, et al.
Pubblicazione: (2024)
di: Lin, Yi-Cheng, et al.
Pubblicazione: (2024)
Dysfluent WFST: A Framework for Zero-Shot Speech Dysfluency Transcription and Detection
di: Guo, Chenxu, et al.
Pubblicazione: (2025)
di: Guo, Chenxu, et al.
Pubblicazione: (2025)
Paralinguistics-Enhanced Large Language Modeling of Spoken Dialogue
di: Lin, Guan-Ting, et al.
Pubblicazione: (2023)
di: Lin, Guan-Ting, et al.
Pubblicazione: (2023)
SHANKS: Simultaneous Hearing and Thinking for Spoken Language Models
di: Chiang, Cheng-Han, et al.
Pubblicazione: (2025)
di: Chiang, Cheng-Han, et al.
Pubblicazione: (2025)
Spoken Language Modeling with Duration-Penalized Self-Supervised Units
di: Visser, Nicol, et al.
Pubblicazione: (2025)
di: Visser, Nicol, et al.
Pubblicazione: (2025)
Detecting Dysfluencies in Stuttering Therapy Using wav2vec 2.0
di: Bayerl, Sebastian P., et al.
Pubblicazione: (2022)
di: Bayerl, Sebastian P., et al.
Pubblicazione: (2022)
URO-Bench: Towards Comprehensive Evaluation for End-to-End Spoken Dialogue Models
di: Yan, Ruiqi, et al.
Pubblicazione: (2025)
di: Yan, Ruiqi, et al.
Pubblicazione: (2025)
Towards ASR Robust Spoken Language Understanding Through In-Context Learning With Word Confusion Networks
di: Everson, Kevin, et al.
Pubblicazione: (2024)
di: Everson, Kevin, et al.
Pubblicazione: (2024)
Finetuning End-to-End Models for Estonian Conversational Spoken Language Translation
di: Sildam, Tiia, et al.
Pubblicazione: (2024)
di: Sildam, Tiia, et al.
Pubblicazione: (2024)
Evaluating Emotion Recognition in Spoken Language Models on Emotionally Incongruent Speech
di: Corrêa, Pedro, et al.
Pubblicazione: (2025)
di: Corrêa, Pedro, et al.
Pubblicazione: (2025)
STITCH: Simultaneous Thinking and Talking with Chunked Reasoning for Spoken Language Models
di: Chiang, Cheng-Han, et al.
Pubblicazione: (2025)
di: Chiang, Cheng-Han, et al.
Pubblicazione: (2025)
Towards a Japanese Full-duplex Spoken Dialogue System
di: Ohashi, Atsumoto, et al.
Pubblicazione: (2025)
di: Ohashi, Atsumoto, et al.
Pubblicazione: (2025)
J-CHAT: Japanese Large-scale Spoken Dialogue Corpus for Spoken Dialogue Language Modeling
di: Nakata, Wataru, et al.
Pubblicazione: (2024)
di: Nakata, Wataru, et al.
Pubblicazione: (2024)
Finding Task-specific Subnetworks in Multi-task Spoken Language Understanding Model
di: Futami, Hayato, et al.
Pubblicazione: (2024)
di: Futami, Hayato, et al.
Pubblicazione: (2024)
ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling
di: Visser, Nicol, et al.
Pubblicazione: (2026)
di: Visser, Nicol, et al.
Pubblicazione: (2026)
SPAR-K: Scheduled Periodic Alternating Early Exit for Spoken Language Models
di: Huang, Hsiao-Ying, et al.
Pubblicazione: (2026)
di: Huang, Hsiao-Ying, et al.
Pubblicazione: (2026)
Toward Corpus Size Requirements for Training and Evaluating Depression Risk Models Using Spoken Language
di: Rutowski, Tomek, et al.
Pubblicazione: (2024)
di: Rutowski, Tomek, et al.
Pubblicazione: (2024)
Sylber: Syllabic Embedding Representation of Speech from Raw Audio
di: Cho, Cheol Jun, et al.
Pubblicazione: (2024)
di: Cho, Cheol Jun, et al.
Pubblicazione: (2024)
Align-SLM: Textless Spoken Language Models with Reinforcement Learning from AI Feedback
di: Lin, Guan-Ting, et al.
Pubblicazione: (2024)
di: Lin, Guan-Ting, et al.
Pubblicazione: (2024)
Spirit LM: Interleaved Spoken and Written Language Model
di: Nguyen, Tu Anh, et al.
Pubblicazione: (2024)
di: Nguyen, Tu Anh, et al.
Pubblicazione: (2024)
On the Evaluation of Speech Foundation Models for Spoken Language Understanding
di: Arora, Siddhant, et al.
Pubblicazione: (2024)
di: Arora, Siddhant, et al.
Pubblicazione: (2024)
Long-Form Speech Generation with Spoken Language Models
di: Park, Se Jin, et al.
Pubblicazione: (2024)
di: Park, Se Jin, et al.
Pubblicazione: (2024)
On The Landscape of Spoken Language Models: A Comprehensive Survey
di: Arora, Siddhant, et al.
Pubblicazione: (2025)
di: Arora, Siddhant, et al.
Pubblicazione: (2025)
Advancing Large Language Models to Capture Varied Speaking Styles and Respond Properly in Spoken Conversations
di: Lin, Guan-Ting, et al.
Pubblicazione: (2024)
di: Lin, Guan-Ting, et al.
Pubblicazione: (2024)
Coding Speech through Vocal Tract Kinematics
di: Cho, Cheol Jun, et al.
Pubblicazione: (2024)
di: Cho, Cheol Jun, et al.
Pubblicazione: (2024)
Documenti analoghi
-
SSDM: Scalable Speech Dysfluency Modeling
di: Lian, Jiachen, et al.
Pubblicazione: (2024) -
Scaling Spoken Language Models with Syllabic Speech Tokenization
di: Lee, Nicholas, et al.
Pubblicazione: (2025) -
Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities
di: Lin, Guan-Ting, et al.
Pubblicazione: (2025) -
YOLO-Stutter: End-to-end Region-Wise Speech Dysfluency Detection
di: Zhou, Xuanru, et al.
Pubblicazione: (2024) -
EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Spoken Dialogue Systems
di: Liu, Jingwen, et al.
Pubblicazione: (2025)