SSDM: Scalable Speech Dysfluency Modeling
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lian, Jiachen, Zhou, Xuanru, Ezzes, Zoe, Vonk, Jet, Morin, Brittany, Baquirin, David, Mille, Zachary, Tempini, Maria Luisa Gorno, Anumanchipalli, Gopala Krishna |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SSDM 2.0: Time-Accurate Speech Rich Transcription with Non-Fluencies
par: Lian, Jiachen, et autres
Publié: (2024)
par: Lian, Jiachen, et autres
Publié: (2024)
Time and Tokens: Benchmarking End-to-End Speech Dysfluency Detection
par: Zhou, Xuanru, et autres
Publié: (2024)
par: Zhou, Xuanru, et autres
Publié: (2024)
Stutter-Solver: End-to-end Multi-lingual Dysfluency Detection
par: Zhou, Xuanru, et autres
Publié: (2024)
par: Zhou, Xuanru, et autres
Publié: (2024)
Analysis and Evaluation of Synthetic Data Generation in Speech Dysfluency Detection
par: Zhang, Jinming, et autres
Publié: (2025)
par: Zhang, Jinming, et autres
Publié: (2025)
YOLO-Stutter: End-to-end Region-Wise Speech Dysfluency Detection
par: Zhou, Xuanru, et autres
Publié: (2024)
par: Zhou, Xuanru, et autres
Publié: (2024)
Towards Accurate Phonetic Error Detection Through Phoneme Similarity Modeling
par: Zhou, Xuanru, et autres
Publié: (2025)
par: Zhou, Xuanru, et autres
Publié: (2025)
Dysfluent WFST: A Framework for Zero-Shot Speech Dysfluency Transcription and Detection
par: Guo, Chenxu, et autres
Publié: (2025)
par: Guo, Chenxu, et autres
Publié: (2025)
Seamless Dysfluent Speech Text Alignment for Disordered Speech Analysis
par: Ye, Zongli, et autres
Publié: (2025)
par: Ye, Zongli, et autres
Publié: (2025)
HASS: Hierarchical Simulation of Logopenic Aphasic Speech for Scalable PPA Detection
par: Li, Harrison, et autres
Publié: (2026)
par: Li, Harrison, et autres
Publié: (2026)
Towards Hierarchical Spoken Language Dysfluency Modeling
par: Lian, Jiachen, et autres
Publié: (2024)
par: Lian, Jiachen, et autres
Publié: (2024)
Speech World Model: Causal State-Action Planning with Explicit Reasoning for Speech
par: Zhou, Xuanru, et autres
Publié: (2025)
par: Zhou, Xuanru, et autres
Publié: (2025)
Unsupervised TTS Acoustic Modeling for TTS with Conditional Disentangled Sequential VAE
par: Lian, Jiachen, et autres
Publié: (2022)
par: Lian, Jiachen, et autres
Publié: (2022)
LCS-CTC: Leveraging Soft Alignments to Enhance Phonetic Transcription Robustness
par: Ye, Zongli, et autres
Publié: (2025)
par: Ye, Zongli, et autres
Publié: (2025)
Speech After Gender: A Trans-Feminine Perspective on Next Steps for Speech Science and Technology
par: Netzorg, Robin, et autres
Publié: (2024)
par: Netzorg, Robin, et autres
Publié: (2024)
Large Language Models for Dysfluency Detection in Stuttered Speech
par: Wagner, Dominik, et autres
Publié: (2024)
par: Wagner, Dominik, et autres
Publié: (2024)
Audio Texture Manipulation by Exemplar-Based Analogy
par: Cheng, Kan Jen, et autres
Publié: (2025)
par: Cheng, Kan Jen, et autres
Publié: (2025)
Deep Speech Synthesis from Multimodal Articulatory Representations
par: Wu, Peter, et autres
Publié: (2024)
par: Wu, Peter, et autres
Publié: (2024)
K-Function: Joint Pronunciation Transcription and Feedback for Evaluating Kids Language Function
par: Li, Shuhe, et autres
Publié: (2025)
par: Li, Shuhe, et autres
Publié: (2025)
Fast, High-Quality and Parameter-Efficient Articulatory Synthesis using Differentiable DSP
par: Liu, Yisi, et autres
Publié: (2024)
par: Liu, Yisi, et autres
Publié: (2024)
Coding Speech through Vocal Tract Kinematics
par: Cho, Cheol Jun, et autres
Publié: (2024)
par: Cho, Cheol Jun, et autres
Publié: (2024)
Sylber: Syllabic Embedding Representation of Speech from Raw Audio
par: Cho, Cheol Jun, et autres
Publié: (2024)
par: Cho, Cheol Jun, et autres
Publié: (2024)
StutterCut: Uncertainty-Guided Normalised Cut for Dysfluency Segmentation
par: Ghosh, Suhita, et autres
Publié: (2025)
par: Ghosh, Suhita, et autres
Publié: (2025)
Detecting Dysfluencies in Stuttering Therapy Using wav2vec 2.0
par: Bayerl, Sebastian P., et autres
Publié: (2022)
par: Bayerl, Sebastian P., et autres
Publié: (2022)
Self-Supervised Speech Quality Assessment (S3QA): Leveraging Speech Foundation Models for a Scalable Speech Quality Metric
par: Ogg, Mattson, et autres
Publié: (2025)
par: Ogg, Mattson, et autres
Publié: (2025)
ViT-TTS: Visual Text-to-Speech with Scalable Diffusion Transformer
par: Liu, Huadai, et autres
Publié: (2023)
par: Liu, Huadai, et autres
Publié: (2023)
VoxGenesis: Unsupervised Discovery of Latent Speaker Manifold for Speech Synthesis
par: Lin, Weiwei, et autres
Publié: (2024)
par: Lin, Weiwei, et autres
Publié: (2024)
Teaching Machines to Speak Using Articulatory Control
par: Anand, Akshay, et autres
Publié: (2025)
par: Anand, Akshay, et autres
Publié: (2025)
A Scalable Pipeline for Enabling Non-Verbal Speech Generation and Understanding
par: Ye, Runchuan, et autres
Publié: (2025)
par: Ye, Runchuan, et autres
Publié: (2025)
Towards Scalable AASIST: Refining Graph Attention for Speech Deepfake Detection
par: Viakhirev, Ivan, et autres
Publié: (2025)
par: Viakhirev, Ivan, et autres
Publié: (2025)
Beyond Performance Plateaus: A Comprehensive Study on Scalability in Speech Enhancement
par: Zhang, Wangyou, et autres
Publié: (2024)
par: Zhang, Wangyou, et autres
Publié: (2024)
Distillation and Pruning for Scalable Self-Supervised Representation-Based Speech Quality Assessment
par: Stahl, Benjamin, et autres
Publié: (2025)
par: Stahl, Benjamin, et autres
Publié: (2025)
Resource-Efficient Adaptation of Speech Foundation Models for Multi-Speaker ASR
par: Wang, Weiqing, et autres
Publié: (2024)
par: Wang, Weiqing, et autres
Publié: (2024)
NEST: Self-supervised Fast Conformer as All-purpose Seasoning to Speech Processing Tasks
par: Huang, He, et autres
Publié: (2024)
par: Huang, He, et autres
Publié: (2024)
Unlocking Strong Supervision: A Data-Centric Study of General-Purpose Audio Pre-Training Methods
par: Zhou, Xuanru, et autres
Publié: (2026)
par: Zhou, Xuanru, et autres
Publié: (2026)
MSceneSpeech: A Multi-Scene Speech Dataset For Expressive Speech Synthesis
par: Yang, Qian, et autres
Publié: (2024)
par: Yang, Qian, et autres
Publié: (2024)
Adaptive Slimming for Scalable and Efficient Speech Enhancement
par: Miccini, Riccardo, et autres
Publié: (2025)
par: Miccini, Riccardo, et autres
Publié: (2025)
Scalable Speech Enhancement with Dynamic Channel Pruning
par: Miccini, Riccardo, et autres
Publié: (2024)
par: Miccini, Riccardo, et autres
Publié: (2024)
S2ST-Omni: Hierarchical Language-Aware SpeechLLM Adaptation for Multilingual Speech-to-Speech Translation
par: Pan, Yu, et autres
Publié: (2025)
par: Pan, Yu, et autres
Publié: (2025)
Zero Shot Text to Speech Augmentation for Automatic Speech Recognition on Low-Resource Accented Speech Corpora
par: Nespoli, Francesco, et autres
Publié: (2024)
par: Nespoli, Francesco, et autres
Publié: (2024)
Robust Speech Recognition with Schrödinger Bridge-Based Speech Enhancement
par: Nasretdinov, Rauf, et autres
Publié: (2025)
par: Nasretdinov, Rauf, et autres
Publié: (2025)
Documents similaires
-
SSDM 2.0: Time-Accurate Speech Rich Transcription with Non-Fluencies
par: Lian, Jiachen, et autres
Publié: (2024) -
Time and Tokens: Benchmarking End-to-End Speech Dysfluency Detection
par: Zhou, Xuanru, et autres
Publié: (2024) -
Stutter-Solver: End-to-end Multi-lingual Dysfluency Detection
par: Zhou, Xuanru, et autres
Publié: (2024) -
Analysis and Evaluation of Synthetic Data Generation in Speech Dysfluency Detection
par: Zhang, Jinming, et autres
Publié: (2025) -
YOLO-Stutter: End-to-end Region-Wise Speech Dysfluency Detection
par: Zhou, Xuanru, et autres
Publié: (2024)