Discrete Diffusion for Generative Modeling of Text-Aligned Speech Tokens
Fuente:
arXiv
Guardado en:
| Autores principales: | Ku, Pin-Jui, Huang, He, Lemercier, Jean-Marie, Sahoo, Subham Sekhar, Chen, Zhehuai, Jukić, Ante |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MDM-ASR: Bridging Accuracy and Efficiency in ASR with Diffusion-Based Non-Autoregressive Decoding
por: Yen, Hao, et al.
Publicado: (2026)
por: Yen, Hao, et al.
Publicado: (2026)
Generative Speech Foundation Model Pretraining for High-Quality Speech Extraction and Restoration
por: Ku, Pin-Jui, et al.
Publicado: (2024)
por: Ku, Pin-Jui, et al.
Publicado: (2024)
Generalizability of Predictive and Generative Speech Enhancement Models to Pathological Speakers
por: Hou, Mingchi, et al.
Publicado: (2025)
por: Hou, Mingchi, et al.
Publicado: (2025)
Schrödinger Bridge for Generative Speech Enhancement
por: Jukić, Ante, et al.
Publicado: (2024)
por: Jukić, Ante, et al.
Publicado: (2024)
Flexible Multichannel Speech Enhancement for Noise-Robust Frontend
por: Jukić, Ante, et al.
Publicado: (2024)
por: Jukić, Ante, et al.
Publicado: (2024)
Robust Speech Recognition with Schrödinger Bridge-Based Speech Enhancement
por: Nasretdinov, Rauf, et al.
Publicado: (2025)
por: Nasretdinov, Rauf, et al.
Publicado: (2025)
Speech Enhancement and Dereverberation with Diffusion-based Generative Models
por: Richter, Julius, et al.
Publicado: (2022)
por: Richter, Julius, et al.
Publicado: (2022)
A Bottom-up Framework with Language-universal Speech Attribute Modeling for Syllable-based ASR
por: Yen, Hao, et al.
Publicado: (2025)
por: Yen, Hao, et al.
Publicado: (2025)
Spectral Codecs: Improving Non-Autoregressive Speech Synthesis with Spectrogram-Based Audio Codecs
por: Langman, Ryan, et al.
Publicado: (2024)
por: Langman, Ryan, et al.
Publicado: (2024)
StoRM: A Diffusion-based Stochastic Regeneration Model for Speech Enhancement and Dereverberation
por: Lemercier, Jean-Marie, et al.
Publicado: (2022)
por: Lemercier, Jean-Marie, et al.
Publicado: (2022)
Non-intrusive Speech Quality Assessment with Diffusion Models Trained on Clean Speech
por: de Oliveira, Danilo, et al.
Publicado: (2024)
por: de Oliveira, Danilo, et al.
Publicado: (2024)
Single and Few-step Diffusion for Generative Speech Enhancement
por: Lay, Bunlong, et al.
Publicado: (2023)
por: Lay, Bunlong, et al.
Publicado: (2023)
Universal Speech Enhancement with Regression and Generative Mamba
por: Chao, Rong, et al.
Publicado: (2025)
por: Chao, Rong, et al.
Publicado: (2025)
Codec-ASR: Training Performant Automatic Speech Recognition Systems with Discrete Speech Representations
por: Dhawan, Kunal, et al.
Publicado: (2024)
por: Dhawan, Kunal, et al.
Publicado: (2024)
High Fidelity Text-to-Speech Via Discrete Tokens Using Token Transducer and Group Masked Language Model
por: Lee, Joun Yeop, et al.
Publicado: (2024)
por: Lee, Joun Yeop, et al.
Publicado: (2024)
An Investigation on Combining Geometry and Consistency Constraints into Phase Estimation for Speech Enhancement
por: Ho, Chun-Wei, et al.
Publicado: (2025)
por: Ho, Chun-Wei, et al.
Publicado: (2025)
Unified Semi-Supervised Pipeline for Automatic Speech Recognition
por: Tadevosyan, Nune, et al.
Publicado: (2025)
por: Tadevosyan, Nune, et al.
Publicado: (2025)
An Explicit Consistency-Preserving Loss Function for Phase Reconstruction and Speech Enhancement
por: Ku, Pin-Jui, et al.
Publicado: (2024)
por: Ku, Pin-Jui, et al.
Publicado: (2024)
Acoustic BPE for Speech Generation with Discrete Tokens
por: Shen, Feiyu, et al.
Publicado: (2023)
por: Shen, Feiyu, et al.
Publicado: (2023)
Language-Universal Speech Attributes Modeling for Zero-Shot Multilingual Spoken Keyword Recognition
por: Yen, Hao, et al.
Publicado: (2024)
por: Yen, Hao, et al.
Publicado: (2024)
Wind Noise Reduction with a Diffusion-based Stochastic Regeneration Model
por: Lemercier, Jean-Marie, et al.
Publicado: (2023)
por: Lemercier, Jean-Marie, et al.
Publicado: (2023)
DeSTA: Enhancing Speech Language Models through Descriptive Speech-Text Alignment
por: Lu, Ke-Han, et al.
Publicado: (2024)
por: Lu, Ke-Han, et al.
Publicado: (2024)
Evaluating Text-to-Speech Synthesis from a Large Discrete Token-based Speech Language Model
por: Wang, Siyang, et al.
Publicado: (2024)
por: Wang, Siyang, et al.
Publicado: (2024)
VoiceTextBlender: Augmenting Large Language Models with Speech Capabilities via Single-Stage Joint Speech-Text Supervised Fine-Tuning
por: Peng, Yifan, et al.
Publicado: (2024)
por: Peng, Yifan, et al.
Publicado: (2024)
BUDDy: Single-Channel Blind Unsupervised Dereverberation with Diffusion Models
por: Moliner, Eloi, et al.
Publicado: (2024)
por: Moliner, Eloi, et al.
Publicado: (2024)
Unsupervised Blind Joint Dereverberation and Room Acoustics Estimation with Diffusion Models
por: Lemercier, Jean-Marie, et al.
Publicado: (2024)
por: Lemercier, Jean-Marie, et al.
Publicado: (2024)
SELM: Speech Enhancement Using Discrete Tokens and Language Models
por: Wang, Ziqian, et al.
Publicado: (2023)
por: Wang, Ziqian, et al.
Publicado: (2023)
Diffusion Models for Audio Restoration
por: Lemercier, Jean-Marie, et al.
Publicado: (2024)
por: Lemercier, Jean-Marie, et al.
Publicado: (2024)
TASTE: Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
por: Tseng, Liang-Hsuan, et al.
Publicado: (2025)
por: Tseng, Liang-Hsuan, et al.
Publicado: (2025)
EmoSSLSphere: Multilingual Emotional Speech Synthesis with Spherical Vectors and Discrete Speech Tokens
por: Park, Joonyong, et al.
Publicado: (2025)
por: Park, Joonyong, et al.
Publicado: (2025)
Bridging the Modality Gap: Softly Discretizing Audio Representation for LLM-based Automatic Speech Recognition
por: Yang, Mu, et al.
Publicado: (2025)
por: Yang, Mu, et al.
Publicado: (2025)
Confidence-based Filtering for Speech Dataset Curation with Generative Speech Enhancement Using Discrete Tokens
por: Yamauchi, Kazuki, et al.
Publicado: (2026)
por: Yamauchi, Kazuki, et al.
Publicado: (2026)
Low Bitrate High-Quality RVQGAN-based Discrete Speech Tokenizer
por: Shechtman, Slava, et al.
Publicado: (2024)
por: Shechtman, Slava, et al.
Publicado: (2024)
Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation
por: Liu, Wenrui, et al.
Publicado: (2025)
por: Liu, Wenrui, et al.
Publicado: (2025)
Multilingual Speech Recognition Using Discrete Tokens with a Two-step Training Strategy
por: Li, Zehan, et al.
Publicado: (2025)
por: Li, Zehan, et al.
Publicado: (2025)
Phone-purity Guided Discrete Tokens for Dysarthric Speech Recognition
por: Wang, Huimeng, et al.
Publicado: (2025)
por: Wang, Huimeng, et al.
Publicado: (2025)
Absorbing Discrete Diffusion for Speech Enhancement
por: Gonzalez, Philippe
Publicado: (2026)
por: Gonzalez, Philippe
Publicado: (2026)
TaDiCodec: Text-aware Diffusion Speech Tokenizer for Speech Language Modeling
por: Wang, Yuancheng, et al.
Publicado: (2025)
por: Wang, Yuancheng, et al.
Publicado: (2025)
Low Frame-rate Speech Codec: a Codec Designed for Fast High-quality Speech LLM Training and Inference
por: Casanova, Edresson, et al.
Publicado: (2024)
por: Casanova, Edresson, et al.
Publicado: (2024)
ViT-TTS: Visual Text-to-Speech with Scalable Diffusion Transformer
por: Liu, Huadai, et al.
Publicado: (2023)
por: Liu, Huadai, et al.
Publicado: (2023)
Ejemplares similares
-
MDM-ASR: Bridging Accuracy and Efficiency in ASR with Diffusion-Based Non-Autoregressive Decoding
por: Yen, Hao, et al.
Publicado: (2026) -
Generative Speech Foundation Model Pretraining for High-Quality Speech Extraction and Restoration
por: Ku, Pin-Jui, et al.
Publicado: (2024) -
Generalizability of Predictive and Generative Speech Enhancement Models to Pathological Speakers
por: Hou, Mingchi, et al.
Publicado: (2025) -
Schrödinger Bridge for Generative Speech Enhancement
por: Jukić, Ante, et al.
Publicado: (2024) -
Flexible Multichannel Speech Enhancement for Noise-Robust Frontend
por: Jukić, Ante, et al.
Publicado: (2024)