DiTAR: Diffusion Transformer Autoregressive Modeling for Speech Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jia, Dongya, Chen, Zhuo, Chen, Jiawei, Du, Chenpeng, Wu, Jian, Cong, Jian, Zhuang, Xiaobin, Li, Chumin, Wei, Zhen, Wang, Yuping, Wang, Yuxuan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MagiCodec: Simple Masked Gaussian-Injected Codec for High-Fidelity Reconstruction and Generation
par: Song, Yakun, et autres
Publié: (2025)
par: Song, Yakun, et autres
Publié: (2025)
DiSTAR: Diffusion over a Scalable Token Autoregressive Representation for Speech Generation
par: Song, Yakun, et autres
Publié: (2025)
par: Song, Yakun, et autres
Publié: (2025)
Direct Preference Optimization for Speech Autoregressive Diffusion Models
par: Liu, Zhijun, et autres
Publié: (2025)
par: Liu, Zhijun, et autres
Publié: (2025)
Sound-VECaps: Improving Audio Generation with Visual Enhanced Captions
par: Yuan, Yi, et autres
Publié: (2024)
par: Yuan, Yi, et autres
Publié: (2024)
Phone-Level Prosody Modelling with GMM-Based MDN for Diverse and Controllable Speech Synthesis
par: Du, Chenpeng, et autres
Publié: (2021)
par: Du, Chenpeng, et autres
Publié: (2021)
Language Model Can Listen While Speaking
par: Ma, Ziyang, et autres
Publié: (2024)
par: Ma, Ziyang, et autres
Publié: (2024)
Seed-TTS: A Family of High-Quality Versatile Speech Generation Models
par: Anastassiou, Philip, et autres
Publié: (2024)
par: Anastassiou, Philip, et autres
Publié: (2024)
Attention-Constrained Inference for Robust Decoder-Only Text-to-Speech
par: Wang, Hankun, et autres
Publié: (2024)
par: Wang, Hankun, et autres
Publié: (2024)
Sounding that Object: Interactive Object-Aware Image to Audio Generation
par: Li, Tingle, et autres
Publié: (2025)
par: Li, Tingle, et autres
Publié: (2025)
VQTTS: High-Fidelity Text-to-Speech Synthesis with Self-Supervised VQ Acoustic Feature
par: Du, Chenpeng, et autres
Publié: (2022)
par: Du, Chenpeng, et autres
Publié: (2022)
Acoustic BPE for Speech Generation with Discrete Tokens
par: Shen, Feiyu, et autres
Publié: (2023)
par: Shen, Feiyu, et autres
Publié: (2023)
UniCATS: A Unified Context-Aware Text-to-Speech Framework with Contextual VQ-Diffusion and Vocoding
par: Du, Chenpeng, et autres
Publié: (2023)
par: Du, Chenpeng, et autres
Publié: (2023)
VoiceShop: A Unified Speech-to-Speech Framework for Identity-Preserving Zero-Shot Voice Editing
par: Anastassiou, Philip, et autres
Publié: (2024)
par: Anastassiou, Philip, et autres
Publié: (2024)
VALL-T: Decoder-Only Generative Transducer for Robust and Decoding-Controllable Text-to-Speech
par: Du, Chenpeng, et autres
Publié: (2024)
par: Du, Chenpeng, et autres
Publié: (2024)
VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis
par: Jung, Jaemin, et autres
Publié: (2024)
par: Jung, Jaemin, et autres
Publié: (2024)
DiTSE: High-Fidelity Generative Speech Enhancement via Latent Diffusion Transformers
par: Guimarães, Heitor R., et autres
Publié: (2025)
par: Guimarães, Heitor R., et autres
Publié: (2025)
LSCodec: Low-Bitrate and Speaker-Decoupled Discrete Speech Codec
par: Guo, Yiwei, et autres
Publié: (2024)
par: Guo, Yiwei, et autres
Publié: (2024)
Towards Reliable Large Audio Language Model
par: Ma, Ziyang, et autres
Publié: (2025)
par: Ma, Ziyang, et autres
Publié: (2025)
SimpleSpeech: Towards Simple and Efficient Text-to-Speech with Scalar Latent Transformer Diffusion Models
par: Yang, Dongchao, et autres
Publié: (2024)
par: Yang, Dongchao, et autres
Publié: (2024)
LongCat-AudioDiT: High-Fidelity Diffusion Text-to-Speech in the Waveform Latent Space
par: Xin, Detai, et autres
Publié: (2026)
par: Xin, Detai, et autres
Publié: (2026)
TaDiCodec: Text-aware Diffusion Speech Tokenizer for Speech Language Modeling
par: Wang, Yuancheng, et autres
Publié: (2025)
par: Wang, Yuancheng, et autres
Publié: (2025)
AudioMorphix: Training-free audio editing with diffusion probabilistic models
par: Liang, Jinhua, et autres
Publié: (2025)
par: Liang, Jinhua, et autres
Publié: (2025)
GAP-URGENet: A Generative-Predictive Fusion Framework for Universal Speech Enhancement
par: Rong, Xiaobin, et autres
Publié: (2026)
par: Rong, Xiaobin, et autres
Publié: (2026)
Multi-Speaker Multi-Lingual VQTTS System for LIMMITS 2023 Challenge
par: Du, Chenpeng, et autres
Publié: (2023)
par: Du, Chenpeng, et autres
Publié: (2023)
Why Do Speech Language Models Fail to Generate Semantically Coherent Outputs? A Modality Evolving Perspective
par: Wang, Hankun, et autres
Publié: (2024)
par: Wang, Hankun, et autres
Publié: (2024)
Unifying Speech Recognition, Synthesis and Conversion with Autoregressive Transformers
par: Cai, Runyuan, et autres
Publié: (2026)
par: Cai, Runyuan, et autres
Publié: (2026)
ViT-TTS: Visual Text-to-Speech with Scalable Diffusion Transformer
par: Liu, Huadai, et autres
Publié: (2023)
par: Liu, Huadai, et autres
Publié: (2023)
Parallel Synthesis for Autoregressive Speech Generation
par: Hsu, Po-chun, et autres
Publié: (2022)
par: Hsu, Po-chun, et autres
Publié: (2022)
EffectiveASR: A Single-Step Non-Autoregressive Mandarin Speech Recognition Architecture with High Accuracy and Inference Speed
par: Zhuang, Ziyang, et autres
Publié: (2024)
par: Zhuang, Ziyang, et autres
Publié: (2024)
Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment
par: Zhang, Xueyao, et autres
Publié: (2025)
par: Zhang, Xueyao, et autres
Publié: (2025)
F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching
par: Chen, Yushen, et autres
Publié: (2024)
par: Chen, Yushen, et autres
Publié: (2024)
IKFST: IOO and KOO Algorithms for Accelerated and Precise WFST-based End-to-End Automatic Speech Recognition
par: Zhuang, Zhuoran, et autres
Publié: (2026)
par: Zhuang, Zhuoran, et autres
Publié: (2026)
Unsupervised Multi-channel Speech Dereverberation via Diffusion
par: Wu, Yulun, et autres
Publié: (2025)
par: Wu, Yulun, et autres
Publié: (2025)
Accelerating Diffusion Transformer-Based Text-to-Speech with Transformer Layer Caching
par: Sakpiboonchit, Siratish
Publié: (2025)
par: Sakpiboonchit, Siratish
Publié: (2025)
DiT-Flow: Speech Enhancement Robust to Multiple Distortions based on Flow Matching in Latent Space and Diffusion Transformers
par: Cao, Tianyu, et autres
Publié: (2026)
par: Cao, Tianyu, et autres
Publié: (2026)
Adaptive Convolution for CNN-based Speech Enhancement Models
par: Wang, Dahan, et autres
Publié: (2025)
par: Wang, Dahan, et autres
Publié: (2025)
Dynamic Frequency-Adaptive Knowledge Distillation for Speech Enhancement
par: Yuan, Xihao, et autres
Publié: (2025)
par: Yuan, Xihao, et autres
Publié: (2025)
Seed-ASR: Understanding Diverse Speech and Contexts with LLM-based Speech Recognition
par: Bai, Ye, et autres
Publié: (2024)
par: Bai, Ye, et autres
Publié: (2024)
StreamVoice: Streamable Context-Aware Language Modeling for Real-time Zero-Shot Voice Conversion
par: Wang, Zhichao, et autres
Publié: (2024)
par: Wang, Zhichao, et autres
Publié: (2024)
StreamVoice+: Evolving into End-to-end Streaming Zero-shot Voice Conversion
par: Wang, Zhichao, et autres
Publié: (2024)
par: Wang, Zhichao, et autres
Publié: (2024)
Documents similaires
-
MagiCodec: Simple Masked Gaussian-Injected Codec for High-Fidelity Reconstruction and Generation
par: Song, Yakun, et autres
Publié: (2025) -
DiSTAR: Diffusion over a Scalable Token Autoregressive Representation for Speech Generation
par: Song, Yakun, et autres
Publié: (2025) -
Direct Preference Optimization for Speech Autoregressive Diffusion Models
par: Liu, Zhijun, et autres
Publié: (2025) -
Sound-VECaps: Improving Audio Generation with Visual Enhanced Captions
par: Yuan, Yi, et autres
Publié: (2024) -
Phone-Level Prosody Modelling with GMM-Based MDN for Diverse and Controllable Speech Synthesis
par: Du, Chenpeng, et autres
Publié: (2021)