ARLON: Boosting Diffusion Transformers with Autoregressive Models for Long Video Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Zongyi, Hu, Shujie, Liu, Shujie, Zhou, Long, Choi, Jeongsoo, Meng, Lingwei, Guo, Xun, Li, Jinyu, Ling, Hefei, Wei, Furu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Boosting Large Language Model for Speech Synthesis: An Empirical Study
por: Hao, Hongkun, et al.
Publicado: (2023)
por: Hao, Hongkun, et al.
Publicado: (2023)
Autoregressive Speech Synthesis without Vector Quantization
por: Meng, Lingwei, et al.
Publicado: (2024)
por: Meng, Lingwei, et al.
Publicado: (2024)
V2SFlow: Video-to-Speech Generation with Speech Decomposition and Rectified Flow
por: Choi, Jeongsoo, et al.
Publicado: (2024)
por: Choi, Jeongsoo, et al.
Publicado: (2024)
WavLLM: Towards Robust and Adaptive Speech Large Language Model
por: Hu, Shujie, et al.
Publicado: (2024)
por: Hu, Shujie, et al.
Publicado: (2024)
VALL-E R: Robust and Efficient Zero-Shot Text-to-Speech Synthesis via Monotonic Alignment
por: Han, Bing, et al.
Publicado: (2024)
por: Han, Bing, et al.
Publicado: (2024)
StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling
por: Wang, Hui, et al.
Publicado: (2025)
por: Wang, Hui, et al.
Publicado: (2025)
FELLE: Autoregressive Speech Synthesis with Token-Wise Coarse-to-Fine Flow Matching
por: Wang, Hui, et al.
Publicado: (2025)
por: Wang, Hui, et al.
Publicado: (2025)
Advanced Long-Content Speech Recognition With Factorized Neural Transducer
por: Gong, Xun, et al.
Publicado: (2024)
por: Gong, Xun, et al.
Publicado: (2024)
VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers
por: Chen, Sanyuan, et al.
Publicado: (2024)
por: Chen, Sanyuan, et al.
Publicado: (2024)
Pseudo-Autoregressive Neural Codec Language Models for Efficient Zero-Shot Text-to-Speech Synthesis
por: Yang, Yifan, et al.
Publicado: (2025)
por: Yang, Yifan, et al.
Publicado: (2025)
WavMark: Watermarking for Audio Generation
por: Chen, Guangyu, et al.
Publicado: (2023)
por: Chen, Guangyu, et al.
Publicado: (2023)
A proof for the conjecture on superlinear problems with Ambrosetti-Rabinowitz condition
por: Li, Chong, et al.
Publicado: (2026)
por: Li, Chong, et al.
Publicado: (2026)
Risk Factors of Thrombocytopenia After Cardiac Surgery with Cardiopulmonary Bypass
por: Shujie Yan
Publicado: (2023)
por: Shujie Yan
Publicado: (2023)
EmotionThinker: Prosody-Aware Reinforcement Learning for Explainable Speech Emotion Reasoning
por: Wang, Dingdong, et al.
Publicado: (2026)
por: Wang, Dingdong, et al.
Publicado: (2026)
Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling
por: Sun, Haiyang, et al.
Publicado: (2025)
por: Sun, Haiyang, et al.
Publicado: (2025)
Next Block Prediction: Video Generation via Semi-Autoregressive Modeling
por: Ren, Shuhuai, et al.
Publicado: (2025)
por: Ren, Shuhuai, et al.
Publicado: (2025)
AlignFormer: Modality Matching Can Achieve Better Zero-shot Instruction-Following Speech-LLM
por: Fan, Ruchao, et al.
Publicado: (2024)
por: Fan, Ruchao, et al.
Publicado: (2024)
Large Language Model Can Transcribe Speech in Multi-Talker Scenarios with Versatile Instructions
por: Meng, Lingwei, et al.
Publicado: (2024)
por: Meng, Lingwei, et al.
Publicado: (2024)
Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion
por: Huang, Xun, et al.
Publicado: (2025)
por: Huang, Xun, et al.
Publicado: (2025)
Long-range hopping in a quasiperiodic potential weakens the non-Hermitian skin effect
por: Peng, Dechi, et al.
Publicado: (2024)
por: Peng, Dechi, et al.
Publicado: (2024)
LaVieID: Local Autoregressive Diffusion Transformers for Identity-Preserving Video Creation
por: Song, Wenhui, et al.
Publicado: (2025)
por: Song, Wenhui, et al.
Publicado: (2025)
A$^2$RD: Agentic Autoregressive Diffusion for Long Video Consistency
por: Long, Do Xuan, et al.
Publicado: (2026)
por: Long, Do Xuan, et al.
Publicado: (2026)
DySink: Dynamic Frame Sinks for Autoregressive Long Video Generation
por: Ye, Bo, et al.
Publicado: (2026)
por: Ye, Bo, et al.
Publicado: (2026)
Representation Alignment Contrastive Regularization for Multi-Object Tracking
por: Liu, Zhonglin, et al.
Publicado: (2024)
por: Liu, Zhonglin, et al.
Publicado: (2024)
DEER: Draft with Diffusion, Verify with Autoregressive Models
por: Cheng, Zicong, et al.
Publicado: (2025)
por: Cheng, Zicong, et al.
Publicado: (2025)
DBDH: A Dual-Branch Dual-Head Neural Network for Invisible Embedded Regions Localization
por: Zhao, Chengxin, et al.
Publicado: (2024)
por: Zhao, Chengxin, et al.
Publicado: (2024)
Privacy-Preserving Community Detection for Locally Distributed Multiple Networks
por: Guo, Xiao, et al.
Publicado: (2023)
por: Guo, Xiao, et al.
Publicado: (2023)
Where Do Flow Semantics Reside? A Protocol-Native Tabular Pretraining Paradigm for Encrypted Traffic Classification
por: Huang, Sizhe, et al.
Publicado: (2026)
por: Huang, Sizhe, et al.
Publicado: (2026)
AlignDiT: Multimodal Aligned Diffusion Transformer for Synchronized Speech Generation
por: Choi, Jeongsoo, et al.
Publicado: (2025)
por: Choi, Jeongsoo, et al.
Publicado: (2025)
Generalization and Risk Bounds for Recurrent Neural Networks
por: Cheng, Xuewei, et al.
Publicado: (2024)
por: Cheng, Xuewei, et al.
Publicado: (2024)
A joint modeling approach to treatment effects estimation with unmeasured confounders
por: Lee, Namhwa, et al.
Publicado: (2024)
por: Lee, Namhwa, et al.
Publicado: (2024)
Transfer Learning for High Dimensional Robust Regression
por: Yuan, Xiaohui, et al.
Publicado: (2024)
por: Yuan, Xiaohui, et al.
Publicado: (2024)
Learning to Identify Conflicts in RPKI
por: Schulmann, Haya, et al.
Publicado: (2025)
por: Schulmann, Haya, et al.
Publicado: (2025)
TASER: Task-Aware Spectral Energy Refine for Backdoor Suppression in UAV Swarms Decentralized Federated Learning
por: Huang, Sizhe, et al.
Publicado: (2026)
por: Huang, Sizhe, et al.
Publicado: (2026)
LongCat-AudioDiT: High-Fidelity Diffusion Text-to-Speech in the Waveform Latent Space
por: Xin, Detai, et al.
Publicado: (2026)
por: Xin, Detai, et al.
Publicado: (2026)
Interleaved Speech-Text Language Models for Simple Streaming Text-to-Speech Synthesis
por: Yang, Yifan, et al.
Publicado: (2024)
por: Yang, Yifan, et al.
Publicado: (2024)
Rolling Forcing: Autoregressive Long Video Diffusion in Real Time
por: Liu, Kunhao, et al.
Publicado: (2025)
por: Liu, Kunhao, et al.
Publicado: (2025)
Entropy-Guided k-Guard Sampling for Long-Horizon Autoregressive Video Generation
por: Han, Yizhao, et al.
Publicado: (2026)
por: Han, Yizhao, et al.
Publicado: (2026)
Efficient Autoregressive Video Diffusion with Dummy Head
por: Guo, Hang, et al.
Publicado: (2026)
por: Guo, Hang, et al.
Publicado: (2026)
Thermodynamic modes of a quasiperiodic mobility-edge system in a quantum Otto cycle
por: Zhou, Ao, et al.
Publicado: (2026)
por: Zhou, Ao, et al.
Publicado: (2026)
Ejemplares similares
-
Boosting Large Language Model for Speech Synthesis: An Empirical Study
por: Hao, Hongkun, et al.
Publicado: (2023) -
Autoregressive Speech Synthesis without Vector Quantization
por: Meng, Lingwei, et al.
Publicado: (2024) -
V2SFlow: Video-to-Speech Generation with Speech Decomposition and Rectified Flow
por: Choi, Jeongsoo, et al.
Publicado: (2024) -
WavLLM: Towards Robust and Adaptive Speech Large Language Model
por: Hu, Shujie, et al.
Publicado: (2024) -
VALL-E R: Robust and Efficient Zero-Shot Text-to-Speech Synthesis via Monotonic Alignment
por: Han, Bing, et al.
Publicado: (2024)