ACDiT: Interpolating Autoregressive Conditional Modeling and Diffusion Transformer
Fuente:
arXiv
Salvato in:
| Autori principali: | Hu, Jinyi, Hu, Shengding, Song, Yuxuan, Huang, Yufei, Wang, Mingxuan, Zhou, Hao, Liu, Zhiyuan, Ma, Wei-Ying, Sun, Maosong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Revisiting Non-Autoregressive Transformers for Efficient Image Synthesis
di: Ni, Zanlin, et al.
Pubblicazione: (2024)
di: Ni, Zanlin, et al.
Pubblicazione: (2024)
LEGENT: Open Platform for Embodied Agents
di: Cheng, Zhili, et al.
Pubblicazione: (2024)
di: Cheng, Zhili, et al.
Pubblicazione: (2024)
EmbodiedEval: Evaluate Multimodal LLMs as Embodied Agents
di: Cheng, Zhili, et al.
Pubblicazione: (2025)
di: Cheng, Zhili, et al.
Pubblicazione: (2025)
Unified View of Grokking, Double Descent and Emergent Abilities: A Perspective from Circuits Competition
di: Huang, Yufei, et al.
Pubblicazione: (2024)
di: Huang, Yufei, et al.
Pubblicazione: (2024)
LaVieID: Local Autoregressive Diffusion Transformers for Identity-Preserving Video Creation
di: Song, Wenhui, et al.
Pubblicazione: (2025)
di: Song, Wenhui, et al.
Pubblicazione: (2025)
Context-Aware Autoregressive Models for Multi-Conditional Image Generation
di: Chen, Yixiao, et al.
Pubblicazione: (2025)
di: Chen, Yixiao, et al.
Pubblicazione: (2025)
Exploring Perceptual Limitation of Multimodal Large Language Models
di: Zhang, Jiarui, et al.
Pubblicazione: (2024)
di: Zhang, Jiarui, et al.
Pubblicazione: (2024)
ARLON: Boosting Diffusion Transformers with Autoregressive Models for Long Video Generation
di: Li, Zongyi, et al.
Pubblicazione: (2024)
di: Li, Zongyi, et al.
Pubblicazione: (2024)
MonoFormer: One Transformer for Both Diffusion and Autoregression
di: Zhao, Chuyang, et al.
Pubblicazione: (2024)
di: Zhao, Chuyang, et al.
Pubblicazione: (2024)
Kaleido Diffusion: Improving Conditional Diffusion Models with Autoregressive Latent Modeling
di: Gu, Jiatao, et al.
Pubblicazione: (2024)
di: Gu, Jiatao, et al.
Pubblicazione: (2024)
Rolling Forcing: Autoregressive Long Video Diffusion in Real Time
di: Liu, Kunhao, et al.
Pubblicazione: (2025)
di: Liu, Kunhao, et al.
Pubblicazione: (2025)
Condition Errors Refinement in Autoregressive Image Generation with Diffusion Loss
di: Zhou, Yucheng, et al.
Pubblicazione: (2026)
di: Zhou, Yucheng, et al.
Pubblicazione: (2026)
Generative Pre-trained Autoregressive Diffusion Transformer
di: Zhang, Yuan, et al.
Pubblicazione: (2025)
di: Zhang, Yuan, et al.
Pubblicazione: (2025)
Marrying Autoregressive Transformer and Diffusion with Multi-Reference Autoregression
di: Zhen, Dingcheng, et al.
Pubblicazione: (2025)
di: Zhen, Dingcheng, et al.
Pubblicazione: (2025)
Autoregressive Distillation of Diffusion Transformers
di: Kim, Yeongmin, et al.
Pubblicazione: (2025)
di: Kim, Yeongmin, et al.
Pubblicazione: (2025)
Hierarchical Flow Diffusion for Efficient Frame Interpolation
di: Hai, Yang, et al.
Pubblicazione: (2025)
di: Hai, Yang, et al.
Pubblicazione: (2025)
Polyphony: Diffusion-based Dual-Hand Action Segmentation with Alternating Vision Transformer and Semantic Conditioning
di: Zheng, Hao, et al.
Pubblicazione: (2026)
di: Zheng, Hao, et al.
Pubblicazione: (2026)
UniCombine: Unified Multi-Conditional Combination with Diffusion Transformer
di: Wang, Haoxuan, et al.
Pubblicazione: (2025)
di: Wang, Haoxuan, et al.
Pubblicazione: (2025)
States Hidden in Hidden States: LLMs Emerge Discrete State Representations Implicitly
di: Chen, Junhao, et al.
Pubblicazione: (2024)
di: Chen, Junhao, et al.
Pubblicazione: (2024)
Epona: Autoregressive Diffusion World Model for Autonomous Driving
di: Zhang, Kaiwen, et al.
Pubblicazione: (2025)
di: Zhang, Kaiwen, et al.
Pubblicazione: (2025)
Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning
di: Wang, Bohan, et al.
Pubblicazione: (2025)
di: Wang, Bohan, et al.
Pubblicazione: (2025)
Accelerating Diffusion Transformer via Increment-Calibrated Caching with Channel-Aware Singular Value Decomposition
di: Chen, Zhiyuan, et al.
Pubblicazione: (2025)
di: Chen, Zhiyuan, et al.
Pubblicazione: (2025)
VGGT-World: Transforming VGGT into an Autoregressive Geometry World Model
di: Sun, Xiangyu, et al.
Pubblicazione: (2026)
di: Sun, Xiangyu, et al.
Pubblicazione: (2026)
Stochastic Interpolants via Conditional Dependent Coupling
di: Ma, Chenrui, et al.
Pubblicazione: (2025)
di: Ma, Chenrui, et al.
Pubblicazione: (2025)
FREE: Uncertainty-Aware Autoregression for Parallel Diffusion Transformers
di: Wen, Xinwan, et al.
Pubblicazione: (2025)
di: Wen, Xinwan, et al.
Pubblicazione: (2025)
Towards Holistic Modeling for Video Frame Interpolation with Auto-regressive Diffusion Transformers
di: Peng, Xinyu, et al.
Pubblicazione: (2026)
di: Peng, Xinyu, et al.
Pubblicazione: (2026)
Multi-Modal Multi-Granularity Tokenizer for Chu Bamboo Slip Scripts
di: Chen, Yingfa, et al.
Pubblicazione: (2024)
di: Chen, Yingfa, et al.
Pubblicazione: (2024)
Real-Time Motion-Controllable Autoregressive Video Diffusion
di: Zhao, Kesen, et al.
Pubblicazione: (2025)
di: Zhao, Kesen, et al.
Pubblicazione: (2025)
End-to-End Training for Autoregressive Video Diffusion via Self-Resampling
di: Guo, Yuwei, et al.
Pubblicazione: (2025)
di: Guo, Yuwei, et al.
Pubblicazione: (2025)
Towards Better & Faster Autoregressive Image Generation: From the Perspective of Entropy
di: Ma, Xiaoxiao, et al.
Pubblicazione: (2025)
di: Ma, Xiaoxiao, et al.
Pubblicazione: (2025)
BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation
di: Hu, Panwen, et al.
Pubblicazione: (2025)
di: Hu, Panwen, et al.
Pubblicazione: (2025)
DC-AR: Efficient Masked Autoregressive Image Generation with Deep Compression Hybrid Tokenizer
di: Wu, Yecheng, et al.
Pubblicazione: (2025)
di: Wu, Yecheng, et al.
Pubblicazione: (2025)
Diffusion Prior Interpolation for Flexibility Real-World Face Super-Resolution
di: Yang, Jiarui, et al.
Pubblicazione: (2024)
di: Yang, Jiarui, et al.
Pubblicazione: (2024)
EfficientMT: Efficient Temporal Adaptation for Motion Transfer in Text-to-Video Diffusion Models
di: Cai, Yufei, et al.
Pubblicazione: (2025)
di: Cai, Yufei, et al.
Pubblicazione: (2025)
SiT: Exploring Flow and Diffusion-based Generative Models with Scalable Interpolant Transformers
di: Ma, Nanye, et al.
Pubblicazione: (2024)
di: Ma, Nanye, et al.
Pubblicazione: (2024)
Group Critical-token Policy Optimization for Autoregressive Image Generation
di: Zhang, Guohui, et al.
Pubblicazione: (2025)
di: Zhang, Guohui, et al.
Pubblicazione: (2025)
Efficient Portrait Matte Creation With Layer Diffusion and Connectivity Priors
di: Lu, Zhiyuan, et al.
Pubblicazione: (2025)
di: Lu, Zhiyuan, et al.
Pubblicazione: (2025)
Progressive Autoregressive Video Diffusion Models
di: Xie, Desai, et al.
Pubblicazione: (2024)
di: Xie, Desai, et al.
Pubblicazione: (2024)
RLHF-V: Towards Trustworthy MLLMs via Behavior Alignment from Fine-grained Correctional Human Feedback
di: Yu, Tianyu, et al.
Pubblicazione: (2023)
di: Yu, Tianyu, et al.
Pubblicazione: (2023)
Transferable Physical-World Adversarial Patches Against Pedestrian Detection Models
di: Yan, Shihui, et al.
Pubblicazione: (2026)
di: Yan, Shihui, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Revisiting Non-Autoregressive Transformers for Efficient Image Synthesis
di: Ni, Zanlin, et al.
Pubblicazione: (2024) -
LEGENT: Open Platform for Embodied Agents
di: Cheng, Zhili, et al.
Pubblicazione: (2024) -
EmbodiedEval: Evaluate Multimodal LLMs as Embodied Agents
di: Cheng, Zhili, et al.
Pubblicazione: (2025) -
Unified View of Grokking, Double Descent and Emergent Abilities: A Perspective from Circuits Competition
di: Huang, Yufei, et al.
Pubblicazione: (2024) -
LaVieID: Local Autoregressive Diffusion Transformers for Identity-Preserving Video Creation
di: Song, Wenhui, et al.
Pubblicazione: (2025)