Recurrent Autoregressive Diffusion: Global Memory Meets Local Attention
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Taiye, Ding, Zihan, Li, Anjian, Zhang, Christina, Xiao, Zeqi, Wang, Yisen, Jin, Chi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
VRAG: Learning World Models for Interactive Video Generation
por: Chen, Taiye, et al.
Publicado: (2025)
por: Chen, Taiye, et al.
Publicado: (2025)
Generative Diffusion Modeling: A Practical Handbook
por: Ding, Zihan, et al.
Publicado: (2024)
por: Ding, Zihan, et al.
Publicado: (2024)
Attend Locally, Remember Linearly: Linear Attention as Cross-Frame Memory for Autoregressive Video Diffusion
por: Li, Kunyang, et al.
Publicado: (2026)
por: Li, Kunyang, et al.
Publicado: (2026)
Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers
por: Zhou, Yifan, et al.
Publicado: (2025)
por: Zhou, Yifan, et al.
Publicado: (2025)
Alias-Free Latent Diffusion Models: Improving Fractional Shift Equivariance of Diffusion Latent Space
por: Zhou, Yifan, et al.
Publicado: (2025)
por: Zhou, Yifan, et al.
Publicado: (2025)
MonoFormer: One Transformer for Both Diffusion and Autoregression
por: Zhao, Chuyang, et al.
Publicado: (2024)
por: Zhao, Chuyang, et al.
Publicado: (2024)
Video Diffusion Models are Training-free Motion Interpreter and Controller
por: Xiao, Zeqi, et al.
Publicado: (2024)
por: Xiao, Zeqi, et al.
Publicado: (2024)
Light Forcing: Accelerating Autoregressive Video Diffusion via Sparse Attention
por: Lv, Chengtao, et al.
Publicado: (2026)
por: Lv, Chengtao, et al.
Publicado: (2026)
SwInception -- Local Attention Meets Convolutions
por: Hagerman, David, et al.
Publicado: (2026)
por: Hagerman, David, et al.
Publicado: (2026)
S-BEVLoc: BEV-based Self-supervised Framework for Large-scale LiDAR Global Localization
por: Zhang, Chenghao, et al.
Publicado: (2025)
por: Zhang, Chenghao, et al.
Publicado: (2025)
Causal Forcing++: Scalable Few-Step Autoregressive Diffusion Distillation for Real-Time Interactive Video Generation
por: Zhao, Min, et al.
Publicado: (2026)
por: Zhao, Min, et al.
Publicado: (2026)
Epona: Autoregressive Diffusion World Model for Autonomous Driving
por: Zhang, Kaiwen, et al.
Publicado: (2025)
por: Zhang, Kaiwen, et al.
Publicado: (2025)
LaVieID: Local Autoregressive Diffusion Transformers for Identity-Preserving Video Creation
por: Song, Wenhui, et al.
Publicado: (2025)
por: Song, Wenhui, et al.
Publicado: (2025)
Filter-Guided Diffusion for Controllable Image Generation
por: Gu, Zeqi, et al.
Publicado: (2023)
por: Gu, Zeqi, et al.
Publicado: (2023)
Adaptive Begin-of-Video Tokens for Autoregressive Video Diffusion Models
por: Cheng, Tianle, et al.
Publicado: (2025)
por: Cheng, Tianle, et al.
Publicado: (2025)
ReHyAt: Recurrent Hybrid Attention for Video Diffusion Transformers
por: Ghafoorian, Mohsen, et al.
Publicado: (2026)
por: Ghafoorian, Mohsen, et al.
Publicado: (2026)
From Text to Mask: Localizing Entities Using the Attention of Text-to-Image Diffusion Models
por: Xiao, Changming, et al.
Publicado: (2023)
por: Xiao, Changming, et al.
Publicado: (2023)
Local Patches Meet Global Context: Scalable 3D Diffusion Priors for Computed Tomography Reconstruction
por: Yang, Taewon, et al.
Publicado: (2025)
por: Yang, Taewon, et al.
Publicado: (2025)
Ca2-VDM: Efficient Autoregressive Video Diffusion Model with Causal Generation and Cache Sharing
por: Gao, Kaifeng, et al.
Publicado: (2024)
por: Gao, Kaifeng, et al.
Publicado: (2024)
ARFlow: Autoregressive Flow with Hybrid Linear Attention
por: Hui, Mude, et al.
Publicado: (2025)
por: Hui, Mude, et al.
Publicado: (2025)
Marrying Autoregressive Transformer and Diffusion with Multi-Reference Autoregression
por: Zhen, Dingcheng, et al.
Publicado: (2025)
por: Zhen, Dingcheng, et al.
Publicado: (2025)
Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning
por: Wang, Bohan, et al.
Publicado: (2025)
por: Wang, Bohan, et al.
Publicado: (2025)
MSC: Multi-Scale Spatio-Temporal Causal Attention for Autoregressive Video Diffusion
por: Xu, Xunnong, et al.
Publicado: (2024)
por: Xu, Xunnong, et al.
Publicado: (2024)
Efficient Autoregressive Video Diffusion with Dummy Head
por: Guo, Hang, et al.
Publicado: (2026)
por: Guo, Hang, et al.
Publicado: (2026)
BinaryAttention: One-Bit QK-Attention for Vision and Diffusion Transformers
por: Xiao, Chaodong, et al.
Publicado: (2026)
por: Xiao, Chaodong, et al.
Publicado: (2026)
ViD-GPT: Introducing GPT-style Autoregressive Generation in Video Diffusion Models
por: Gao, Kaifeng, et al.
Publicado: (2024)
por: Gao, Kaifeng, et al.
Publicado: (2024)
Trajectory Attention for Fine-grained Video Motion Control
por: Xiao, Zeqi, et al.
Publicado: (2024)
por: Xiao, Zeqi, et al.
Publicado: (2024)
Hadamard Attention Recurrent Transformer: A Strong Baseline for Stereo Matching Transformer
por: Chen, Ziyang, et al.
Publicado: (2025)
por: Chen, Ziyang, et al.
Publicado: (2025)
WorldMem: Long-term Consistent World Simulation with Memory
por: Xiao, Zeqi, et al.
Publicado: (2025)
por: Xiao, Zeqi, et al.
Publicado: (2025)
FREE: Uncertainty-Aware Autoregression for Parallel Diffusion Transformers
por: Wen, Xinwan, et al.
Publicado: (2025)
por: Wen, Xinwan, et al.
Publicado: (2025)
UniX: Unifying Autoregression and Diffusion for Chest X-Ray Understanding and Generation
por: Zhang, Ruiheng, et al.
Publicado: (2026)
por: Zhang, Ruiheng, et al.
Publicado: (2026)
Knot Forcing: Taming Autoregressive Video Diffusion Models for Real-time Infinite Interactive Portrait Animation
por: Xiao, Steven, et al.
Publicado: (2025)
por: Xiao, Steven, et al.
Publicado: (2025)
Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation
por: Li, Zaijing, et al.
Publicado: (2026)
por: Li, Zaijing, et al.
Publicado: (2026)
Exploring Local Memorization in Diffusion Models via Bright Ending Attention
por: Chen, Chen, et al.
Publicado: (2024)
por: Chen, Chen, et al.
Publicado: (2024)
Spiking Meets Attention: Efficient Remote Sensing Image Super-Resolution with Attention Spiking Neural Networks
por: Xiao, Yi, et al.
Publicado: (2025)
por: Xiao, Yi, et al.
Publicado: (2025)
Continuous Speculative Decoding for Autoregressive Image Generation
por: Wang, Zili, et al.
Publicado: (2024)
por: Wang, Zili, et al.
Publicado: (2024)
LongAnimation: Long Animation Generation with Dynamic Global-Local Memory
por: Chen, Nan, et al.
Publicado: (2025)
por: Chen, Nan, et al.
Publicado: (2025)
FlowAR: Scale-wise Autoregressive Image Generation Meets Flow Matching
por: Ren, Sucheng, et al.
Publicado: (2024)
por: Ren, Sucheng, et al.
Publicado: (2024)
Global2Local: A Joint-Hierarchical Attention for Video Captioning
por: Dai, Chengpeng, et al.
Publicado: (2022)
por: Dai, Chengpeng, et al.
Publicado: (2022)
Autoregressive Distillation of Diffusion Transformers
por: Kim, Yeongmin, et al.
Publicado: (2025)
por: Kim, Yeongmin, et al.
Publicado: (2025)
Ejemplares similares
-
VRAG: Learning World Models for Interactive Video Generation
por: Chen, Taiye, et al.
Publicado: (2025) -
Generative Diffusion Modeling: A Practical Handbook
por: Ding, Zihan, et al.
Publicado: (2024) -
Attend Locally, Remember Linearly: Linear Attention as Cross-Frame Memory for Autoregressive Video Diffusion
por: Li, Kunyang, et al.
Publicado: (2026) -
Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers
por: Zhou, Yifan, et al.
Publicado: (2025) -
Alias-Free Latent Diffusion Models: Improving Fractional Shift Equivariance of Diffusion Latent Space
por: Zhou, Yifan, et al.
Publicado: (2025)