Taming Teacher Forcing for Masked Autoregressive Video Generation
Fuente:
arXiv
Saved in:
| Main Authors: | Zhou, Deyu, Sun, Quan, Peng, Yuang, Yan, Kun, Dong, Runpei, Wang, Duomin, Ge, Zheng, Duan, Nan, Zhang, Xiangyu, Ni, Lionel M., Shum, Heung-Yeung |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
LazyDrag: Enabling Stable Drag-Based Editing on Multi-Modal Diffusion Transformers via Explicit Correspondence
by: Yin, Zixin, et al.
Published: (2025)
by: Yin, Zixin, et al.
Published: (2025)
Training-Free Text-Guided Color Editing with Multi-Modal Diffusion Transformer
by: Yin, Zixin, et al.
Published: (2025)
by: Yin, Zixin, et al.
Published: (2025)
Large Investment Model
by: Guo, Jian, et al.
Published: (2024)
by: Guo, Jian, et al.
Published: (2024)
Alpha-GPT: Human-AI Interactive Alpha Mining for Quantitative Investment
by: Wang, Saizhuo, et al.
Published: (2023)
by: Wang, Saizhuo, et al.
Published: (2023)
NoiseAR: AutoRegressing Initial Noise Prior for Diffusion Models
by: Li, Zeming, et al.
Published: (2025)
by: Li, Zeming, et al.
Published: (2025)
Exploring Recurrent Long-term Temporal Fusion for Multi-view 3D Perception
by: Han, Chunrui, et al.
Published: (2023)
by: Han, Chunrui, et al.
Published: (2023)
Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model
by: Hu, Jingcheng, et al.
Published: (2025)
by: Hu, Jingcheng, et al.
Published: (2025)
Knot Forcing: Taming Autoregressive Video Diffusion Models for Real-time Infinite Interactive Portrait Animation
by: Xiao, Steven, et al.
Published: (2025)
by: Xiao, Steven, et al.
Published: (2025)
SQuadGen: Generating Simple Quad Layouts via Chart Distance Fields
by: Kong, Youkang, et al.
Published: (2026)
by: Kong, Youkang, et al.
Published: (2026)
DreamBench++: A Human-Aligned Benchmark for Personalized Image Generation
by: Peng, Yuang, et al.
Published: (2024)
by: Peng, Yuang, et al.
Published: (2024)
RAE-AR: Taming Autoregressive Models with Representation Autoencoders
by: Yu, Hu, et al.
Published: (2026)
by: Yu, Hu, et al.
Published: (2026)
Perception in Reflection
by: Wei, Yana, et al.
Published: (2025)
by: Wei, Yana, et al.
Published: (2025)
Video-MTR: Reinforced Multi-Turn Reasoning for Long Video Understanding
by: Xie, Yuan, et al.
Published: (2025)
by: Xie, Yuan, et al.
Published: (2025)
Think-on-Graph: Deep and Responsible Reasoning of Large Language Model on Knowledge Graph
by: Sun, Jiashuo, et al.
Published: (2023)
by: Sun, Jiashuo, et al.
Published: (2023)
Multi-matrix Factorization Attention
by: Hu, Jingcheng, et al.
Published: (2024)
by: Hu, Jingcheng, et al.
Published: (2024)
Context Forcing: Consistent Autoregressive Video Generation with Long Context
by: Chen, Shuo, et al.
Published: (2026)
by: Chen, Shuo, et al.
Published: (2026)
Qwen-Image-Layered: Towards Inherent Editability via Layer Decomposition
by: Yin, Shengming, et al.
Published: (2025)
by: Yin, Shengming, et al.
Published: (2025)
DreamLLM: Synergistic Multimodal Comprehension and Creation
by: Dong, Runpei, et al.
Published: (2023)
by: Dong, Runpei, et al.
Published: (2023)
The Vertical Challenge of Low-Altitude Economy: Why We Need a Unified Height System?
by: Yan, Shuaichen, et al.
Published: (2026)
by: Yan, Shuaichen, et al.
Published: (2026)
Layout-Conditioned Autoregressive Text-to-Image Generation via Structured Masking
by: Zheng, Zirui, et al.
Published: (2025)
by: Zheng, Zirui, et al.
Published: (2025)
Reward-Forcing: Autoregressive Video Generation with Reward Feedback
by: Zhang, Jingran, et al.
Published: (2026)
by: Zhang, Jingran, et al.
Published: (2026)
Sparse Forcing: Native Trainable Sparse Attention for Real-time Autoregressive Diffusion Video Generation
by: Xu, Boxun, et al.
Published: (2026)
by: Xu, Boxun, et al.
Published: (2026)
ALTo: Adaptive-Length Tokenizer for Autoregressive Mask Generation
by: Wang, Lingfeng, et al.
Published: (2025)
by: Wang, Lingfeng, et al.
Published: (2025)
UniVerse-1: Unified Audio-Video Generation via Stitching of Experts
by: Wang, Duomin, et al.
Published: (2025)
by: Wang, Duomin, et al.
Published: (2025)
MarDini: Masked Autoregressive Diffusion for Video Generation at Scale
by: Liu, Haozhe, et al.
Published: (2024)
by: Liu, Haozhe, et al.
Published: (2024)
CanvasMAR: Improving Masked Autoregressive Video Prediction With Canvas
by: Li, Zian, et al.
Published: (2025)
by: Li, Zian, et al.
Published: (2025)
Causal Forcing++: Scalable Few-Step Autoregressive Diffusion Distillation for Real-Time Interactive Video Generation
by: Zhao, Min, et al.
Published: (2026)
by: Zhao, Min, et al.
Published: (2026)
LoRA-IR: Taming Low-Rank Experts for Efficient All-in-One Image Restoration
by: Ai, Yuang, et al.
Published: (2024)
by: Ai, Yuang, et al.
Published: (2024)
Rolling Forcing: Autoregressive Long Video Diffusion in Real Time
by: Liu, Kunhao, et al.
Published: (2025)
by: Liu, Kunhao, et al.
Published: (2025)
Taming the Entropy Cliff: Variable Codebook Size Quantization for Autoregressive Visual Generation
by: Zheng, Bowen, et al.
Published: (2026)
by: Zheng, Bowen, et al.
Published: (2026)
Light Future: Multimodal Action Frame Prediction via InstructPix2Pix
by: Zhong, Zesen, et al.
Published: (2025)
by: Zhong, Zesen, et al.
Published: (2025)
Portrait4D-v2: Pseudo Multi-View Data Creates Better 4D Head Synthesizer
by: Deng, Yu, et al.
Published: (2024)
by: Deng, Yu, et al.
Published: (2024)
Learning Getting-Up Policies for Real-World Humanoid Robots
by: He, Xialin, et al.
Published: (2025)
by: He, Xialin, et al.
Published: (2025)
Learning Humanoid End-Effector Control for Open-Vocabulary Visual Loco-Manipulation
by: Dong, Runpei, et al.
Published: (2026)
by: Dong, Runpei, et al.
Published: (2026)
SAMRefiner: Taming Segment Anything Model for Universal Mask Refinement
by: Lin, Yuqi, et al.
Published: (2025)
by: Lin, Yuqi, et al.
Published: (2025)
SMPLer: Taming Transformers for Monocular 3D Human Shape and Pose Estimation
by: Xu, Xiangyu, et al.
Published: (2024)
by: Xu, Xiangyu, et al.
Published: (2024)
Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression
by: Wang, Lirui, et al.
Published: (2025)
by: Wang, Lirui, et al.
Published: (2025)
One-Forcing: Towards Stable One-Step Autoregressive Video Generation
by: Feng, Jiaqi, et al.
Published: (2026)
by: Feng, Jiaqi, et al.
Published: (2026)
Light Forcing: Accelerating Autoregressive Video Diffusion via Sparse Attention
by: Lv, Chengtao, et al.
Published: (2026)
by: Lv, Chengtao, et al.
Published: (2026)
Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion
by: Huang, Xun, et al.
Published: (2025)
by: Huang, Xun, et al.
Published: (2025)
Similar Items
-
LazyDrag: Enabling Stable Drag-Based Editing on Multi-Modal Diffusion Transformers via Explicit Correspondence
by: Yin, Zixin, et al.
Published: (2025) -
Training-Free Text-Guided Color Editing with Multi-Modal Diffusion Transformer
by: Yin, Zixin, et al.
Published: (2025) -
Large Investment Model
by: Guo, Jian, et al.
Published: (2024) -
Alpha-GPT: Human-AI Interactive Alpha Mining for Quantitative Investment
by: Wang, Saizhuo, et al.
Published: (2023) -
NoiseAR: AutoRegressing Initial Noise Prior for Diffusion Models
by: Li, Zeming, et al.
Published: (2025)