Next Block Prediction: Video Generation via Semi-Autoregressive Modeling
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ren, Shuhuai, Ma, Shuming, Sun, Xu, Wei, Furu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VideoAR: Autoregressive Video Generation via Next-Frame & Scale Prediction
par: Ji, Longbin, et autres
Publié: (2026)
par: Ji, Longbin, et autres
Publié: (2026)
LaDiC: Are Diffusion Models Really Inferior to Autoregressive Counterparts for Image-to-Text Generation?
par: Wang, Yuchi, et autres
Publié: (2024)
par: Wang, Yuchi, et autres
Publié: (2024)
Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction
par: Tian, Keyu, et autres
Publié: (2024)
par: Tian, Keyu, et autres
Publié: (2024)
TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding
par: Ren, Shuhuai, et autres
Publié: (2023)
par: Ren, Shuhuai, et autres
Publié: (2023)
Towards Multimodal Video Paragraph Captioning Models Robust to Missing Modality
par: Chen, Sishuo, et autres
Publié: (2024)
par: Chen, Sishuo, et autres
Publié: (2024)
TEMPLE: Incentivizing Temporal Understanding of Video Large Language Models via Progressive Pre-SFT Alignment
par: Li, Shicheng, et autres
Publié: (2025)
par: Li, Shicheng, et autres
Publié: (2025)
VITATECS: A Diagnostic Dataset for Temporal Concept Understanding of Video-Language Models
par: Li, Shicheng, et autres
Publié: (2023)
par: Li, Shicheng, et autres
Publié: (2023)
Motion-Aware Caching for Efficient Autoregressive Video Generation
par: Xu, Jing, et autres
Publié: (2026)
par: Xu, Jing, et autres
Publié: (2026)
LARP: Tokenizing Videos with a Learned Autoregressive Generative Prior
par: Wang, Hanyu, et autres
Publié: (2024)
par: Wang, Hanyu, et autres
Publié: (2024)
MAGI-1: Autoregressive Video Generation at Scale
par: ai, Sand., et autres
Publié: (2025)
par: ai, Sand., et autres
Publié: (2025)
Speculative Decoding for Autoregressive Video Generation
par: Hu, Yuezhou, et autres
Publié: (2026)
par: Hu, Yuezhou, et autres
Publié: (2026)
Head Forcing: Long Autoregressive Video Generation via Head Heterogeneity
par: Tian, Jiahao, et autres
Publié: (2026)
par: Tian, Jiahao, et autres
Publié: (2026)
Video-GPT via Next Clip Diffusion
par: Zhuang, Shaobin, et autres
Publié: (2025)
par: Zhuang, Shaobin, et autres
Publié: (2025)
Fostering Video Reasoning via Next-Event Prediction
par: Wang, Haonan, et autres
Publié: (2025)
par: Wang, Haonan, et autres
Publié: (2025)
Fast Autoregressive Video Generation with Diagonal Decoding
par: Ye, Yang, et autres
Publié: (2025)
par: Ye, Yang, et autres
Publié: (2025)
DySink: Dynamic Frame Sinks for Autoregressive Long Video Generation
par: Ye, Bo, et autres
Publié: (2026)
par: Ye, Bo, et autres
Publié: (2026)
MarDini: Masked Autoregressive Diffusion for Video Generation at Scale
par: Liu, Haozhe, et autres
Publié: (2024)
par: Liu, Haozhe, et autres
Publié: (2024)
Inferix: A Block-Diffusion based Next-Generation Inference Engine for World Simulation
par: Inferix Team, et autres
Publié: (2025)
par: Inferix Team, et autres
Publié: (2025)
Autoregressive Video Generation beyond Next Frames Prediction
par: Ren, Sucheng, et autres
Publié: (2025)
par: Ren, Sucheng, et autres
Publié: (2025)
MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation
par: Chen, Ming, et autres
Publié: (2025)
par: Chen, Ming, et autres
Publié: (2025)
Block Cascading: Training Free Acceleration of Block-Causal Video Models
par: Bandyopadhyay, Hmrishav, et autres
Publié: (2025)
par: Bandyopadhyay, Hmrishav, et autres
Publié: (2025)
SANA-Video: Efficient Video Generation with Block Linear Diffusion Transformer
par: Chen, Junsong, et autres
Publié: (2025)
par: Chen, Junsong, et autres
Publié: (2025)
RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction
par: Wang, Yuchi, et autres
Publié: (2025)
par: Wang, Yuchi, et autres
Publié: (2025)
HiTVideo: Hierarchical Tokenizers for Enhancing Text-to-Video Generation with Autoregressive Large Language Models
par: Zhou, Ziqin, et autres
Publié: (2025)
par: Zhou, Ziqin, et autres
Publié: (2025)
BIVDiff: A Training-Free Framework for General-Purpose Video Synthesis via Bridging Image and Video Diffusion Models
par: Shi, Fengyuan, et autres
Publié: (2023)
par: Shi, Fengyuan, et autres
Publié: (2023)
PointNSP: Autoregressive 3D Point Cloud Generation with Next-Scale Level-of-Detail Prediction
par: Meng, Ziqiao, et autres
Publié: (2025)
par: Meng, Ziqiao, et autres
Publié: (2025)
One-Forcing: Towards Stable One-Step Autoregressive Video Generation
par: Feng, Jiaqi, et autres
Publié: (2026)
par: Feng, Jiaqi, et autres
Publié: (2026)
VisCodex: Unified Multimodal Code Generation via Merging Vision and Coding Models
par: Jiang, Lingjie, et autres
Publié: (2025)
par: Jiang, Lingjie, et autres
Publié: (2025)
VideoMAR: Autoregressive Video Generatio with Continuous Tokens
par: Yu, Hu, et autres
Publié: (2025)
par: Yu, Hu, et autres
Publié: (2025)
Vision Foundation Models as Effective Visual Tokenizers for Autoregressive Image Generation
par: Zheng, Anlin, et autres
Publié: (2025)
par: Zheng, Anlin, et autres
Publié: (2025)
CubeComposer: Spatio-Temporal Autoregressive 4K 360° Video Generation from Perspective Video
par: Li, Lingen, et autres
Publié: (2026)
par: Li, Lingen, et autres
Publié: (2026)
TokenTrim: Inference-Time Token Pruning for Autoregressive Long Video Generation
par: Shaulov, Ariel, et autres
Publié: (2026)
par: Shaulov, Ariel, et autres
Publié: (2026)
Cut2Next: Generating Next Shot via In-Context Tuning
par: He, Jingwen, et autres
Publié: (2025)
par: He, Jingwen, et autres
Publié: (2025)
Direction-Aware Diagonal Autoregressive Image Generation
par: Xu, Yijia, et autres
Publié: (2025)
par: Xu, Yijia, et autres
Publié: (2025)
MAVIN: Multi-Action Video Generation with Diffusion Models via Transition Video Infilling
par: Zhang, Bowen, et autres
Publié: (2024)
par: Zhang, Bowen, et autres
Publié: (2024)
Adversarial Error Correction for Visual Autoregressive Generation
par: Bi, Ligong, et autres
Publié: (2026)
par: Bi, Ligong, et autres
Publié: (2026)
Layout-Conditioned Autoregressive Text-to-Image Generation via Structured Masking
par: Zheng, Zirui, et autres
Publié: (2025)
par: Zheng, Zirui, et autres
Publié: (2025)
Autoregressive Adversarial Post-Training for Real-Time Interactive Video Generation
par: Lin, Shanchuan, et autres
Publié: (2025)
par: Lin, Shanchuan, et autres
Publié: (2025)
Mesh RAG: Retrieval Augmentation for Autoregressive Mesh Generation
par: Sun, Xiatao, et autres
Publié: (2025)
par: Sun, Xiatao, et autres
Publié: (2025)
Predicting the Next Action by Modeling the Abstract Goal
par: Roy, Debaditya, et autres
Publié: (2022)
par: Roy, Debaditya, et autres
Publié: (2022)
Documents similaires
-
VideoAR: Autoregressive Video Generation via Next-Frame & Scale Prediction
par: Ji, Longbin, et autres
Publié: (2026) -
LaDiC: Are Diffusion Models Really Inferior to Autoregressive Counterparts for Image-to-Text Generation?
par: Wang, Yuchi, et autres
Publié: (2024) -
Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction
par: Tian, Keyu, et autres
Publié: (2024) -
TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding
par: Ren, Shuhuai, et autres
Publié: (2023) -
Towards Multimodal Video Paragraph Captioning Models Robust to Missing Modality
par: Chen, Sishuo, et autres
Publié: (2024)