TempoMaster: Efficient Long Video Generation via Next-Frame-Rate Prediction
Fuente:
arXiv
Salvato in:
| Autori principali: | Ma, Yukuo, Liu, Cong, Wang, Junke, Liu, Junqi, Huang, Haibin, Wu, Zuxuan, Zhang, Chi, Li, Xuelong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VideoAR: Autoregressive Video Generation via Next-Frame & Scale Prediction
di: Ji, Longbin, et al.
Pubblicazione: (2026)
di: Ji, Longbin, et al.
Pubblicazione: (2026)
VideoLoom: A Video Large Language Model for Joint Spatial-Temporal Understanding
di: Shi, Jiapeng, et al.
Pubblicazione: (2026)
di: Shi, Jiapeng, et al.
Pubblicazione: (2026)
Macro-from-Micro Planning for High-Quality and Parallelized Autoregressive Long Video Generation
di: Xiang, Xunzhi, et al.
Pubblicazione: (2025)
di: Xiang, Xunzhi, et al.
Pubblicazione: (2025)
Tele-Omni: a Unified Multimodal Framework for Video Generation and Editing
di: Liu, Jialun, et al.
Pubblicazione: (2026)
di: Liu, Jialun, et al.
Pubblicazione: (2026)
OmniTokenizer: A Joint Image-Video Tokenizer for Visual Generation
di: Wang, Junke, et al.
Pubblicazione: (2024)
di: Wang, Junke, et al.
Pubblicazione: (2024)
Long-Context Autoregressive Video Modeling with Next-Frame Prediction
di: Gu, Yuchao, et al.
Pubblicazione: (2025)
di: Gu, Yuchao, et al.
Pubblicazione: (2025)
DeRA: Decoupled Representation Alignment for Video Tokenization
di: Guo, Pengbo, et al.
Pubblicazione: (2025)
di: Guo, Pengbo, et al.
Pubblicazione: (2025)
Autoregressive Video Generation beyond Next Frames Prediction
di: Ren, Sucheng, et al.
Pubblicazione: (2025)
di: Ren, Sucheng, et al.
Pubblicazione: (2025)
OmniVid: A Generative Framework for Universal Video Understanding
di: Wang, Junke, et al.
Pubblicazione: (2024)
di: Wang, Junke, et al.
Pubblicazione: (2024)
NFIG: Multi-Scale Autoregressive Image Generation via Frequency Ordering
di: Huang, Zhihao, et al.
Pubblicazione: (2025)
di: Huang, Zhihao, et al.
Pubblicazione: (2025)
CtrlVDiff: Controllable Video Generation via Unified Multimodal Video Diffusion
di: Xi, Dianbing, et al.
Pubblicazione: (2025)
di: Xi, Dianbing, et al.
Pubblicazione: (2025)
FluxMem: Adaptive Hierarchical Memory for Streaming Video Understanding
di: Xie, Yiweng, et al.
Pubblicazione: (2026)
di: Xie, Yiweng, et al.
Pubblicazione: (2026)
Pix2Cap-COCO: Advancing Visual Comprehension via Pixel-Level Captioning
di: You, Zuyao, et al.
Pubblicazione: (2025)
di: You, Zuyao, et al.
Pubblicazione: (2025)
TeleStyle: Content-Preserving Style Transfer in Images and Videos
di: Zhang, Shiwen, et al.
Pubblicazione: (2026)
di: Zhang, Shiwen, et al.
Pubblicazione: (2026)
QwenStyle: Content-Preserving Style Transfer with Qwen-Image-Edit
di: Zhang, Shiwen, et al.
Pubblicazione: (2026)
di: Zhang, Shiwen, et al.
Pubblicazione: (2026)
Rethinking Discrete Tokens: Treating Them as Conditions for Continuous Autoregressive Image Synthesis
di: Zheng, Peng, et al.
Pubblicazione: (2025)
di: Zheng, Peng, et al.
Pubblicazione: (2025)
FrameThinker: Learning to Think with Long Videos via Multi-Turn Frame Spotlighting
di: He, Zefeng, et al.
Pubblicazione: (2025)
di: He, Zefeng, et al.
Pubblicazione: (2025)
SimpleAR: Pushing the Frontier of Autoregressive Visual Generation through Pretraining, SFT, and RL
di: Wang, Junke, et al.
Pubblicazione: (2025)
di: Wang, Junke, et al.
Pubblicazione: (2025)
Motion-Aware Video Frame Interpolation
di: Han, Pengfei, et al.
Pubblicazione: (2024)
di: Han, Pengfei, et al.
Pubblicazione: (2024)
Frame Context Packing and Drift Prevention in Next-Frame-Prediction Video Diffusion Models
di: Zhang, Lvmin, et al.
Pubblicazione: (2025)
di: Zhang, Lvmin, et al.
Pubblicazione: (2025)
Frame-Level Captions for Long Video Generation with Complex Multi Scenes
di: Zheng, Guangcong, et al.
Pubblicazione: (2025)
di: Zheng, Guangcong, et al.
Pubblicazione: (2025)
Point2Insert: Video Object Insertion via Sparse Point Guidance
di: Zhou, Yu, et al.
Pubblicazione: (2026)
di: Zhou, Yu, et al.
Pubblicazione: (2026)
Thinking with Frames: Generative Video Distortion Evaluation via Frame Reward Model
di: Wang, Yuan, et al.
Pubblicazione: (2026)
di: Wang, Yuan, et al.
Pubblicazione: (2026)
Enhancing Train-Free Infinite-Frame Generation for Consistent Long Videos
di: Feng, X., et al.
Pubblicazione: (2026)
di: Feng, X., et al.
Pubblicazione: (2026)
Generative Frame Sampler for Long Video Understanding
di: Yao, Linli, et al.
Pubblicazione: (2025)
di: Yao, Linli, et al.
Pubblicazione: (2025)
DCDM: Divide-and-Conquer Diffusion Models for Consistency-Preserving Video Generation
di: Zhao, Haoyu, et al.
Pubblicazione: (2026)
di: Zhao, Haoyu, et al.
Pubblicazione: (2026)
Reinforced Rate Control for Neural Video Compression via Inter-Frame Rate-Distortion Awareness
di: Cong, Wuyang, et al.
Pubblicazione: (2026)
di: Cong, Wuyang, et al.
Pubblicazione: (2026)
Next Block Prediction: Video Generation via Semi-Autoregressive Modeling
di: Ren, Shuhuai, et al.
Pubblicazione: (2025)
di: Ren, Shuhuai, et al.
Pubblicazione: (2025)
EDEN: Enhanced Diffusion for High-quality Large-motion Video Frame Interpolation
di: Zhang, Zihao, et al.
Pubblicazione: (2025)
di: Zhang, Zihao, et al.
Pubblicazione: (2025)
Seeing What Matters: Visual Preference Policy Optimization for Visual Generation
di: Ni, Ziqi, et al.
Pubblicazione: (2025)
di: Ni, Ziqi, et al.
Pubblicazione: (2025)
Lumina-Video: Efficient and Flexible Video Generation with Multi-scale Next-DiT
di: Liu, Dongyang, et al.
Pubblicazione: (2025)
di: Liu, Dongyang, et al.
Pubblicazione: (2025)
FRAG: Frame Selection Augmented Generation for Long Video and Long Document Understanding
di: Huang, De-An, et al.
Pubblicazione: (2025)
di: Huang, De-An, et al.
Pubblicazione: (2025)
Fostering Video Reasoning via Next-Event Prediction
di: Wang, Haonan, et al.
Pubblicazione: (2025)
di: Wang, Haonan, et al.
Pubblicazione: (2025)
Everything is a Video: Unifying Modalities through Next-Frame Prediction
di: Hudson, G. Thomas, et al.
Pubblicazione: (2024)
di: Hudson, G. Thomas, et al.
Pubblicazione: (2024)
Conditional Video Generation for High-Efficiency Video Compression
di: Yi, Fangqiu, et al.
Pubblicazione: (2025)
di: Yi, Fangqiu, et al.
Pubblicazione: (2025)
Learning from Next-Frame Prediction: Autoregressive Video Modeling Encodes Effective Representations
di: Li, Jinghan, et al.
Pubblicazione: (2025)
di: Li, Jinghan, et al.
Pubblicazione: (2025)
HiAR: Efficient Autoregressive Long Video Generation via Hierarchical Denoising
di: Zou, Kai, et al.
Pubblicazione: (2026)
di: Zou, Kai, et al.
Pubblicazione: (2026)
Not All Frame Features Are Equal: Video-to-4D Generation via Decoupling Dynamic-Static Features
di: Yang, Liying, et al.
Pubblicazione: (2025)
di: Yang, Liying, et al.
Pubblicazione: (2025)
Generating Multimodal Driving Scenes via Next-Scene Prediction
di: Wu, Yanhao, et al.
Pubblicazione: (2025)
di: Wu, Yanhao, et al.
Pubblicazione: (2025)
TeleBoost: A Systematic Alignment Framework for High-Fidelity, Controllable, and Robust Video Generation
di: Liang, Yuanzhi, et al.
Pubblicazione: (2026)
di: Liang, Yuanzhi, et al.
Pubblicazione: (2026)
Documenti analoghi
-
VideoAR: Autoregressive Video Generation via Next-Frame & Scale Prediction
di: Ji, Longbin, et al.
Pubblicazione: (2026) -
VideoLoom: A Video Large Language Model for Joint Spatial-Temporal Understanding
di: Shi, Jiapeng, et al.
Pubblicazione: (2026) -
Macro-from-Micro Planning for High-Quality and Parallelized Autoregressive Long Video Generation
di: Xiang, Xunzhi, et al.
Pubblicazione: (2025) -
Tele-Omni: a Unified Multimodal Framework for Video Generation and Editing
di: Liu, Jialun, et al.
Pubblicazione: (2026) -
OmniTokenizer: A Joint Image-Video Tokenizer for Visual Generation
di: Wang, Junke, et al.
Pubblicazione: (2024)