VideoAuteur: Towards Long Narrative Video Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xiao, Junfei, Cheng, Feng, Qi, Lu, Gui, Liangke, Cen, Jiepeng, Ma, Zhibei, Yuille, Alan, Jiang, Lu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Long Context Tuning for Video Generation
par: Guo, Yuwei, et autres
Publié: (2025)
par: Guo, Yuwei, et autres
Publié: (2025)
Mixture of Contexts for Long Video Generation
par: Cai, Shengqu, et autres
Publié: (2025)
par: Cai, Shengqu, et autres
Publié: (2025)
Auteur: Language-Driven Cinematographic Framing for Human-Centric Video Generation
par: Kizil, Muhammed Burak, et autres
Publié: (2026)
par: Kizil, Muhammed Burak, et autres
Publié: (2026)
Captain Cinema: Towards Short Movie Generation
par: Xiao, Junfei, et autres
Publié: (2025)
par: Xiao, Junfei, et autres
Publié: (2025)
CameraCtrl II: Dynamic Scene Exploration via Camera-controlled Video Diffusion Models
par: He, Hao, et autres
Publié: (2025)
par: He, Hao, et autres
Publié: (2025)
ViMix-14M: A Curated Multi-Source Video-Text Dataset with Long-Form, High-Quality Captions and Crawl-Free Access
par: Yang, Timing, et autres
Publié: (2025)
par: Yang, Timing, et autres
Publié: (2025)
Play to Generalize: Learning to Reason Through Game Play
par: Xie, Yunfei, et autres
Publié: (2025)
par: Xie, Yunfei, et autres
Publié: (2025)
HECTOR: Hybrid Editable Compositional Object References for Video Generation
par: Zhang, Guofeng, et autres
Publié: (2026)
par: Zhang, Guofeng, et autres
Publié: (2026)
Autoregressive Video Generation beyond Next Frames Prediction
par: Ren, Sucheng, et autres
Publié: (2025)
par: Ren, Sucheng, et autres
Publié: (2025)
PaLM2-VAdapter: Progressively Aligned Language Model Makes a Strong Vision-language Adapter
par: Xiao, Junfei, et autres
Publié: (2024)
par: Xiao, Junfei, et autres
Publié: (2024)
NarrLV: Towards a Comprehensive Narrative-Centric Evaluation for Long Video Generation
par: Feng, X., et autres
Publié: (2025)
par: Feng, X., et autres
Publié: (2025)
Thinking with Spatial Code for Physical-World Video Reasoning
par: Chen, Jieneng, et autres
Publié: (2026)
par: Chen, Jieneng, et autres
Publié: (2026)
Rejuvenating image-GPT as Strong Visual Representation Learners
par: Ren, Sucheng, et autres
Publié: (2023)
par: Ren, Sucheng, et autres
Publié: (2023)
HoloCine: Holistic Generation of Cinematic Multi-Shot Long Video Narratives
par: Meng, Yihao, et autres
Publié: (2025)
par: Meng, Yihao, et autres
Publié: (2025)
GenEx: Generating an Explorable World
par: Lu, Taiming, et autres
Publié: (2024)
par: Lu, Taiming, et autres
Publié: (2024)
EvoWorld: Evolving Panoramic World Generation with Explicit 3D Memory
par: Wang, Jiahao, et autres
Publié: (2025)
par: Wang, Jiahao, et autres
Publié: (2025)
Rethinking Video-Text Understanding: Retrieval from Counterfactually Augmented Data
par: Ma, Wufei, et autres
Publié: (2024)
par: Ma, Wufei, et autres
Publié: (2024)
TGT: Text-Grounded Trajectories for Locally Controlled Video Generation
par: Zhang, Guofeng, et autres
Publié: (2025)
par: Zhang, Guofeng, et autres
Publié: (2025)
A Survey on Long Video Generation: Challenges, Methods, and Prospects
par: Li, Chengxuan, et autres
Publié: (2024)
par: Li, Chengxuan, et autres
Publié: (2024)
VideoMerge: Towards Training-free Long Video Generation
par: Zhang, Siyang, et autres
Publié: (2025)
par: Zhang, Siyang, et autres
Publié: (2025)
Advancing Narrative Long Video Generation via Training-Free Identity-Aware Memory
par: Liu, Jinzhuo, et autres
Publié: (2026)
par: Liu, Jinzhuo, et autres
Publié: (2026)
Is Your Text-to-Image Model Robust to Caption Noise?
par: Yu, Weichen, et autres
Publié: (2024)
par: Yu, Weichen, et autres
Publié: (2024)
Towards Temporal Compositional Reasoning in Long-Form Sports Videos
par: Cao, Siyu, et autres
Publié: (2026)
par: Cao, Siyu, et autres
Publié: (2026)
VTok: A Unified Video Tokenizer with Decoupled Spatial-Temporal Latents
par: Wang, Feng, et autres
Publié: (2026)
par: Wang, Feng, et autres
Publié: (2026)
FreeLong++: Training-Free Long Video Generation via Multi-band SpectralFusion
par: Lu, Yu, et autres
Publié: (2025)
par: Lu, Yu, et autres
Publié: (2025)
Generative Neural Video Compression via Video Diffusion Prior
par: Mao, Qi, et autres
Publié: (2025)
par: Mao, Qi, et autres
Publié: (2025)
Multi-sentence Video Grounding for Long Video Generation
par: Feng, Wei, et autres
Publié: (2024)
par: Feng, Wei, et autres
Publié: (2024)
VideoSSM: Autoregressive Long Video Generation with Hybrid State-Space Memory
par: Yu, Yifei, et autres
Publié: (2025)
par: Yu, Yifei, et autres
Publié: (2025)
LongLive: Real-time Interactive Long Video Generation
par: Yang, Shuai, et autres
Publié: (2025)
par: Yang, Shuai, et autres
Publié: (2025)
Towards Chunk-Wise Generation for Long Videos
par: Zhang, Siyang, et autres
Publié: (2024)
par: Zhang, Siyang, et autres
Publié: (2024)
SeedVR: Seeding Infinity in Diffusion Transformer Towards Generic Video Restoration
par: Wang, Jianyi, et autres
Publié: (2025)
par: Wang, Jianyi, et autres
Publié: (2025)
Captain Safari: A World Engine with Pose-Aligned 3D Memory
par: Chou, Yu-Cheng, et autres
Publié: (2025)
par: Chou, Yu-Cheng, et autres
Publié: (2025)
ARVideo: Autoregressive Pretraining for Self-Supervised Video Representation Learning
par: Ren, Sucheng, et autres
Publié: (2024)
par: Ren, Sucheng, et autres
Publié: (2024)
Narrative Aligned Long Form Video Question Answering
par: Jain, Rahul, et autres
Publié: (2026)
par: Jain, Rahul, et autres
Publié: (2026)
ReVision: Refining Video Diffusion with Explicit 3D Motion Modeling
par: Liu, Qihao, et autres
Publié: (2025)
par: Liu, Qihao, et autres
Publié: (2025)
Towards Long Video Understanding via Fine-detailed Video Story Generation
par: You, Zeng, et autres
Publié: (2024)
par: You, Zeng, et autres
Publié: (2024)
Seaweed-7B: Cost-Effective Training of Video Generation Foundation Model
par: Seawead, Team, et autres
Publié: (2025)
par: Seawead, Team, et autres
Publié: (2025)
FreeLong: Training-Free Long Video Generation with SpectralBlend Temporal Attention
par: Lu, Yu, et autres
Publié: (2024)
par: Lu, Yu, et autres
Publié: (2024)
Vision-Language-Vision Auto-Encoder: Scalable Knowledge Distillation from Diffusion Models
par: Zhang, Tiezheng, et autres
Publié: (2025)
par: Zhang, Tiezheng, et autres
Publié: (2025)
Generative World Explorer
par: Lu, Taiming, et autres
Publié: (2024)
par: Lu, Taiming, et autres
Publié: (2024)
Documents similaires
-
Long Context Tuning for Video Generation
par: Guo, Yuwei, et autres
Publié: (2025) -
Mixture of Contexts for Long Video Generation
par: Cai, Shengqu, et autres
Publié: (2025) -
Auteur: Language-Driven Cinematographic Framing for Human-Centric Video Generation
par: Kizil, Muhammed Burak, et autres
Publié: (2026) -
Captain Cinema: Towards Short Movie Generation
par: Xiao, Junfei, et autres
Publié: (2025) -
CameraCtrl II: Dynamic Scene Exploration via Camera-controlled Video Diffusion Models
par: He, Hao, et autres
Publié: (2025)