Frame-Level Captions for Long Video Generation with Complex Multi Scenes
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zheng, Guangcong, Yuan, Jianlong, Wang, Bo, Huang, Haoyang, Ma, Guoqing, Duan, Nan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
STORYANCHORS: Generating Consistent Multi-Scene Story Frames for Long-Form Narratives
par: Wang, Bo, et autres
Publié: (2025)
par: Wang, Bo, et autres
Publié: (2025)
Generative Pre-trained Autoregressive Diffusion Transformer
par: Zhang, Yuan, et autres
Publié: (2025)
par: Zhang, Yuan, et autres
Publié: (2025)
Text-based Talking Video Editing with Cascaded Conditional Diffusion
par: Han, Bo, et autres
Publié: (2024)
par: Han, Bo, et autres
Publié: (2024)
RealCam-Vid: High-resolution Video Dataset with Dynamic Scenes and Metric-scale Camera Movements
par: Zheng, Guangcong, et autres
Publié: (2025)
par: Zheng, Guangcong, et autres
Publié: (2025)
Mask$^2$DiT: Dual Mask-based Diffusion Transformer for Multi-Scene Long Video Generation
par: Qi, Tianhao, et autres
Publié: (2025)
par: Qi, Tianhao, et autres
Publié: (2025)
Progress-Aware Video Frame Captioning
par: Xue, Zihui, et autres
Publié: (2024)
par: Xue, Zihui, et autres
Publié: (2024)
Narrating the Video: Boosting Text-Video Retrieval via Comprehensive Utilization of Frame-Level Captions
par: Hur, Chan, et autres
Publié: (2025)
par: Hur, Chan, et autres
Publié: (2025)
Fine-Grained Captioning of Long Videos through Scene Graph Consolidation
par: Chu, Sanghyeok, et autres
Publié: (2025)
par: Chu, Sanghyeok, et autres
Publié: (2025)
LongCaptioning: Unlocking the Power of Long Video Caption Generation in Large Multimodal Models
par: Wei, Hongchen, et autres
Publié: (2025)
par: Wei, Hongchen, et autres
Publié: (2025)
TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions
par: Yao, Linli, et autres
Publié: (2026)
par: Yao, Linli, et autres
Publié: (2026)
Teacher-Feature Drifting: One-Step Diffusion Distillation with Pretrained Diffusion Representations
par: Zhang, Yuan, et autres
Publié: (2026)
par: Zhang, Yuan, et autres
Publié: (2026)
Scene Graph-guided SegCaptioning Transformer with Fine-grained Alignment for Controllable Video Segmentation and Captioning
par: Zhang, Xu, et autres
Publié: (2026)
par: Zhang, Xu, et autres
Publié: (2026)
FrameThinker: Learning to Think with Long Videos via Multi-Turn Frame Spotlighting
par: He, Zefeng, et autres
Publié: (2025)
par: He, Zefeng, et autres
Publié: (2025)
Enhancing Long Video Question Answering with Scene-Localized Frame Grouping
par: Yang, Xuyi, et autres
Publié: (2025)
par: Yang, Xuyi, et autres
Publié: (2025)
TempoMaster: Efficient Long Video Generation via Next-Frame-Rate Prediction
par: Ma, Yukuo, et autres
Publié: (2025)
par: Ma, Yukuo, et autres
Publié: (2025)
Thinking with Frames: Generative Video Distortion Evaluation via Frame Reward Model
par: Wang, Yuan, et autres
Publié: (2026)
par: Wang, Yuan, et autres
Publié: (2026)
GaussVideoDreamer: 3D Scene Generation with Video Diffusion and Inconsistency-Aware Gaussian Splatting
par: Hao, Junlin, et autres
Publié: (2025)
par: Hao, Junlin, et autres
Publié: (2025)
Frequency-guided Multi-level Reasoning for Scene Graph Generation in Video
par: Li, Chenxing, et autres
Publié: (2026)
par: Li, Chenxing, et autres
Publié: (2026)
VideoScene: Distilling Video Diffusion Model to Generate 3D Scenes in One Step
par: Wang, Hanyang, et autres
Publié: (2025)
par: Wang, Hanyang, et autres
Publié: (2025)
ShareGPT4Video: Improving Video Understanding and Generation with Better Captions
par: Chen, Lin, et autres
Publié: (2024)
par: Chen, Lin, et autres
Publié: (2024)
Scene Summarization: Clustering Scene Videos into Spatially Diverse Frames
par: Chen, Chao, et autres
Publié: (2023)
par: Chen, Chao, et autres
Publié: (2023)
VC4VG: Optimizing Video Captions for Text-to-Video Generation
par: Du, Yang, et autres
Publié: (2025)
par: Du, Yang, et autres
Publié: (2025)
TALC: Time-Aligned Captions for Multi-Scene Text-to-Video Generation
par: Bansal, Hritik, et autres
Publié: (2024)
par: Bansal, Hritik, et autres
Publié: (2024)
Enhancing Train-Free Infinite-Frame Generation for Consistent Long Videos
par: Feng, X., et autres
Publié: (2026)
par: Feng, X., et autres
Publié: (2026)
UltraVideo: High-Quality UHD Video Dataset with Comprehensive Captions
par: Xue, Zhucun, et autres
Publié: (2025)
par: Xue, Zhucun, et autres
Publié: (2025)
Addressing the ID-Matching Challenge in Long Video Captioning
par: Yang, Zhantao, et autres
Publié: (2025)
par: Yang, Zhantao, et autres
Publié: (2025)
Generative Frame Sampler for Long Video Understanding
par: Yao, Linli, et autres
Publié: (2025)
par: Yao, Linli, et autres
Publié: (2025)
LFS: Learnable Frame Selector for Event-Aware and Temporally Diverse Video Captioning
par: Chao, Lianying, et autres
Publié: (2026)
par: Chao, Lianying, et autres
Publié: (2026)
SnapCap: Efficient Snapshot Compressive Video Captioning
par: Sun, Jianqiao, et autres
Publié: (2024)
par: Sun, Jianqiao, et autres
Publié: (2024)
Video ReCap: Recursive Captioning of Hour-Long Videos
par: Islam, Md Mohaiminul, et autres
Publié: (2024)
par: Islam, Md Mohaiminul, et autres
Publié: (2024)
SOVC: Subject-Oriented Video Captioning
par: Teng, Chang, et autres
Publié: (2023)
par: Teng, Chang, et autres
Publié: (2023)
Compact Attention: Exploiting Structured Spatio-Temporal Sparsity for Fast Video Generation
par: Li, Qirui, et autres
Publié: (2025)
par: Li, Qirui, et autres
Publié: (2025)
VideoMaker: Zero-shot Customized Video Generation with the Inherent Force of Video Diffusion Models
par: Wu, Tao, et autres
Publié: (2024)
par: Wu, Tao, et autres
Publié: (2024)
Grounded Video Caption Generation
par: Kazakos, Evangelos, et autres
Publié: (2024)
par: Kazakos, Evangelos, et autres
Publié: (2024)
Long-Context Autoregressive Video Modeling with Next-Frame Prediction
par: Gu, Yuchao, et autres
Publié: (2025)
par: Gu, Yuchao, et autres
Publié: (2025)
CustomCrafter: Customized Video Generation with Preserving Motion and Concept Composition Abilities
par: Wu, Tao, et autres
Publié: (2024)
par: Wu, Tao, et autres
Publié: (2024)
Event-Anchored Frame Selection for Effective Long-Video Understanding
par: Chen, Wang, et autres
Publié: (2026)
par: Chen, Wang, et autres
Publié: (2026)
The Devil is in the Distributions: Explicit Modeling of Scene Content is Key in Zero-Shot Video Captioning
par: Tian, Mingkai, et autres
Publié: (2025)
par: Tian, Mingkai, et autres
Publié: (2025)
Towards Effective Long-Video Event Prediction via Multi-Level Event Semantics Mining
par: Peng, Bo, et autres
Publié: (2026)
par: Peng, Bo, et autres
Publié: (2026)
Voyager: Long-Range and World-Consistent Video Diffusion for Explorable 3D Scene Generation
par: Huang, Tianyu, et autres
Publié: (2025)
par: Huang, Tianyu, et autres
Publié: (2025)
Documents similaires
-
STORYANCHORS: Generating Consistent Multi-Scene Story Frames for Long-Form Narratives
par: Wang, Bo, et autres
Publié: (2025) -
Generative Pre-trained Autoregressive Diffusion Transformer
par: Zhang, Yuan, et autres
Publié: (2025) -
Text-based Talking Video Editing with Cascaded Conditional Diffusion
par: Han, Bo, et autres
Publié: (2024) -
RealCam-Vid: High-resolution Video Dataset with Dynamic Scenes and Metric-scale Camera Movements
par: Zheng, Guangcong, et autres
Publié: (2025) -
Mask$^2$DiT: Dual Mask-based Diffusion Transformer for Multi-Scene Long Video Generation
par: Qi, Tianhao, et autres
Publié: (2025)