VideoGen-of-Thought: Step-by-step generating multi-shot video with minimal manual intervention
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zheng, Mingzhe, Xu, Yongqi, Huang, Haojian, Ma, Xuran, Liu, Yexin, Shu, Wenjie, Pang, Yatian, Tang, Feilong, Chen, Qifeng, Yang, Harry, Lim, Ser-Nam |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VideoGen-of-Thought: Step-by-step generating multi-shot video with minimal manual intervention
par: Zheng, Mingzhe, et autres
Publié: (2025)
par: Zheng, Mingzhe, et autres
Publié: (2025)
Model Reveals What to Cache: Profiling-Based Feature Reuse for Video Diffusion Models
par: Ma, Xuran, et autres
Publié: (2025)
par: Ma, Xuran, et autres
Publié: (2025)
Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation
par: Chen, Harold Haodong, et autres
Publié: (2025)
par: Chen, Harold Haodong, et autres
Publié: (2025)
Zero-shot Synthetic Video Realism Enhancement via Structure-aware Denoising
par: Wang, Yifan, et autres
Publié: (2025)
par: Wang, Yifan, et autres
Publié: (2025)
DreamDance: Animating Human Images by Enriching 3D Geometry Cues from 2D Poses
par: Pang, Yatian, et autres
Publié: (2024)
par: Pang, Yatian, et autres
Publié: (2024)
CML-Bench: A Framework for Evaluating and Enhancing LLM-Powered Movie Scripts Generation
par: Zheng, Mingzhe, et autres
Publié: (2025)
par: Zheng, Mingzhe, et autres
Publié: (2025)
LightGen: Efficient Image Generation through Knowledge Distillation and Direct Preference Optimization
par: Wu, Xianfeng, et autres
Publié: (2025)
par: Wu, Xianfeng, et autres
Publié: (2025)
Temporal Regularization Makes Your Video Generator Stronger
par: Chen, Harold Haodong, et autres
Publié: (2025)
par: Chen, Harold Haodong, et autres
Publié: (2025)
VideoMerge: Towards Training-free Long Video Generation
par: Zhang, Siyang, et autres
Publié: (2025)
par: Zhang, Siyang, et autres
Publié: (2025)
AC-Foley: Reference-Audio-Guided Video-to-Audio Synthesis with Acoustic Transfer
par: Fang, Pengjun, et autres
Publié: (2026)
par: Fang, Pengjun, et autres
Publié: (2026)
Beyond Generation: Unlocking Universal Editing via Self-Supervised Fine-Tuning
par: Chen, Harold Haodong, et autres
Publié: (2024)
par: Chen, Harold Haodong, et autres
Publié: (2024)
VideoGen-Eval: Agent-based System for Video Generation Evaluation
par: Yang, Yuhang, et autres
Publié: (2025)
par: Yang, Yuhang, et autres
Publié: (2025)
DC-VideoGen: Efficient Video Generation with Deep Compression Video Autoencoder
par: Chen, Junyu, et autres
Publié: (2025)
par: Chen, Junyu, et autres
Publié: (2025)
Sparse VideoGen: Accelerating Video Diffusion Transformers with Spatial-Temporal Sparsity
par: Xi, Haocheng, et autres
Publié: (2025)
par: Xi, Haocheng, et autres
Publié: (2025)
Towards Chunk-Wise Generation for Long Videos
par: Zhang, Siyang, et autres
Publié: (2024)
par: Zhang, Siyang, et autres
Publié: (2024)
Next Patch Prediction for Autoregressive Visual Generation
par: Pang, Yatian, et autres
Publié: (2024)
par: Pang, Yatian, et autres
Publié: (2024)
Spherical Linear Interpolation and Text-Anchoring for Zero-shot Composed Image Retrieval
par: Jang, Young Kyun, et autres
Publié: (2024)
par: Jang, Young Kyun, et autres
Publié: (2024)
AlignVid: Training-Free Attention Scaling for Semantic Fidelity in Text-Guided Image-to-Video Generation
par: Liu, Yexin, et autres
Publié: (2025)
par: Liu, Yexin, et autres
Publié: (2025)
Interleaved-Modal Chain-of-Thought
par: Gao, Jun, et autres
Publié: (2024)
par: Gao, Jun, et autres
Publié: (2024)
Sparse VideoGen2: Accelerate Video Generation with Sparse Attention via Semantic-Aware Permutation
par: Yang, Shuo, et autres
Publié: (2025)
par: Yang, Shuo, et autres
Publié: (2025)
Ultra-short-term multi-step wind speed prediction for wind farms based on adaptive noise reduction technology and temporal convolutional network
par: Huang, Haojian
Publié: (2023)
par: Huang, Haojian
Publié: (2023)
When Semantics Mislead Vision: Mitigating Large Multimodal Models Hallucinations in Scene Text Spotting and Understanding
par: Shu, Yan, et autres
Publié: (2025)
par: Shu, Yan, et autres
Publié: (2025)
TokenSkip: Controllable Chain-of-Thought Compression in LLMs
par: Xia, Heming, et autres
Publié: (2025)
par: Xia, Heming, et autres
Publié: (2025)
Quant VideoGen: Auto-Regressive Long Video Generation via 2-Bit KV-Cache Quantization
par: Xi, Haocheng, et autres
Publié: (2026)
par: Xi, Haocheng, et autres
Publié: (2026)
Video Decomposition Prior: A Methodology to Decompose Videos into Layers
par: Shrivastava, Gaurav, et autres
Publié: (2024)
par: Shrivastava, Gaurav, et autres
Publié: (2024)
Niagara: Normal-Integrated Geometric Affine Field for Scene Reconstruction from a Single View
par: Wu, Xianzu, et autres
Publié: (2025)
par: Wu, Xianzu, et autres
Publié: (2025)
Enhancing Diffusion-based Restoration Models via Difficulty-Adaptive Reinforcement Learning with IQA Reward
par: Xu, Xiaogang, et autres
Publié: (2025)
par: Xu, Xiaogang, et autres
Publié: (2025)
Mitigating Misleading Chain-of-Thought Reasoning with Selective Filtering
par: Wu, Yexin, et autres
Publié: (2024)
par: Wu, Yexin, et autres
Publié: (2024)
AirSketch: Generative Motion to Sketch
par: Lim, Hui Xian Grace, et autres
Publié: (2024)
par: Lim, Hui Xian Grace, et autres
Publié: (2024)
LASER: A Neuro-Symbolic Framework for Learning Spatial-Temporal Scene Graphs with Weak Supervision
par: Huang, Jiani, et autres
Publié: (2023)
par: Huang, Jiani, et autres
Publié: (2023)
DreamMask: Boosting Open-vocabulary Panoptic Segmentation with Synthetic Data
par: Tu, Yuanpeng, et autres
Publié: (2025)
par: Tu, Yuanpeng, et autres
Publié: (2025)
Towards Unified 3D Object Detection via Algorithm and Data Unification
par: Li, Zhuoling, et autres
Publié: (2024)
par: Li, Zhuoling, et autres
Publié: (2024)
Composing Object Relations and Attributes for Image-Text Matching
par: Pham, Khoi, et autres
Publié: (2024)
par: Pham, Khoi, et autres
Publié: (2024)
Fast Encoding and Decoding for Implicit Video Representation
par: Chen, Hao, et autres
Publié: (2024)
par: Chen, Hao, et autres
Publié: (2024)
Mitigating Dialogue Hallucination for Large Vision Language Models via Adversarial Instruction Tuning
par: Park, Dongmin, et autres
Publié: (2024)
par: Park, Dongmin, et autres
Publié: (2024)
Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop
par: Qian, Zhaofang, et autres
Publié: (2024)
par: Qian, Zhaofang, et autres
Publié: (2024)
Delta Activations: A Representation for Finetuned Large Language Models
par: Xu, Zhiqiu, et autres
Publié: (2025)
par: Xu, Zhiqiu, et autres
Publié: (2025)
Step‐by‐step demonstration of Hotokezaka strictureplasty for Crohn's disease: A video vignette
par: Clemente Junior Nappi, et autres
Publié: (2026)
par: Clemente Junior Nappi, et autres
Publié: (2026)
DiReCT: Disentangled Regularization of Contrastive Trajectories for Physics-Refined Video Generation
par: Meyarian, Abolfazl, et autres
Publié: (2026)
par: Meyarian, Abolfazl, et autres
Publié: (2026)
OP-LoRA: The Blessing of Dimensionality
par: Teterwak, Piotr, et autres
Publié: (2024)
par: Teterwak, Piotr, et autres
Publié: (2024)
Documents similaires
-
VideoGen-of-Thought: Step-by-step generating multi-shot video with minimal manual intervention
par: Zheng, Mingzhe, et autres
Publié: (2025) -
Model Reveals What to Cache: Profiling-Based Feature Reuse for Video Diffusion Models
par: Ma, Xuran, et autres
Publié: (2025) -
Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation
par: Chen, Harold Haodong, et autres
Publié: (2025) -
Zero-shot Synthetic Video Realism Enhancement via Structure-aware Denoising
par: Wang, Yifan, et autres
Publié: (2025) -
DreamDance: Animating Human Images by Enriching 3D Geometry Cues from 2D Poses
par: Pang, Yatian, et autres
Publié: (2024)