Temporal Regularization Makes Your Video Generator Stronger
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Harold Haodong, Huang, Haojian, Wu, Xianfeng, Liu, Yexin, Bai, Yajing, Shu, Wen-Jie, Yang, Harry, Lim, Ser-Nam |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation
di: Chen, Harold Haodong, et al.
Pubblicazione: (2025)
di: Chen, Harold Haodong, et al.
Pubblicazione: (2025)
LightGen: Efficient Image Generation through Knowledge Distillation and Direct Preference Optimization
di: Wu, Xianfeng, et al.
Pubblicazione: (2025)
di: Wu, Xianfeng, et al.
Pubblicazione: (2025)
Beyond Generation: Unlocking Universal Editing via Self-Supervised Fine-Tuning
di: Chen, Harold Haodong, et al.
Pubblicazione: (2024)
di: Chen, Harold Haodong, et al.
Pubblicazione: (2024)
Go with Your Gut: Scaling Confidence for Autoregressive Image Generation
di: Chen, Harold Haodong, et al.
Pubblicazione: (2025)
di: Chen, Harold Haodong, et al.
Pubblicazione: (2025)
VideoMerge: Towards Training-free Long Video Generation
di: Zhang, Siyang, et al.
Pubblicazione: (2025)
di: Zhang, Siyang, et al.
Pubblicazione: (2025)
Model Reveals What to Cache: Profiling-Based Feature Reuse for Video Diffusion Models
di: Ma, Xuran, et al.
Pubblicazione: (2025)
di: Ma, Xuran, et al.
Pubblicazione: (2025)
AlignVid: Training-Free Attention Scaling for Semantic Fidelity in Text-Guided Image-to-Video Generation
di: Liu, Yexin, et al.
Pubblicazione: (2025)
di: Liu, Yexin, et al.
Pubblicazione: (2025)
VideoGen-of-Thought: Step-by-step generating multi-shot video with minimal manual intervention
di: Zheng, Mingzhe, et al.
Pubblicazione: (2025)
di: Zheng, Mingzhe, et al.
Pubblicazione: (2025)
VideoGen-of-Thought: Step-by-step generating multi-shot video with minimal manual intervention
di: Zheng, Mingzhe, et al.
Pubblicazione: (2024)
di: Zheng, Mingzhe, et al.
Pubblicazione: (2024)
LoopViT: Scaling Visual ARC with Looped Transformers
di: Shu, Wen-Jie, et al.
Pubblicazione: (2026)
di: Shu, Wen-Jie, et al.
Pubblicazione: (2026)
Towards Chunk-Wise Generation for Long Videos
di: Zhang, Siyang, et al.
Pubblicazione: (2024)
di: Zhang, Siyang, et al.
Pubblicazione: (2024)
Learning Latent Proxies for Controllable Single-Image Relighting
di: Zheng, Haoze, et al.
Pubblicazione: (2026)
di: Zheng, Haoze, et al.
Pubblicazione: (2026)
DiReCT: Disentangled Regularization of Contrastive Trajectories for Physics-Refined Video Generation
di: Meyarian, Abolfazl, et al.
Pubblicazione: (2026)
di: Meyarian, Abolfazl, et al.
Pubblicazione: (2026)
Video Decomposition Prior: A Methodology to Decompose Videos into Layers
di: Shrivastava, Gaurav, et al.
Pubblicazione: (2024)
di: Shrivastava, Gaurav, et al.
Pubblicazione: (2024)
Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop
di: Qian, Zhaofang, et al.
Pubblicazione: (2024)
di: Qian, Zhaofang, et al.
Pubblicazione: (2024)
When Semantics Mislead Vision: Mitigating Large Multimodal Models Hallucinations in Scene Text Spotting and Understanding
di: Shu, Yan, et al.
Pubblicazione: (2025)
di: Shu, Yan, et al.
Pubblicazione: (2025)
Zero-shot Synthetic Video Realism Enhancement via Structure-aware Denoising
di: Wang, Yifan, et al.
Pubblicazione: (2025)
di: Wang, Yifan, et al.
Pubblicazione: (2025)
VistaDPO: Video Hierarchical Spatial-Temporal Direct Preference Optimization for Large Video Models
di: Huang, Haojian, et al.
Pubblicazione: (2025)
di: Huang, Haojian, et al.
Pubblicazione: (2025)
LASER: A Neuro-Symbolic Framework for Learning Spatial-Temporal Scene Graphs with Weak Supervision
di: Huang, Jiani, et al.
Pubblicazione: (2023)
di: Huang, Jiani, et al.
Pubblicazione: (2023)
Fast Encoding and Decoding for Implicit Video Representation
di: Chen, Hao, et al.
Pubblicazione: (2024)
di: Chen, Hao, et al.
Pubblicazione: (2024)
AC-Foley: Reference-Audio-Guided Video-to-Audio Synthesis with Acoustic Transfer
di: Fang, Pengjun, et al.
Pubblicazione: (2026)
di: Fang, Pengjun, et al.
Pubblicazione: (2026)
FineQuest: Adaptive Knowledge-Assisted Sports Video Understanding via Agent-of-Thoughts Reasoning
di: Chen, Haodong, et al.
Pubblicazione: (2025)
di: Chen, Haodong, et al.
Pubblicazione: (2025)
Niagara: Normal-Integrated Geometric Affine Field for Scene Reconstruction from a Single View
di: Wu, Xianzu, et al.
Pubblicazione: (2025)
di: Wu, Xianzu, et al.
Pubblicazione: (2025)
Scaling Up Temporal Domain Generalization via Temporal Experts Averaging
di: Liu, Aoming, et al.
Pubblicazione: (2025)
di: Liu, Aoming, et al.
Pubblicazione: (2025)
AirSketch: Generative Motion to Sketch
di: Lim, Hui Xian Grace, et al.
Pubblicazione: (2024)
di: Lim, Hui Xian Grace, et al.
Pubblicazione: (2024)
Decoupled Seg Tokens Make Stronger Reasoning Video Segmenter and Grounder
di: Jisheng, Dang, et al.
Pubblicazione: (2025)
di: Jisheng, Dang, et al.
Pubblicazione: (2025)
FSViewFusion: Few-Shots View Generation of Novel Objects
di: Hussain, Rukhshanda, et al.
Pubblicazione: (2024)
di: Hussain, Rukhshanda, et al.
Pubblicazione: (2024)
FSC: Few-point Shape Completion
di: Wu, Xianzu, et al.
Pubblicazione: (2024)
di: Wu, Xianzu, et al.
Pubblicazione: (2024)
TalkVid: A Large-Scale Diversified Dataset for Audio-Driven Talking Head Synthesis
di: Chen, Shunian, et al.
Pubblicazione: (2025)
di: Chen, Shunian, et al.
Pubblicazione: (2025)
Beyond Uncertainty: Evidential Deep Learning for Robust Video Temporal Grounding
di: Ma, Kaijing, et al.
Pubblicazione: (2024)
di: Ma, Kaijing, et al.
Pubblicazione: (2024)
Enhancing Diffusion-based Restoration Models via Difficulty-Adaptive Reinforcement Learning with IQA Reward
di: Xu, Xiaogang, et al.
Pubblicazione: (2025)
di: Xu, Xiaogang, et al.
Pubblicazione: (2025)
GaussianVTON: 3D Human Virtual Try-ON via Multi-Stage Gaussian Splatting Editing with Image Prompting
di: Chen, Haodong, et al.
Pubblicazione: (2024)
di: Chen, Haodong, et al.
Pubblicazione: (2024)
Weak Distribution Detectors Lead to Stronger Generalizability of Vision-Language Prompt Tuning
di: Ding, Kun, et al.
Pubblicazione: (2024)
di: Ding, Kun, et al.
Pubblicazione: (2024)
DreamMask: Boosting Open-vocabulary Panoptic Segmentation with Synthetic Data
di: Tu, Yuanpeng, et al.
Pubblicazione: (2025)
di: Tu, Yuanpeng, et al.
Pubblicazione: (2025)
Towards Unified 3D Object Detection via Algorithm and Data Unification
di: Li, Zhuoling, et al.
Pubblicazione: (2024)
di: Li, Zhuoling, et al.
Pubblicazione: (2024)
Composing Object Relations and Attributes for Image-Text Matching
di: Pham, Khoi, et al.
Pubblicazione: (2024)
di: Pham, Khoi, et al.
Pubblicazione: (2024)
Mitigating Dialogue Hallucination for Large Vision Language Models via Adversarial Instruction Tuning
di: Park, Dongmin, et al.
Pubblicazione: (2024)
di: Park, Dongmin, et al.
Pubblicazione: (2024)
GeoVideo: Introducing Geometric Regularization into Video Generation Model
di: Bai, Yunpeng, et al.
Pubblicazione: (2025)
di: Bai, Yunpeng, et al.
Pubblicazione: (2025)
Unveiling the Ignorance of MLLMs: Seeing Clearly, Answering Incorrectly
di: Liu, Yexin, et al.
Pubblicazione: (2024)
di: Liu, Yexin, et al.
Pubblicazione: (2024)
Structure-Aware Prototype Guided Trusted Multi-View Classification
di: Huang, Haojian, et al.
Pubblicazione: (2025)
di: Huang, Haojian, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation
di: Chen, Harold Haodong, et al.
Pubblicazione: (2025) -
LightGen: Efficient Image Generation through Knowledge Distillation and Direct Preference Optimization
di: Wu, Xianfeng, et al.
Pubblicazione: (2025) -
Beyond Generation: Unlocking Universal Editing via Self-Supervised Fine-Tuning
di: Chen, Harold Haodong, et al.
Pubblicazione: (2024) -
Go with Your Gut: Scaling Confidence for Autoregressive Image Generation
di: Chen, Harold Haodong, et al.
Pubblicazione: (2025) -
VideoMerge: Towards Training-free Long Video Generation
di: Zhang, Siyang, et al.
Pubblicazione: (2025)