Evaluation of Text-to-Video Generation Models: A Dynamics Perspective
Fuente:
arXiv
Salvato in:
| Autori principali: | Liao, Mingxiang, Lu, Hannan, Zhang, Xinyu, Wan, Fang, Wang, Tianyu, Zhao, Yuzhong, Zuo, Wangmeng, Ye, Qixiang, Wang, Jingdong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DynRefer: Delving into Region-level Multimodal Tasks via Dynamic Resolution
di: Zhao, Yuzhong, et al.
Pubblicazione: (2024)
di: Zhao, Yuzhong, et al.
Pubblicazione: (2024)
Thinking with Images via Self-Calling Agent
di: Yang, Wenxi, et al.
Pubblicazione: (2025)
di: Yang, Wenxi, et al.
Pubblicazione: (2025)
Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention
di: Lu, Hannan, et al.
Pubblicazione: (2024)
di: Lu, Hannan, et al.
Pubblicazione: (2024)
Timestep Embedding Tells: It's Time to Cache for Video Diffusion Model
di: Liu, Feng, et al.
Pubblicazione: (2024)
di: Liu, Feng, et al.
Pubblicazione: (2024)
AceTone: Bridging Words and Colors for Conditional Image Grading
di: Ma, Tianren, et al.
Pubblicazione: (2026)
di: Ma, Tianren, et al.
Pubblicazione: (2026)
PhysChoreo: Physics-Controllable Video Generation with Part-Aware Semantic Grounding
di: Zhang, Haoze, et al.
Pubblicazione: (2025)
di: Zhang, Haoze, et al.
Pubblicazione: (2025)
Lie Flow: Video Dynamic Fields Modeling and Predicting with Lie Algebra as Geometric Physics Principle
di: Qiao, Weidong, et al.
Pubblicazione: (2026)
di: Qiao, Weidong, et al.
Pubblicazione: (2026)
ControlCap: Controllable Region-level Captioning
di: Zhao, Yuzhong, et al.
Pubblicazione: (2024)
di: Zhao, Yuzhong, et al.
Pubblicazione: (2024)
FILP-3D: Enhancing 3D Few-shot Class-incremental Learning with Pre-trained Vision-Language Models
di: Xu, Wan, et al.
Pubblicazione: (2023)
di: Xu, Wan, et al.
Pubblicazione: (2023)
VideoElevator: Elevating Video Generation Quality with Versatile Text-to-Image Diffusion Models
di: Zhang, Yabo, et al.
Pubblicazione: (2024)
di: Zhang, Yabo, et al.
Pubblicazione: (2024)
Generative Inbetweening through Frame-wise Conditions-Driven Video Generation
di: Zhu, Tianyi, et al.
Pubblicazione: (2024)
di: Zhu, Tianyi, et al.
Pubblicazione: (2024)
CC-Diff: Enhancing Contextual Coherence in Remote Sensing Image Synthesis
di: Zhang, Mu, et al.
Pubblicazione: (2024)
di: Zhang, Mu, et al.
Pubblicazione: (2024)
Enhanced Generative Structure Prior for Chinese Text Image Super-resolution
di: Li, Xiaoming, et al.
Pubblicazione: (2025)
di: Li, Xiaoming, et al.
Pubblicazione: (2025)
Premier: Personalized Preference Modulation with Learnable User Embedding in Text-to-Image Generation
di: Wang, Zihao, et al.
Pubblicazione: (2026)
di: Wang, Zihao, et al.
Pubblicazione: (2026)
S2AM3D: Scale-controllable Part Segmentation of 3D Point Clouds
di: Su, Han, et al.
Pubblicazione: (2025)
di: Su, Han, et al.
Pubblicazione: (2025)
DreamControl: Control-Based Text-to-3D Generation with 3D Self-Prior
di: Huang, Tianyu, et al.
Pubblicazione: (2023)
di: Huang, Tianyu, et al.
Pubblicazione: (2023)
TextField3D: Towards Enhancing Open-Vocabulary 3D Generation with Noisy Text Fields
di: Huang, Tianyu, et al.
Pubblicazione: (2023)
di: Huang, Tianyu, et al.
Pubblicazione: (2023)
Bridging Geometry-Coherent Text-to-3D Generation with Multi-View Diffusion Priors and Gaussian Splatting
di: Yang, Feng, et al.
Pubblicazione: (2025)
di: Yang, Feng, et al.
Pubblicazione: (2025)
DreamPhysics: Learning Physics-Based 3D Dynamics with Video Diffusion Priors
di: Huang, Tianyu, et al.
Pubblicazione: (2024)
di: Huang, Tianyu, et al.
Pubblicazione: (2024)
ACE: Anti-Editing Concept Erasure in Text-to-Image Models
di: Wang, Zihao, et al.
Pubblicazione: (2025)
di: Wang, Zihao, et al.
Pubblicazione: (2025)
VMamba: Visual State Space Model
di: Liu, Yue, et al.
Pubblicazione: (2024)
di: Liu, Yue, et al.
Pubblicazione: (2024)
ScrollScape: Unlocking 32K Image Generation With Video Diffusion Priors
di: Yu, Haodong, et al.
Pubblicazione: (2026)
di: Yu, Haodong, et al.
Pubblicazione: (2026)
RoamScene3D: Immersive Text-to-3D Scene Generation via Adaptive Object-aware Roaming
di: Chu, Jisheng, et al.
Pubblicazione: (2026)
di: Chu, Jisheng, et al.
Pubblicazione: (2026)
LOVE: Benchmarking and Evaluating Text-to-Video Generation and Video-to-Text Interpretation
di: Wang, Jiarui, et al.
Pubblicazione: (2025)
di: Wang, Jiarui, et al.
Pubblicazione: (2025)
S2Gaussian: Sparse-View Super-Resolution 3D Gaussian Splatting
di: Wan, Yecong, et al.
Pubblicazione: (2025)
di: Wan, Yecong, et al.
Pubblicazione: (2025)
Color3D: Controllable and Consistent 3D Colorization with Personalized Colorizer
di: Wan, Yecong, et al.
Pubblicazione: (2025)
di: Wan, Yecong, et al.
Pubblicazione: (2025)
SplatWeaver: Learning to Allocate Gaussian Primitives for Generalizable Novel View Synthesis
di: Wan, Yecong, et al.
Pubblicazione: (2026)
di: Wan, Yecong, et al.
Pubblicazione: (2026)
Self-Supervised High Dynamic Range Imaging with Multi-Exposure Images in Dynamic Scenes
di: Zhang, Zhilu, et al.
Pubblicazione: (2023)
di: Zhang, Zhilu, et al.
Pubblicazione: (2023)
Text-Guided Video Masked Autoencoder
di: Fan, David, et al.
Pubblicazione: (2024)
di: Fan, David, et al.
Pubblicazione: (2024)
Unprejudiced Training Auxiliary Tasks Makes Primary Better: A Multi-Task Learning Perspective
di: Li, Yuanze, et al.
Pubblicazione: (2024)
di: Li, Yuanze, et al.
Pubblicazione: (2024)
MasterWeaver: Taming Editability and Face Identity for Personalized Text-to-Image Generation
di: Wei, Yuxiang, et al.
Pubblicazione: (2024)
di: Wei, Yuxiang, et al.
Pubblicazione: (2024)
Voyager: Long-Range and World-Consistent Video Diffusion for Explorable 3D Scene Generation
di: Huang, Tianyu, et al.
Pubblicazione: (2025)
di: Huang, Tianyu, et al.
Pubblicazione: (2025)
VideoAnchor: Reinforcing Subspace-Structured Visual Cues for Coherent Visual-Spatial Reasoning
di: Wang, Zhaozhi, et al.
Pubblicazione: (2025)
di: Wang, Zhaozhi, et al.
Pubblicazione: (2025)
SceneDreamer360: Text-Driven 3D-Consistent Scene Generation with Panoramic Gaussian Splatting
di: Li, Wenrui, et al.
Pubblicazione: (2024)
di: Li, Wenrui, et al.
Pubblicazione: (2024)
ArtHOI: Taming Foundation Models for Monocular 4D Reconstruction of Hand-Articulated-Object Interactions
di: Wang, Zikai, et al.
Pubblicazione: (2026)
di: Wang, Zikai, et al.
Pubblicazione: (2026)
Thinking with Frames: Generative Video Distortion Evaluation via Frame Reward Model
di: Wang, Yuan, et al.
Pubblicazione: (2026)
di: Wang, Yuan, et al.
Pubblicazione: (2026)
Evaluating Image Caption via Cycle-consistent Text-to-Image Generation
di: Cui, Tianyu, et al.
Pubblicazione: (2025)
di: Cui, Tianyu, et al.
Pubblicazione: (2025)
GLaVE-Cap: Global-Local Aligned Video Captioning with Vision Expert Integration
di: Xu, Wan, et al.
Pubblicazione: (2025)
di: Xu, Wan, et al.
Pubblicazione: (2025)
MoSA: Motion-Coherent Human Video Generation via Structure-Appearance Decoupling
di: Wang, Haoyu, et al.
Pubblicazione: (2025)
di: Wang, Haoyu, et al.
Pubblicazione: (2025)
T2AV-Compass: Towards Unified Evaluation for Text-to-Audio-Video Generation
di: Cao, Zhe, et al.
Pubblicazione: (2025)
di: Cao, Zhe, et al.
Pubblicazione: (2025)
Documenti analoghi
-
DynRefer: Delving into Region-level Multimodal Tasks via Dynamic Resolution
di: Zhao, Yuzhong, et al.
Pubblicazione: (2024) -
Thinking with Images via Self-Calling Agent
di: Yang, Wenxi, et al.
Pubblicazione: (2025) -
Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention
di: Lu, Hannan, et al.
Pubblicazione: (2024) -
Timestep Embedding Tells: It's Time to Cache for Video Diffusion Model
di: Liu, Feng, et al.
Pubblicazione: (2024) -
AceTone: Bridging Words and Colors for Conditional Image Grading
di: Ma, Tianren, et al.
Pubblicazione: (2026)