VideoGen-Eval: Agent-based System for Video Generation Evaluation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yang, Yuhang, Fan, Ke, Sun, Shangkun, Li, Hongxiang, Zeng, Ailing, Han, FeiLin, Zhai, Wei, Liu, Wei, Cao, Yang, Zha, Zheng-Jun |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Sparse VideoGen: Accelerating Video Diffusion Transformers with Spatial-Temporal Sparsity
par: Xi, Haocheng, et autres
Publié: (2025)
par: Xi, Haocheng, et autres
Publié: (2025)
HERO: Human Reaction Generation from Videos
par: Yu, Chengjun, et autres
Publié: (2025)
par: Yu, Chengjun, et autres
Publié: (2025)
DC-VideoGen: Efficient Video Generation with Deep Compression Video Autoencoder
par: Chen, Junyu, et autres
Publié: (2025)
par: Chen, Junyu, et autres
Publié: (2025)
Sparse VideoGen2: Accelerate Video Generation with Sparse Attention via Semantic-Aware Permutation
par: Yang, Shuo, et autres
Publié: (2025)
par: Yang, Shuo, et autres
Publié: (2025)
Quant VideoGen: Auto-Regressive Long Video Generation via 2-Bit KV-Cache Quantization
par: Xi, Haocheng, et autres
Publié: (2026)
par: Xi, Haocheng, et autres
Publié: (2026)
The Dawn of Video Generation: Preliminary Explorations with SORA-like Models
par: Zeng, Ailing, et autres
Publié: (2024)
par: Zeng, Ailing, et autres
Publié: (2024)
Gloria: Consistent Character Video Generation via Content Anchors
par: Yang, Yuhang, et autres
Publié: (2026)
par: Yang, Yuhang, et autres
Publié: (2026)
VideoGen-of-Thought: Step-by-step generating multi-shot video with minimal manual intervention
par: Zheng, Mingzhe, et autres
Publié: (2025)
par: Zheng, Mingzhe, et autres
Publié: (2025)
VideoGen-of-Thought: Step-by-step generating multi-shot video with minimal manual intervention
par: Zheng, Mingzhe, et autres
Publié: (2024)
par: Zheng, Mingzhe, et autres
Publié: (2024)
TOUCH: Text-guided Controllable Generation of Free-Form Hand-Object Interactions
par: Han, Guangyi, et autres
Publié: (2025)
par: Han, Guangyi, et autres
Publié: (2025)
Improved Video VAE for Latent Video Diffusion Model
par: Wu, Pingyu, et autres
Publié: (2024)
par: Wu, Pingyu, et autres
Publié: (2024)
LEMON: Learning 3D Human-Object Interaction Relation from 2D Images
par: Yang, Yuhang, et autres
Publié: (2023)
par: Yang, Yuhang, et autres
Publié: (2023)
End-to-End Spatial-Temporal Transformer for Real-time 4D HOI Reconstruction
par: Zhang, Haoyu, et autres
Publié: (2026)
par: Zhang, Haoyu, et autres
Publié: (2026)
ViewPoint: Panoramic Video Generation with Pretrained Diffusion Models
par: Fang, Zixun, et autres
Publié: (2025)
par: Fang, Zixun, et autres
Publié: (2025)
GREAT: Geometry-Intention Collaborative Inference for Open-Vocabulary 3D Object Affordance Grounding
par: Shao, Yawen, et autres
Publié: (2024)
par: Shao, Yawen, et autres
Publié: (2024)
EgoChoir: Capturing 3D Human-Object Interaction Regions from Egocentric Views
par: Yang, Yuhang, et autres
Publié: (2024)
par: Yang, Yuhang, et autres
Publié: (2024)
Exploring AIGC Video Quality: A Focus on Visual Harmony, Video-Text Consistency and Domain Distribution Gap
par: Qu, Bowen, et autres
Publié: (2024)
par: Qu, Bowen, et autres
Publié: (2024)
GRACE: Estimating Geometry-level 3D Human-Scene Contact from 2D Images
par: Wang, Chengfeng, et autres
Publié: (2025)
par: Wang, Chengfeng, et autres
Publié: (2025)
RAIN: Real-time Animation of Infinite Video Stream
par: Shu, Zhilei, et autres
Publié: (2024)
par: Shu, Zhilei, et autres
Publié: (2024)
Flow4Agent: Long-form Video Understanding via Motion Prior from Optical Flow
par: Liu, Ruyang, et autres
Publié: (2025)
par: Liu, Ruyang, et autres
Publié: (2025)
VE-Bench: Subjective-Aligned Benchmark Suite for Text-Driven Video Editing Quality Assessment
par: Sun, Shangkun, et autres
Publié: (2024)
par: Sun, Shangkun, et autres
Publié: (2024)
Grounding 3D Scene Affordance From Egocentric Interactions
par: Liu, Cuiyu, et autres
Publié: (2024)
par: Liu, Cuiyu, et autres
Publié: (2024)
VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization
par: Fang, Zixun, et autres
Publié: (2025)
par: Fang, Zixun, et autres
Publié: (2025)
MATE: Motion-Augmented Temporal Consistency for Event-based Point Tracking
par: Han, Han, et autres
Publié: (2024)
par: Han, Han, et autres
Publié: (2024)
Content-Rich AIGC Video Quality Assessment via Intricate Text Alignment and Motion-Aware Consistency
par: Sun, Shangkun, et autres
Publié: (2025)
par: Sun, Shangkun, et autres
Publié: (2025)
UniFinEval: Towards Unified Evaluation of Financial Multimodal Models across Text, Images and Videos
par: Yang, Zhi, et autres
Publié: (2026)
par: Yang, Zhi, et autres
Publié: (2026)
Intention-driven Ego-to-Exo Video Generation
par: Luo, Hongchen, et autres
Publié: (2024)
par: Luo, Hongchen, et autres
Publié: (2024)
ViViD: Video Virtual Try-on using Diffusion Models
par: Fang, Zixun, et autres
Publié: (2024)
par: Fang, Zixun, et autres
Publié: (2024)
Event Stream Filtering via Probability Flux Estimation
par: Chen, Jinze, et autres
Publié: (2025)
par: Chen, Jinze, et autres
Publié: (2025)
Visual-Geometric Collaborative Guidance for Affordance Learning
par: Luo, Hongchen, et autres
Publié: (2024)
par: Luo, Hongchen, et autres
Publié: (2024)
Leverage Task Context for Object Affordance Ranking
par: Huang, Haojie, et autres
Publié: (2024)
par: Huang, Haojie, et autres
Publié: (2024)
EvalCrafter: Benchmarking and Evaluating Large Video Generation Models
par: Liu, Yaofang, et autres
Publié: (2023)
par: Liu, Yaofang, et autres
Publié: (2023)
Unbiased Gradient Estimation for Event Binning via Functional Backpropagation
par: Chen, Jinze, et autres
Publié: (2026)
par: Chen, Jinze, et autres
Publié: (2026)
PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance
par: Sun, Shangkun, et autres
Publié: (2024)
par: Sun, Shangkun, et autres
Publié: (2024)
EMoTive: Event-guided Trajectory Modeling for 3D Motion Estimation
par: Wan, Zengyu, et autres
Publié: (2025)
par: Wan, Zengyu, et autres
Publié: (2025)
MVU-Eval: Towards Multi-Video Understanding Evaluation for Multimodal LLMs
par: Peng, Tianhao, et autres
Publié: (2025)
par: Peng, Tianhao, et autres
Publié: (2025)
Event-based Visual Deformation Measurement
par: Wu, Yuliang, et autres
Publié: (2026)
par: Wu, Yuliang, et autres
Publié: (2026)
Event-based Asynchronous HDR Imaging by Temporal Incident Light Modulation
par: Wu, Yuliang, et autres
Publié: (2024)
par: Wu, Yuliang, et autres
Publié: (2024)
MedGen: Unlocking Medical Video Generation by Scaling Granularly-annotated Medical Videos
par: Wang, Rongsheng, et autres
Publié: (2025)
par: Wang, Rongsheng, et autres
Publié: (2025)
MMAR: Towards Lossless Multi-Modal Auto-Regressive Probabilistic Modeling
par: Yang, Jian, et autres
Publié: (2024)
par: Yang, Jian, et autres
Publié: (2024)
Documents similaires
-
Sparse VideoGen: Accelerating Video Diffusion Transformers with Spatial-Temporal Sparsity
par: Xi, Haocheng, et autres
Publié: (2025) -
HERO: Human Reaction Generation from Videos
par: Yu, Chengjun, et autres
Publié: (2025) -
DC-VideoGen: Efficient Video Generation with Deep Compression Video Autoencoder
par: Chen, Junyu, et autres
Publié: (2025) -
Sparse VideoGen2: Accelerate Video Generation with Sparse Attention via Semantic-Aware Permutation
par: Yang, Shuo, et autres
Publié: (2025) -
Quant VideoGen: Auto-Regressive Long Video Generation via 2-Bit KV-Cache Quantization
par: Xi, Haocheng, et autres
Publié: (2026)