VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing
Fuente:
arXiv
Saved in:
| Main Authors: | Deng, Andong, Du, Dawei, Chen, Zhenfang, Zhong, Wen, Chen, Fan, Chen, Guang, Kuo, Chia-Wen, Wen, Longyin, Chen, Chen, Zhu, Sijie |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Beyond Raw Videos: Understanding Edited Videos with Large Multimodal Model
by: Xu, Lu, et al.
Published: (2024)
by: Xu, Lu, et al.
Published: (2024)
Vidi: Large Multimodal Models for Video Understanding and Editing
by: Vidi Team, et al.
Published: (2025)
by: Vidi Team, et al.
Published: (2025)
D-Attn: Decomposed Attention for Large Vision-and-Language Models
by: Kuo, Chia-Wen, et al.
Published: (2025)
by: Kuo, Chia-Wen, et al.
Published: (2025)
Edit3K: Universal Representation Learning for Video Editing Components
by: Gu, Xin, et al.
Published: (2024)
by: Gu, Xin, et al.
Published: (2024)
SuperEdit: Rectifying and Facilitating Supervision for Instruction-Based Image Editing
by: Li, Ming, et al.
Published: (2025)
by: Li, Ming, et al.
Published: (2025)
CuMo: Scaling Multimodal LLM with Co-Upcycled Mixture-of-Experts
by: Li, Jiachen, et al.
Published: (2024)
by: Li, Jiachen, et al.
Published: (2024)
Where do Large Vision-Language Models Look at when Answering Questions?
by: Xing, Xiaoying, et al.
Published: (2025)
by: Xing, Xiaoying, et al.
Published: (2025)
Multi-Reward as Condition for Instruction-based Image Editing
by: Gu, Xin, et al.
Published: (2024)
by: Gu, Xin, et al.
Published: (2024)
Vidi2.5: Large Multimodal Models for Video Understanding and Creation
by: Vidi Team, et al.
Published: (2025)
by: Vidi Team, et al.
Published: (2025)
Thinking With Bounding Boxes: Enhancing Spatio-Temporal Video Grounding via Reinforcement Fine-Tuning
by: Gu, Xin, et al.
Published: (2025)
by: Gu, Xin, et al.
Published: (2025)
SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models
by: Deng, Andong, et al.
Published: (2025)
by: Deng, Andong, et al.
Published: (2025)
STAR: A Benchmark for Situated Reasoning in Real-World Videos
by: Wu, Bo, et al.
Published: (2024)
by: Wu, Bo, et al.
Published: (2024)
SOK-Bench: A Situated Video Reasoning Benchmark with Aligned Open-World Knowledge
by: Wang, Andong, et al.
Published: (2024)
by: Wang, Andong, et al.
Published: (2024)
LongCaptioning: Unlocking the Power of Long Video Caption Generation in Large Multimodal Models
by: Wei, Hongchen, et al.
Published: (2025)
by: Wei, Hongchen, et al.
Published: (2025)
XSeg: A Large-scale X-ray Contraband Segmentation Benchmark For Real-World Security Screening
by: Gao, Hongxia, et al.
Published: (2026)
by: Gao, Hongxia, et al.
Published: (2026)
From Perception to Reasoning: Deep Thinking Empowers Multimodal Large Language Models
by: Zhu, Wenxin, et al.
Published: (2025)
by: Zhu, Wenxin, et al.
Published: (2025)
LayeredFlow: A Real-World Benchmark for Non-Lambertian Multi-Layer Optical Flow
by: Wen, Hongyu, et al.
Published: (2024)
by: Wen, Hongyu, et al.
Published: (2024)
Engagement Prediction of Short Videos with Large Multimodal Models
by: Sun, Wei, et al.
Published: (2025)
by: Sun, Wei, et al.
Published: (2025)
RecipeGen: A Step-Aligned Multimodal Benchmark for Real-World Recipe Generation
by: Zhang, Ruoxuan, et al.
Published: (2025)
by: Zhang, Ruoxuan, et al.
Published: (2025)
Accurate and Fast Compressed Video Captioning
by: Shen, Yaojie, et al.
Published: (2023)
by: Shen, Yaojie, et al.
Published: (2023)
Culture In a Frame: C$^3$B as a Comic-Based Benchmark for Multimodal Culturally Awareness
by: Song, Yuchen, et al.
Published: (2025)
by: Song, Yuchen, et al.
Published: (2025)
MathReal: We Keep It Real! A Real Scene Benchmark for Evaluating Math Reasoning in Multimodal Large Language Models
by: Feng, Jun, et al.
Published: (2025)
by: Feng, Jun, et al.
Published: (2025)
MathScape: Benchmarking Multimodal Large Language Models in Real-World Mathematical Contexts
by: Liang, Hao, et al.
Published: (2024)
by: Liang, Hao, et al.
Published: (2024)
Multimodal Fusion and Coherence Modeling for Video Topic Segmentation
by: Yu, Hai, et al.
Published: (2024)
by: Yu, Hai, et al.
Published: (2024)
TGT: Text-Grounded Trajectories for Locally Controlled Video Generation
by: Zhang, Guofeng, et al.
Published: (2025)
by: Zhang, Guofeng, et al.
Published: (2025)
A.I.R.: Enabling Adaptive, Iterative, and Reasoning-based Frame Selection For Video Question Answering
by: Zou, Yuanhao, et al.
Published: (2025)
by: Zou, Yuanhao, et al.
Published: (2025)
ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models for Audio Generation and Editing
by: Liu, Huadai, et al.
Published: (2025)
by: Liu, Huadai, et al.
Published: (2025)
A Survey on Video Temporal Grounding with Multimodal Large Language Model
by: Wu, Jianlong, et al.
Published: (2025)
by: Wu, Jianlong, et al.
Published: (2025)
ESA: Energy-Based Shot Assembly Optimization for Automatic Video Editing
by: Chen, Yaosen, et al.
Published: (2025)
by: Chen, Yaosen, et al.
Published: (2025)
OpenEarthSensing: Large-Scale Fine-Grained Benchmark for Open-World Remote Sensing
by: Xiang, Xiang, et al.
Published: (2025)
by: Xiang, Xiang, et al.
Published: (2025)
Beyond Rigid: Benchmarking Non-Rigid Video Editing
by: Qu, Bingzheng, et al.
Published: (2026)
by: Qu, Bingzheng, et al.
Published: (2026)
Referring Layer Decomposition
by: Chen, Fangyi, et al.
Published: (2026)
by: Chen, Fangyi, et al.
Published: (2026)
FlowAnchor: Stabilizing the Editing Signal for Inversion-Free Video Editing
by: Chen, Ze, et al.
Published: (2026)
by: Chen, Ze, et al.
Published: (2026)
To Preserve or To Compress: An In-Depth Study of Connector Selection in Multimodal Large Language Models
by: Lin, Junyan, et al.
Published: (2024)
by: Lin, Junyan, et al.
Published: (2024)
EditBoard: Towards a Comprehensive Evaluation Benchmark for Text-Based Video Editing Models
by: Chen, Yupeng, et al.
Published: (2024)
by: Chen, Yupeng, et al.
Published: (2024)
UVEB: A Large-scale Benchmark and Baseline Towards Real-World Underwater Video Enhancement
by: Xie, Yaofeng, et al.
Published: (2024)
by: Xie, Yaofeng, et al.
Published: (2024)
Benchmarking the Trustworthiness in Multimodal LLMs for Video Understanding
by: Wang, Youze, et al.
Published: (2025)
by: Wang, Youze, et al.
Published: (2025)
TiViBench: Benchmarking Think-in-Video Reasoning for Video Generative Models
by: Chen, Harold Haodong, et al.
Published: (2025)
by: Chen, Harold Haodong, et al.
Published: (2025)
Prompt-Anchored Vision-Text Distillation for Lifelong Person Re-identification
by: Wen, Wen, et al.
Published: (2026)
by: Wen, Wen, et al.
Published: (2026)
EgoPlan-Bench2: A Benchmark for Multimodal Large Language Model Planning in Real-World Scenarios
by: Qiu, Lu, et al.
Published: (2024)
by: Qiu, Lu, et al.
Published: (2024)
Similar Items
-
Beyond Raw Videos: Understanding Edited Videos with Large Multimodal Model
by: Xu, Lu, et al.
Published: (2024) -
Vidi: Large Multimodal Models for Video Understanding and Editing
by: Vidi Team, et al.
Published: (2025) -
D-Attn: Decomposed Attention for Large Vision-and-Language Models
by: Kuo, Chia-Wen, et al.
Published: (2025) -
Edit3K: Universal Representation Learning for Video Editing Components
by: Gu, Xin, et al.
Published: (2024) -
SuperEdit: Rectifying and Facilitating Supervision for Instruction-Based Image Editing
by: Li, Ming, et al.
Published: (2025)