VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhang, Shi-Xue, Wang, Hongfa, Huang, Duojun, Li, Xin, Zhu, Xiaobin, Yin, Xu-Cheng |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning
von: Lu, Xingyu, et al.
Veröffentlicht: (2026)
von: Lu, Xingyu, et al.
Veröffentlicht: (2026)
DiffCap-Bench: A Comprehensive, Challenging, Robust Benchmark for Image Difference Captioning
von: Wei, Yuancheng, et al.
Veröffentlicht: (2026)
von: Wei, Yuancheng, et al.
Veröffentlicht: (2026)
Video-Language Alignment via Spatio-Temporal Graph Transformer
von: Zhang, Shi-Xue, et al.
Veröffentlicht: (2024)
von: Zhang, Shi-Xue, et al.
Veröffentlicht: (2024)
Inverse-like Antagonistic Scene Text Spotting via Reading-Order Estimation and Dynamic Sampling
von: Zhang, Shi-Xue, et al.
Veröffentlicht: (2024)
von: Zhang, Shi-Xue, et al.
Veröffentlicht: (2024)
CaReBench: A Fine-Grained Benchmark for Video Captioning and Retrieval
von: Xu, Yifan, et al.
Veröffentlicht: (2024)
von: Xu, Yifan, et al.
Veröffentlicht: (2024)
MotionBench: Benchmarking and Improving Fine-grained Video Motion Understanding for Vision Language Models
von: Hong, Wenyi, et al.
Veröffentlicht: (2025)
von: Hong, Wenyi, et al.
Veröffentlicht: (2025)
Caption Anything in Video: Fine-grained Object-centric Captioning via Spatiotemporal Multimodal Prompting
von: Tang, Yunlong, et al.
Veröffentlicht: (2025)
von: Tang, Yunlong, et al.
Veröffentlicht: (2025)
FingerCap: Fine-grained Finger-level Hand Motion Captioning
von: Shen, Xin, et al.
Veröffentlicht: (2025)
von: Shen, Xin, et al.
Veröffentlicht: (2025)
OmniDiff: A Comprehensive Benchmark for Fine-grained Image Difference Captioning
von: Liu, Yuan, et al.
Veröffentlicht: (2025)
von: Liu, Yuan, et al.
Veröffentlicht: (2025)
Scene Graph-guided SegCaptioning Transformer with Fine-grained Alignment for Controllable Video Segmentation and Captioning
von: Zhang, Xu, et al.
Veröffentlicht: (2026)
von: Zhang, Xu, et al.
Veröffentlicht: (2026)
KPM-Bench: A Kinematic Parsing Motion Benchmark for Fine-grained Motion-centric Video Understanding
von: Lin, Boda, et al.
Veröffentlicht: (2026)
von: Lin, Boda, et al.
Veröffentlicht: (2026)
TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models
von: Cai, Mu, et al.
Veröffentlicht: (2024)
von: Cai, Mu, et al.
Veröffentlicht: (2024)
ChronoMagic-Bench: A Benchmark for Metamorphic Evaluation of Text-to-Time-lapse Video Generation
von: Yuan, Shenghai, et al.
Veröffentlicht: (2024)
von: Yuan, Shenghai, et al.
Veröffentlicht: (2024)
UGC-VideoCaptioner: An Omni UGC Video Detail Caption Model and New Benchmarks
von: Wu, Peiran, et al.
Veröffentlicht: (2025)
von: Wu, Peiran, et al.
Veröffentlicht: (2025)
AIM-Bench: Benchmarking and Improving Affective Image Manipulation via Fine-Grained Hierarchical Control
von: Chen, Shi, et al.
Veröffentlicht: (2026)
von: Chen, Shi, et al.
Veröffentlicht: (2026)
Q-Bench-Video: Benchmarking the Video Quality Understanding of LMMs
von: Zhang, Zicheng, et al.
Veröffentlicht: (2024)
von: Zhang, Zicheng, et al.
Veröffentlicht: (2024)
FREAK: A Fine-grained Hallucination Evaluation Benchmark for Advanced MLLMs
von: Yin, Zhihan, et al.
Veröffentlicht: (2026)
von: Yin, Zhihan, et al.
Veröffentlicht: (2026)
VGA-Bench: A Unified Benchmark and Multi-Model Framework for Video Aesthetics and Generation Quality Evaluation
von: Jiang, Longteng, et al.
Veröffentlicht: (2026)
von: Jiang, Longteng, et al.
Veröffentlicht: (2026)
Large-scale Pre-training for Grounded Video Caption Generation
von: Kazakos, Evangelos, et al.
Veröffentlicht: (2025)
von: Kazakos, Evangelos, et al.
Veröffentlicht: (2025)
Koala-36M: A Large-scale Video Dataset Improving Consistency between Fine-grained Conditions and Video Content
von: Wang, Qiuheng, et al.
Veröffentlicht: (2024)
von: Wang, Qiuheng, et al.
Veröffentlicht: (2024)
Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models
von: Wang, Haibo, et al.
Veröffentlicht: (2024)
von: Wang, Haibo, et al.
Veröffentlicht: (2024)
PointQ-Bench: Benchmarking Diagnostic and Interpretable Point Cloud Quality Assessment
von: Wang, Duanchu, et al.
Veröffentlicht: (2026)
von: Wang, Duanchu, et al.
Veröffentlicht: (2026)
EVC-MF: End-to-end Video Captioning Network with Multi-scale Features
von: Niu, Tian-Zi, et al.
Veröffentlicht: (2024)
von: Niu, Tian-Zi, et al.
Veröffentlicht: (2024)
FineState-Bench: Benchmarking State-Conditioned Grounding for Fine-grained GUI State Setting
von: Ji, Fengxian, et al.
Veröffentlicht: (2026)
von: Ji, Fengxian, et al.
Veröffentlicht: (2026)
UltraVideo: High-Quality UHD Video Dataset with Comprehensive Captions
von: Xue, Zhucun, et al.
Veröffentlicht: (2025)
von: Xue, Zhucun, et al.
Veröffentlicht: (2025)
MM-SafetyBench: A Benchmark for Safety Evaluation of Multimodal Large Language Models
von: Liu, Xin, et al.
Veröffentlicht: (2023)
von: Liu, Xin, et al.
Veröffentlicht: (2023)
HalDec-Bench: Benchmarking Hallucination Detector in Image Captioning
von: Saito, Kuniaki, et al.
Veröffentlicht: (2026)
von: Saito, Kuniaki, et al.
Veröffentlicht: (2026)
HalDec-Bench: Benchmarking Hallucination Detector in Image Captioning
von: Saito, Kuniaki, et al.
Veröffentlicht: (2025)
von: Saito, Kuniaki, et al.
Veröffentlicht: (2025)
EVQAScore: A Fine-grained Metric for Video Question Answering Data Quality Evaluation
von: Liang, Hao, et al.
Veröffentlicht: (2024)
von: Liang, Hao, et al.
Veröffentlicht: (2024)
FAVOR-Bench: A Comprehensive Benchmark for Fine-Grained Video Motion Understanding
von: Tu, Chongjun, et al.
Veröffentlicht: (2025)
von: Tu, Chongjun, et al.
Veröffentlicht: (2025)
FineParser: A Fine-grained Spatio-temporal Action Parser for Human-centric Action Quality Assessment
von: Xu, Jinglin, et al.
Veröffentlicht: (2024)
von: Xu, Jinglin, et al.
Veröffentlicht: (2024)
Video-SafetyBench: A Benchmark for Safety Evaluation of Video LVLMs
von: Liu, Xuannan, et al.
Veröffentlicht: (2025)
von: Liu, Xuannan, et al.
Veröffentlicht: (2025)
Towards Fine-Grained Human Motion Video Captioning
von: Song, Guorui, et al.
Veröffentlicht: (2025)
von: Song, Guorui, et al.
Veröffentlicht: (2025)
T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation
von: Chen, Yubin, et al.
Veröffentlicht: (2025)
von: Chen, Yubin, et al.
Veröffentlicht: (2025)
PresentBench: A Fine-Grained Rubric-Based Benchmark for Slide Generation
von: Chen, Xin-Sheng, et al.
Veröffentlicht: (2026)
von: Chen, Xin-Sheng, et al.
Veröffentlicht: (2026)
Exploiting Auxiliary Caption for Video Grounding
von: Li, Hongxiang, et al.
Veröffentlicht: (2023)
von: Li, Hongxiang, et al.
Veröffentlicht: (2023)
FIOVA: A Multi-Annotator Benchmark for Human-Aligned Video Captioning
von: Hu, Shiyu, et al.
Veröffentlicht: (2024)
von: Hu, Shiyu, et al.
Veröffentlicht: (2024)
VC-Bench: Pioneering the Video Connecting Benchmark with a Dataset and Evaluation Metrics
von: Yin, Zhiyu, et al.
Veröffentlicht: (2026)
von: Yin, Zhiyu, et al.
Veröffentlicht: (2026)
FiVE: A Fine-grained Video Editing Benchmark for Evaluating Emerging Diffusion and Rectified Flow Models
von: Li, Minghan, et al.
Veröffentlicht: (2025)
von: Li, Minghan, et al.
Veröffentlicht: (2025)
Knowledge Guided Entity-aware Video Captioning and A Basketball Benchmark
von: Xi, Zeyu, et al.
Veröffentlicht: (2024)
von: Xi, Zeyu, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning
von: Lu, Xingyu, et al.
Veröffentlicht: (2026) -
DiffCap-Bench: A Comprehensive, Challenging, Robust Benchmark for Image Difference Captioning
von: Wei, Yuancheng, et al.
Veröffentlicht: (2026) -
Video-Language Alignment via Spatio-Temporal Graph Transformer
von: Zhang, Shi-Xue, et al.
Veröffentlicht: (2024) -
Inverse-like Antagonistic Scene Text Spotting via Reading-Order Estimation and Dynamic Sampling
von: Zhang, Shi-Xue, et al.
Veröffentlicht: (2024) -
CaReBench: A Fine-Grained Benchmark for Video Captioning and Retrieval
von: Xu, Yifan, et al.
Veröffentlicht: (2024)