VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Shi-Xue, Wang, Hongfa, Huang, Duojun, Li, Xin, Zhu, Xiaobin, Yin, Xu-Cheng |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning
par: Lu, Xingyu, et autres
Publié: (2026)
par: Lu, Xingyu, et autres
Publié: (2026)
DiffCap-Bench: A Comprehensive, Challenging, Robust Benchmark for Image Difference Captioning
par: Wei, Yuancheng, et autres
Publié: (2026)
par: Wei, Yuancheng, et autres
Publié: (2026)
Video-Language Alignment via Spatio-Temporal Graph Transformer
par: Zhang, Shi-Xue, et autres
Publié: (2024)
par: Zhang, Shi-Xue, et autres
Publié: (2024)
Inverse-like Antagonistic Scene Text Spotting via Reading-Order Estimation and Dynamic Sampling
par: Zhang, Shi-Xue, et autres
Publié: (2024)
par: Zhang, Shi-Xue, et autres
Publié: (2024)
CaReBench: A Fine-Grained Benchmark for Video Captioning and Retrieval
par: Xu, Yifan, et autres
Publié: (2024)
par: Xu, Yifan, et autres
Publié: (2024)
MotionBench: Benchmarking and Improving Fine-grained Video Motion Understanding for Vision Language Models
par: Hong, Wenyi, et autres
Publié: (2025)
par: Hong, Wenyi, et autres
Publié: (2025)
Caption Anything in Video: Fine-grained Object-centric Captioning via Spatiotemporal Multimodal Prompting
par: Tang, Yunlong, et autres
Publié: (2025)
par: Tang, Yunlong, et autres
Publié: (2025)
FingerCap: Fine-grained Finger-level Hand Motion Captioning
par: Shen, Xin, et autres
Publié: (2025)
par: Shen, Xin, et autres
Publié: (2025)
OmniDiff: A Comprehensive Benchmark for Fine-grained Image Difference Captioning
par: Liu, Yuan, et autres
Publié: (2025)
par: Liu, Yuan, et autres
Publié: (2025)
Scene Graph-guided SegCaptioning Transformer with Fine-grained Alignment for Controllable Video Segmentation and Captioning
par: Zhang, Xu, et autres
Publié: (2026)
par: Zhang, Xu, et autres
Publié: (2026)
KPM-Bench: A Kinematic Parsing Motion Benchmark for Fine-grained Motion-centric Video Understanding
par: Lin, Boda, et autres
Publié: (2026)
par: Lin, Boda, et autres
Publié: (2026)
TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models
par: Cai, Mu, et autres
Publié: (2024)
par: Cai, Mu, et autres
Publié: (2024)
ChronoMagic-Bench: A Benchmark for Metamorphic Evaluation of Text-to-Time-lapse Video Generation
par: Yuan, Shenghai, et autres
Publié: (2024)
par: Yuan, Shenghai, et autres
Publié: (2024)
UGC-VideoCaptioner: An Omni UGC Video Detail Caption Model and New Benchmarks
par: Wu, Peiran, et autres
Publié: (2025)
par: Wu, Peiran, et autres
Publié: (2025)
AIM-Bench: Benchmarking and Improving Affective Image Manipulation via Fine-Grained Hierarchical Control
par: Chen, Shi, et autres
Publié: (2026)
par: Chen, Shi, et autres
Publié: (2026)
Q-Bench-Video: Benchmarking the Video Quality Understanding of LMMs
par: Zhang, Zicheng, et autres
Publié: (2024)
par: Zhang, Zicheng, et autres
Publié: (2024)
FREAK: A Fine-grained Hallucination Evaluation Benchmark for Advanced MLLMs
par: Yin, Zhihan, et autres
Publié: (2026)
par: Yin, Zhihan, et autres
Publié: (2026)
VGA-Bench: A Unified Benchmark and Multi-Model Framework for Video Aesthetics and Generation Quality Evaluation
par: Jiang, Longteng, et autres
Publié: (2026)
par: Jiang, Longteng, et autres
Publié: (2026)
Large-scale Pre-training for Grounded Video Caption Generation
par: Kazakos, Evangelos, et autres
Publié: (2025)
par: Kazakos, Evangelos, et autres
Publié: (2025)
Koala-36M: A Large-scale Video Dataset Improving Consistency between Fine-grained Conditions and Video Content
par: Wang, Qiuheng, et autres
Publié: (2024)
par: Wang, Qiuheng, et autres
Publié: (2024)
Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models
par: Wang, Haibo, et autres
Publié: (2024)
par: Wang, Haibo, et autres
Publié: (2024)
PointQ-Bench: Benchmarking Diagnostic and Interpretable Point Cloud Quality Assessment
par: Wang, Duanchu, et autres
Publié: (2026)
par: Wang, Duanchu, et autres
Publié: (2026)
EVC-MF: End-to-end Video Captioning Network with Multi-scale Features
par: Niu, Tian-Zi, et autres
Publié: (2024)
par: Niu, Tian-Zi, et autres
Publié: (2024)
FineState-Bench: Benchmarking State-Conditioned Grounding for Fine-grained GUI State Setting
par: Ji, Fengxian, et autres
Publié: (2026)
par: Ji, Fengxian, et autres
Publié: (2026)
UltraVideo: High-Quality UHD Video Dataset with Comprehensive Captions
par: Xue, Zhucun, et autres
Publié: (2025)
par: Xue, Zhucun, et autres
Publié: (2025)
MM-SafetyBench: A Benchmark for Safety Evaluation of Multimodal Large Language Models
par: Liu, Xin, et autres
Publié: (2023)
par: Liu, Xin, et autres
Publié: (2023)
HalDec-Bench: Benchmarking Hallucination Detector in Image Captioning
par: Saito, Kuniaki, et autres
Publié: (2026)
par: Saito, Kuniaki, et autres
Publié: (2026)
HalDec-Bench: Benchmarking Hallucination Detector in Image Captioning
par: Saito, Kuniaki, et autres
Publié: (2025)
par: Saito, Kuniaki, et autres
Publié: (2025)
EVQAScore: A Fine-grained Metric for Video Question Answering Data Quality Evaluation
par: Liang, Hao, et autres
Publié: (2024)
par: Liang, Hao, et autres
Publié: (2024)
FAVOR-Bench: A Comprehensive Benchmark for Fine-Grained Video Motion Understanding
par: Tu, Chongjun, et autres
Publié: (2025)
par: Tu, Chongjun, et autres
Publié: (2025)
FineParser: A Fine-grained Spatio-temporal Action Parser for Human-centric Action Quality Assessment
par: Xu, Jinglin, et autres
Publié: (2024)
par: Xu, Jinglin, et autres
Publié: (2024)
Video-SafetyBench: A Benchmark for Safety Evaluation of Video LVLMs
par: Liu, Xuannan, et autres
Publié: (2025)
par: Liu, Xuannan, et autres
Publié: (2025)
Towards Fine-Grained Human Motion Video Captioning
par: Song, Guorui, et autres
Publié: (2025)
par: Song, Guorui, et autres
Publié: (2025)
T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation
par: Chen, Yubin, et autres
Publié: (2025)
par: Chen, Yubin, et autres
Publié: (2025)
PresentBench: A Fine-Grained Rubric-Based Benchmark for Slide Generation
par: Chen, Xin-Sheng, et autres
Publié: (2026)
par: Chen, Xin-Sheng, et autres
Publié: (2026)
Exploiting Auxiliary Caption for Video Grounding
par: Li, Hongxiang, et autres
Publié: (2023)
par: Li, Hongxiang, et autres
Publié: (2023)
FIOVA: A Multi-Annotator Benchmark for Human-Aligned Video Captioning
par: Hu, Shiyu, et autres
Publié: (2024)
par: Hu, Shiyu, et autres
Publié: (2024)
VC-Bench: Pioneering the Video Connecting Benchmark with a Dataset and Evaluation Metrics
par: Yin, Zhiyu, et autres
Publié: (2026)
par: Yin, Zhiyu, et autres
Publié: (2026)
FiVE: A Fine-grained Video Editing Benchmark for Evaluating Emerging Diffusion and Rectified Flow Models
par: Li, Minghan, et autres
Publié: (2025)
par: Li, Minghan, et autres
Publié: (2025)
Knowledge Guided Entity-aware Video Captioning and A Basketball Benchmark
par: Xi, Zeyu, et autres
Publié: (2024)
par: Xi, Zeyu, et autres
Publié: (2024)
Documents similaires
-
VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning
par: Lu, Xingyu, et autres
Publié: (2026) -
DiffCap-Bench: A Comprehensive, Challenging, Robust Benchmark for Image Difference Captioning
par: Wei, Yuancheng, et autres
Publié: (2026) -
Video-Language Alignment via Spatio-Temporal Graph Transformer
par: Zhang, Shi-Xue, et autres
Publié: (2024) -
Inverse-like Antagonistic Scene Text Spotting via Reading-Order Estimation and Dynamic Sampling
par: Zhang, Shi-Xue, et autres
Publié: (2024) -
CaReBench: A Fine-Grained Benchmark for Video Captioning and Retrieval
par: Xu, Yifan, et autres
Publié: (2024)