VC-Inspector: Advancing Reference-free Evaluation of Video Captions with Factual Analysis
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Dipta, Shubhashis Roy, Wu, Tz-Ying, Tripathi, Subarna |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Q2E: Query-to-Event Decomposition for Zero-Shot Multilingual Text-to-Video Retrieval
par: Dipta, Shubhashis Roy, et autres
Publié: (2025)
par: Dipta, Shubhashis Roy, et autres
Publié: (2025)
Harnessing Object Grounding for Time-Sensitive Video Understanding
par: Wu, Tz-Ying, et autres
Publié: (2025)
par: Wu, Tz-Ying, et autres
Publié: (2025)
Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models
par: Wu, Tz-Ying, et autres
Publié: (2025)
par: Wu, Tz-Ying, et autres
Publié: (2025)
Ego-VPA: Egocentric Video Understanding with Parameter-efficient Adaptation
par: Wu, Tz-Ying, et autres
Publié: (2024)
par: Wu, Tz-Ying, et autres
Publié: (2024)
Search2Motion: Training-Free Object-Level Motion Control via Attention-Consensus Search
par: Liu, Sainan, et autres
Publié: (2026)
par: Liu, Sainan, et autres
Publié: (2026)
VC4VG: Optimizing Video Captions for Text-to-Video Generation
par: Du, Yang, et autres
Publié: (2025)
par: Du, Yang, et autres
Publié: (2025)
EASG-Bench: Video Q&A Benchmark with Egocentric Action Scene Graphs
par: Rodin, Ivan, et autres
Publié: (2025)
par: Rodin, Ivan, et autres
Publié: (2025)
Many Dialects, Many Languages, One Cultural Lens: Evaluating Multilingual VLMs for Bengali Culture Understanding Across Historically Linked Languages and Regional Dialects
par: Sayeedi, Nurul Labib, et autres
Publié: (2026)
par: Sayeedi, Nurul Labib, et autres
Publié: (2026)
VideoSAGE: Video Summarization with Graph Representation Learning
par: Chaves, Jose M. Rojas, et autres
Publié: (2024)
par: Chaves, Jose M. Rojas, et autres
Publié: (2024)
Grounded Visual Factualization: Factual Anchor-Based Finetuning for Enhancing MLLM Factual Consistency
par: Morbiato, Filippo, et autres
Publié: (2025)
par: Morbiato, Filippo, et autres
Publié: (2025)
Surveying the Landscape of Image Captioning Evaluation: A Comprehensive Taxonomy, Trends and Metrics Analysis
par: Berger, Uri, et autres
Publié: (2024)
par: Berger, Uri, et autres
Publié: (2024)
SViTT-Ego: A Sparse Video-Text Transformer for Egocentric Video
par: Valdez, Hector A., et autres
Publié: (2024)
par: Valdez, Hector A., et autres
Publié: (2024)
Contrastive Language Video Time Pre-training
par: Liu, Hengyue, et autres
Publié: (2024)
par: Liu, Hengyue, et autres
Publié: (2024)
Can VLMs Recall Factual Associations From Visual References?
par: Ashok, Dhananjay, et autres
Publié: (2025)
par: Ashok, Dhananjay, et autres
Publié: (2025)
An Examination of the Robustness of Reference-Free Image Captioning Evaluation Metrics
par: Ahmadi, Saba, et autres
Publié: (2023)
par: Ahmadi, Saba, et autres
Publié: (2023)
DiffVC: A Non-autoregressive Framework Based on Diffusion Model for Video Captioning
par: Wang, Junbo, et autres
Publié: (2026)
par: Wang, Junbo, et autres
Publié: (2026)
FLEUR: An Explainable Reference-Free Evaluation Metric for Image Captioning Using a Large Multimodal Model
par: Lee, Yebin, et autres
Publié: (2024)
par: Lee, Yebin, et autres
Publié: (2024)
Unveiling the Invisible: Captioning Videos with Metaphors
par: Kalarani, Abisek Rajakumar, et autres
Publié: (2024)
par: Kalarani, Abisek Rajakumar, et autres
Publié: (2024)
OmniCaptioner: One Captioner to Rule Them All
par: Lu, Yiting, et autres
Publié: (2025)
par: Lu, Yiting, et autres
Publié: (2025)
Exo2EgoDVC: Dense Video Captioning of Egocentric Procedural Activities Using Web Instructional Videos
par: Ohkawa, Takehiko, et autres
Publié: (2023)
par: Ohkawa, Takehiko, et autres
Publié: (2023)
A Video is Worth 10,000 Words: Training and Benchmarking with Diverse Captions for Better Long Video Retrieval
par: Gwilliam, Matthew, et autres
Publié: (2023)
par: Gwilliam, Matthew, et autres
Publié: (2023)
LLMVA-GEBC: Large Language Model with Video Adapter for Generic Event Boundary Captioning
par: Tang, Yolo Yunlong, et autres
Publié: (2023)
par: Tang, Yolo Yunlong, et autres
Publié: (2023)
SPECS: Specificity-Enhanced CLIP-Score for Long Image Caption Evaluation
par: Chen, Xiaofu, et autres
Publié: (2025)
par: Chen, Xiaofu, et autres
Publié: (2025)
"See the World, Discover Knowledge": A Chinese Factuality Evaluation for Large Vision Language Models
par: Gu, Jihao, et autres
Publié: (2025)
par: Gu, Jihao, et autres
Publié: (2025)
Figuring out Figures: Using Textual References to Caption Scientific Figures
par: Cao, Stanley, et autres
Publié: (2024)
par: Cao, Stanley, et autres
Publié: (2024)
MCF-VC: Mitigate Catastrophic Forgetting in Class-Incremental Learning for Multimodal Video Captioning
par: Xiong, Huiyu, et autres
Publié: (2024)
par: Xiong, Huiyu, et autres
Publié: (2024)
Distinctive Image Captioning: Leveraging Ground Truth Captions in CLIP Guided Reinforcement Learning
par: Chaffin, Antoine, et autres
Publié: (2024)
par: Chaffin, Antoine, et autres
Publié: (2024)
FACE-net: Factual Calibration and Emotion Augmentation for Retrieval-enhanced Emotional Video Captioning
par: Chen, Weidong, et autres
Publié: (2026)
par: Chen, Weidong, et autres
Publié: (2026)
Precision or Recall? An Analysis of Image Captions for Training Text-to-Image Generation Model
par: Cheng, Sheng, et autres
Publié: (2024)
par: Cheng, Sheng, et autres
Publié: (2024)
SST-EM: Advanced Metrics for Evaluating Semantic, Spatial and Temporal Aspects in Video Editing
par: Biyyala, Varun, et autres
Publié: (2025)
par: Biyyala, Varun, et autres
Publié: (2025)
G-VEval: A Versatile Metric for Evaluating Image and Video Captions Using GPT-4o
par: Tong, Tony Cheng, et autres
Publié: (2024)
par: Tong, Tony Cheng, et autres
Publié: (2024)
Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning
par: Piergiovanni, AJ, et autres
Publié: (2024)
par: Piergiovanni, AJ, et autres
Publié: (2024)
Unblocking Fine-Grained Evaluation of Detailed Captions: An Explaining AutoRater and Critic-and-Revise Pipeline
par: Gordon, Brian, et autres
Publié: (2025)
par: Gordon, Brian, et autres
Publié: (2025)
If We May De-Presuppose: Robustly Verifying Claims through Presupposition-Free Question Decomposition
par: Dipta, Shubhashis Roy, et autres
Publié: (2025)
par: Dipta, Shubhashis Roy, et autres
Publié: (2025)
ProTeCt: Prompt Tuning for Taxonomic Open Set Classification
par: Wu, Tz-Ying, et autres
Publié: (2023)
par: Wu, Tz-Ying, et autres
Publié: (2023)
LLM-Bootstrapped Targeted Finding Guidance for Factual MLLM-based Medical Report Generation
par: Yang, Cunyuan, et autres
Publié: (2026)
par: Yang, Cunyuan, et autres
Publié: (2026)
Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis
par: Fu, Chaoyou, et autres
Publié: (2024)
par: Fu, Chaoyou, et autres
Publié: (2024)
Wolf: Dense Video Captioning with a World Summarization Framework
par: Li, Boyi, et autres
Publié: (2024)
par: Li, Boyi, et autres
Publié: (2024)
FinCap: Topic-Aligned Captions for Short-Form Financial YouTube Videos
par: Sukhani, Siddhant, et autres
Publié: (2025)
par: Sukhani, Siddhant, et autres
Publié: (2025)
From Image Captioning to Visual Storytelling
par: Passadakis, Admitos, et autres
Publié: (2025)
par: Passadakis, Admitos, et autres
Publié: (2025)
Documents similaires
-
Q2E: Query-to-Event Decomposition for Zero-Shot Multilingual Text-to-Video Retrieval
par: Dipta, Shubhashis Roy, et autres
Publié: (2025) -
Harnessing Object Grounding for Time-Sensitive Video Understanding
par: Wu, Tz-Ying, et autres
Publié: (2025) -
Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models
par: Wu, Tz-Ying, et autres
Publié: (2025) -
Ego-VPA: Egocentric Video Understanding with Parameter-efficient Adaptation
par: Wu, Tz-Ying, et autres
Publié: (2024) -
Search2Motion: Training-Free Object-Level Motion Control via Attention-Consensus Search
par: Liu, Sainan, et autres
Publié: (2026)