CAPability: A Comprehensive Visual Caption Benchmark for Evaluating Both Correctness and Thoroughness
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Zhihang, Xie, Chen-Wei, Wen, Bin, Yu, Feiwu, Chen, Jixuan, Li, Pandeng, Zhang, Boqiang, Yang, Nianzu, Li, Yinglu, Gao, Zuan, Zheng, Yun, Xie, Hongtao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Choose What You Need: Disentangled Representation Learning for Scene Text Recognition, Removal and Editing
di: Zhang, Boqiang, et al.
Pubblicazione: (2024)
di: Zhang, Boqiang, et al.
Pubblicazione: (2024)
How Control Information Influences Multilingual Text Image Generation and Editing?
di: Zhang, Boqiang, et al.
Pubblicazione: (2024)
di: Zhang, Boqiang, et al.
Pubblicazione: (2024)
RegionRAG: Region-level Retrieval-Augmented Generation for Visual Document Understanding
di: Li, Yinglu, et al.
Pubblicazione: (2025)
di: Li, Yinglu, et al.
Pubblicazione: (2025)
Hybrid-Level Instruction Injection for Video Token Compression in Multi-modal Large Language Models
di: Liu, Zhihang, et al.
Pubblicazione: (2025)
di: Liu, Zhihang, et al.
Pubblicazione: (2025)
ShowTable: Unlocking Creative Table Visualization with Collaborative Reflection and Refinement
di: Liu, Zhihang, et al.
Pubblicazione: (2025)
di: Liu, Zhihang, et al.
Pubblicazione: (2025)
Self-Supervised Pre-training with Symmetric Superimposition Modeling for Scene Text Recognition
di: Gao, Zuan, et al.
Pubblicazione: (2024)
di: Gao, Zuan, et al.
Pubblicazione: (2024)
Rethinking Video Tokenization: A Conditioned Diffusion-based Approach
di: Yang, Nianzu, et al.
Pubblicazione: (2025)
di: Yang, Nianzu, et al.
Pubblicazione: (2025)
AlignZeg: Mitigating Objective Misalignment for Zero-shot Semantic Segmentation
di: Ge, Jiannan, et al.
Pubblicazione: (2024)
di: Ge, Jiannan, et al.
Pubblicazione: (2024)
GenAgent: Scaling Text-to-Image Generation via Agentic Multimodal Reasoning
di: Jiang, Kaixun, et al.
Pubblicazione: (2026)
di: Jiang, Kaixun, et al.
Pubblicazione: (2026)
DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding
di: Wu, Hao, et al.
Pubblicazione: (2024)
di: Wu, Hao, et al.
Pubblicazione: (2024)
Focus on the Whole Character: Discriminative Character Modeling for Scene Text Recognition
di: Zhou, Bangbang, et al.
Pubblicazione: (2024)
di: Zhou, Bangbang, et al.
Pubblicazione: (2024)
AIBench: Evaluating Visual-Logical Consistency in Academic Illustration Generation
di: Liao, Zhaohe, et al.
Pubblicazione: (2026)
di: Liao, Zhaohe, et al.
Pubblicazione: (2026)
UFO: A Unified Approach to Fine-grained Visual Perception via Open-ended Language Interface
di: Tang, Hao, et al.
Pubblicazione: (2025)
di: Tang, Hao, et al.
Pubblicazione: (2025)
SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning
di: Zhang, Lin, et al.
Pubblicazione: (2025)
di: Zhang, Lin, et al.
Pubblicazione: (2025)
Beyond Visual Cues: Semantic-Driven Token Filtering and Expert Routing for Anytime Person ReID
di: Li, Jiaxuan, et al.
Pubblicazione: (2026)
di: Li, Jiaxuan, et al.
Pubblicazione: (2026)
UniLiP: Adapting CLIP for Unified Multimodal Understanding, Generation and Editing
di: Tang, Hao, et al.
Pubblicazione: (2025)
di: Tang, Hao, et al.
Pubblicazione: (2025)
Boosting Segment Anything Model to Generalize Visually Non-Salient Scenarios
di: Guo, Guangqian, et al.
Pubblicazione: (2026)
di: Guo, Guangqian, et al.
Pubblicazione: (2026)
OmniCaptioner: One Captioner to Rule Them All
di: Lu, Yiting, et al.
Pubblicazione: (2025)
di: Lu, Yiting, et al.
Pubblicazione: (2025)
DiffCap-Bench: A Comprehensive, Challenging, Robust Benchmark for Image Difference Captioning
di: Wei, Yuancheng, et al.
Pubblicazione: (2026)
di: Wei, Yuancheng, et al.
Pubblicazione: (2026)
MMLongBench: Benchmarking Long-Context Vision-Language Models Effectively and Thoroughly
di: Wang, Zhaowei, et al.
Pubblicazione: (2025)
di: Wang, Zhaowei, et al.
Pubblicazione: (2025)
VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning
di: Lu, Xingyu, et al.
Pubblicazione: (2026)
di: Lu, Xingyu, et al.
Pubblicazione: (2026)
BACON: Improving Clarity of Image Captions via Bag-of-Concept Graphs
di: Yang, Zhantao, et al.
Pubblicazione: (2024)
di: Yang, Zhantao, et al.
Pubblicazione: (2024)
SpaceVLLM: Endowing Multimodal Large Language Model with Spatio-Temporal Video Grounding Capability
di: Wang, Jiankang, et al.
Pubblicazione: (2025)
di: Wang, Jiankang, et al.
Pubblicazione: (2025)
MetaCaptioner: Towards Generalist Visual Captioning with Open-source Suites
di: Lei, Zhenxin, et al.
Pubblicazione: (2025)
di: Lei, Zhenxin, et al.
Pubblicazione: (2025)
Hallucination Mitigation Prompts Long-term Video Understanding
di: Sun, Yiwei, et al.
Pubblicazione: (2024)
di: Sun, Yiwei, et al.
Pubblicazione: (2024)
Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor
di: Chen, Jiali, et al.
Pubblicazione: (2024)
di: Chen, Jiali, et al.
Pubblicazione: (2024)
Omni-Captioner: Data Pipeline, Models, and Benchmark for Omni Detailed Perception
di: Ma, Ziyang, et al.
Pubblicazione: (2025)
di: Ma, Ziyang, et al.
Pubblicazione: (2025)
Efficient Deployment of Large Language Models on Resource-constrained Devices
di: Yao, Zhiwei, et al.
Pubblicazione: (2025)
di: Yao, Zhiwei, et al.
Pubblicazione: (2025)
SpaceDG: Benchmarking Spatial Intelligence under Visual Degradation
di: Zhou, Xiaolong, et al.
Pubblicazione: (2026)
di: Zhou, Xiaolong, et al.
Pubblicazione: (2026)
Benchmarking Table Comprehension In The Wild
di: Pan, Yikang, et al.
Pubblicazione: (2024)
di: Pan, Yikang, et al.
Pubblicazione: (2024)
MUNIChus: Multilingual News Image Captioning Benchmark
di: Chen, Yuji, et al.
Pubblicazione: (2026)
di: Chen, Yuji, et al.
Pubblicazione: (2026)
HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly
di: Yen, Howard, et al.
Pubblicazione: (2024)
di: Yen, Howard, et al.
Pubblicazione: (2024)
BRACE: A Benchmark for Robust Audio Caption Quality Evaluation
di: Guo, Tianyu, et al.
Pubblicazione: (2025)
di: Guo, Tianyu, et al.
Pubblicazione: (2025)
SITE: towards Spatial Intelligence Thorough Evaluation
di: Wang, Wenqi, et al.
Pubblicazione: (2025)
di: Wang, Wenqi, et al.
Pubblicazione: (2025)
CODIS: Benchmarking Context-Dependent Visual Comprehension for Multimodal Large Language Models
di: Luo, Fuwen, et al.
Pubblicazione: (2024)
di: Luo, Fuwen, et al.
Pubblicazione: (2024)
GeReA: Question-Aware Prompt Captions for Knowledge-based Visual Question Answering
di: Ma, Ziyu, et al.
Pubblicazione: (2024)
di: Ma, Ziyu, et al.
Pubblicazione: (2024)
EVCap: Retrieval-Augmented Image Captioning with External Visual-Name Memory for Open-World Comprehension
di: Li, Jiaxuan, et al.
Pubblicazione: (2023)
di: Li, Jiaxuan, et al.
Pubblicazione: (2023)
Collaborative Inference for Large Models with Task Offloading and Early Exiting
di: Xie, Zuan, et al.
Pubblicazione: (2024)
di: Xie, Zuan, et al.
Pubblicazione: (2024)
HICEScore: A Hierarchical Metric for Image Captioning Evaluation
di: Zeng, Zequn, et al.
Pubblicazione: (2024)
di: Zeng, Zequn, et al.
Pubblicazione: (2024)
EditBoard: Towards a Comprehensive Evaluation Benchmark for Text-Based Video Editing Models
di: Chen, Yupeng, et al.
Pubblicazione: (2024)
di: Chen, Yupeng, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Choose What You Need: Disentangled Representation Learning for Scene Text Recognition, Removal and Editing
di: Zhang, Boqiang, et al.
Pubblicazione: (2024) -
How Control Information Influences Multilingual Text Image Generation and Editing?
di: Zhang, Boqiang, et al.
Pubblicazione: (2024) -
RegionRAG: Region-level Retrieval-Augmented Generation for Visual Document Understanding
di: Li, Yinglu, et al.
Pubblicazione: (2025) -
Hybrid-Level Instruction Injection for Video Token Compression in Multi-modal Large Language Models
di: Liu, Zhihang, et al.
Pubblicazione: (2025) -
ShowTable: Unlocking Creative Table Visualization with Collaborative Reflection and Refinement
di: Liu, Zhihang, et al.
Pubblicazione: (2025)