DetailVerifyBench: A Benchmark for Dense Hallucination Localization in Long Image Captions
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Xinran, Zhang, Yuxuan, Zhang, Xiao, Yan, Haolong, Diao, Muxi, Xu, Songyu, Yan, Zhonghao, Li, Hongbing, Liang, Kongming, Ma, Zhanyu |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CineTechBench: A Benchmark for Cinematographic Technique Understanding and Generation
par: Wang, Xinran, et autres
Publié: (2025)
par: Wang, Xinran, et autres
Publié: (2025)
Harnessing Caption Detailness for Data-Efficient Text-to-Image Generation
par: Wang, Xinran, et autres
Publié: (2025)
par: Wang, Xinran, et autres
Publié: (2025)
From Simple to Professional: A Combinatorial Controllable Image Captioning Agent
par: Wang, Xinran, et autres
Publié: (2024)
par: Wang, Xinran, et autres
Publié: (2024)
Omni-Captioner: Data Pipeline, Models, and Benchmark for Omni Detailed Perception
par: Ma, Ziyang, et autres
Publié: (2025)
par: Ma, Ziyang, et autres
Publié: (2025)
Mitigating Image Captioning Hallucinations in Vision-Language Models
par: Zhao, Fei, et autres
Publié: (2025)
par: Zhao, Fei, et autres
Publié: (2025)
Hepato-LLaVA: An Expert MLLM with Sparse Topo-Pack Attention for Hepatocellular Pathology Analysis on Whole Slide Images
par: Yang, Yuxuan, et autres
Publié: (2026)
par: Yang, Yuxuan, et autres
Publié: (2026)
LongInsightBench: A Comprehensive Benchmark for Evaluating Omni-Modal Models on Human-Centric Long-Video Understanding
par: Han, ZhaoYang, et autres
Publié: (2025)
par: Han, ZhaoYang, et autres
Publié: (2025)
Hallucination Localization in Video Captioning
par: Nakada, Shota, et autres
Publié: (2025)
par: Nakada, Shota, et autres
Publié: (2025)
RealBench: A Chinese Multi-image Understanding Benchmark Close to Real-world Scenarios
par: Zhao, Fei, et autres
Publié: (2025)
par: Zhao, Fei, et autres
Publié: (2025)
TCC-Bench: Benchmarking the Traditional Chinese Culture Understanding Capabilities of MLLMs
par: Xu, Pengju, et autres
Publié: (2025)
par: Xu, Pengju, et autres
Publié: (2025)
Multi-Scale and Detail-Enhanced Segment Anything Model for Salient Object Detection
par: Gao, Shixuan, et autres
Publié: (2024)
par: Gao, Shixuan, et autres
Publié: (2024)
MedReasoner: Reinforcement Learning Drives Reasoning Grounding from Clinical Thought to Pixel-Level Precision
par: Yan, Zhonghao, et autres
Publié: (2025)
par: Yan, Zhonghao, et autres
Publié: (2025)
Q-Bench: A Benchmark for General-Purpose Foundation Models on Low-level Vision
par: Wu, Haoning, et autres
Publié: (2023)
par: Wu, Haoning, et autres
Publié: (2023)
Entropy-Adaptive Fine-Tuning: Resolving Confident Conflicts to Mitigate Forgetting
par: Diao, Muxi, et autres
Publié: (2026)
par: Diao, Muxi, et autres
Publié: (2026)
HKD4VLM: A Progressive Hybrid Knowledge Distillation Framework for Robust Multimodal Hallucination and Factuality Detection in VLMs
par: Zhang, Zijian, et autres
Publié: (2025)
par: Zhang, Zijian, et autres
Publié: (2025)
Dental-TriageBench: Benchmarking Multimodal Reasoning for Hierarchical Dental Triage
par: He, Ziyi, et autres
Publié: (2026)
par: He, Ziyi, et autres
Publié: (2026)
VC-Bench: Pioneering the Video Connecting Benchmark with a Dataset and Evaluation Metrics
par: Yin, Zhiyu, et autres
Publié: (2026)
par: Yin, Zhiyu, et autres
Publié: (2026)
PolySmart @ TRECVid 2024 Video Captioning (VTT)
par: Wu, Jiaxin, et autres
Publié: (2024)
par: Wu, Jiaxin, et autres
Publié: (2024)
Towards Universal Modal Tracking with Online Dense Temporal Token Learning
par: Zheng, Yaozong, et autres
Publié: (2025)
par: Zheng, Yaozong, et autres
Publié: (2025)
RO-Bench: Large-scale robustness evaluation of MLLMs with text-driven counterfactual videos
par: Yang, Zixi, et autres
Publié: (2025)
par: Yang, Zixi, et autres
Publié: (2025)
Implicit Location-Caption Alignment via Complementary Masking for Weakly-Supervised Dense Video Captioning
par: Ge, Shiping, et autres
Publié: (2024)
par: Ge, Shiping, et autres
Publié: (2024)
HAIC: Improving Human Action Understanding and Generation with Better Captions for Multi-modal Large Language Models
par: Wang, Xiao, et autres
Publié: (2025)
par: Wang, Xiao, et autres
Publié: (2025)
DIBS: Enhancing Dense Video Captioning with Unlabeled Videos via Pseudo Boundary Enrichment and Online Refinement
par: Wu, Hao, et autres
Publié: (2024)
par: Wu, Hao, et autres
Publié: (2024)
Video-Mediated Emotion Disclosure: Expressions of Fear, Sadness, and Joy by People with Schizophrenia on YouTube
par: Liu, Jiaying Lizzy, et autres
Publié: (2025)
par: Liu, Jiaying Lizzy, et autres
Publié: (2025)
PetalView: Fine-grained Location and Orientation Extraction of Street-view Images via Cross-view Local Search with Supplementary Materials
par: Hu, Wenmiao, et autres
Publié: (2024)
par: Hu, Wenmiao, et autres
Publié: (2024)
Differentiable JPEG: The Devil is in the Details
par: Reich, Christoph, et autres
Publié: (2023)
par: Reich, Christoph, et autres
Publié: (2023)
VDC-Agent: When Video Detailed Captioners Evolve Themselves via Agentic Self-Reflection
par: Wang, Qiang, et autres
Publié: (2025)
par: Wang, Qiang, et autres
Publié: (2025)
PaveBench: A Versatile Benchmark for Pavement Distress Perception and Interactive Vision-Language Analysis
par: Li, Dexiang, et autres
Publié: (2026)
par: Li, Dexiang, et autres
Publié: (2026)
LoginMEA: Local-to-Global Interaction Network for Multi-modal Entity Alignment
par: Su, Taoyu, et autres
Publié: (2024)
par: Su, Taoyu, et autres
Publié: (2024)
Benchmarking and Improving LVLMs on Event Extraction from Multimedia Documents
par: Xing, Fuyu, et autres
Publié: (2025)
par: Xing, Fuyu, et autres
Publié: (2025)
Edit As You Wish: Video Caption Editing with Multi-grained User Control
par: Yao, Linli, et autres
Publié: (2023)
par: Yao, Linli, et autres
Publié: (2023)
Less for More: Enhanced Feedback-aligned Mixed LLMs for Molecule Caption Generation and Fine-Grained NLI Evaluation
par: Gkoumas, Dimitris, et autres
Publié: (2024)
par: Gkoumas, Dimitris, et autres
Publié: (2024)
Long Video Diffusion Generation with Segmented Cross-Attention and Content-Rich Video Data Curation
par: Yan, Xin, et autres
Publié: (2024)
par: Yan, Xin, et autres
Publié: (2024)
TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos
par: Kong, Fanheng, et autres
Publié: (2025)
par: Kong, Fanheng, et autres
Publié: (2025)
ESG-Net: Event-Aware Semantic Guided Network for Dense Audio-Visual Event Localization
par: Li, Huilai, et autres
Publié: (2025)
par: Li, Huilai, et autres
Publié: (2025)
See or Guess: Counterfactually Regularized Image Captioning
par: Cao, Qian, et autres
Publié: (2024)
par: Cao, Qian, et autres
Publié: (2024)
DeepfakeBench-MM: A Comprehensive Benchmark for Multimodal Deepfake Detection
par: Zhao, Kangran, et autres
Publié: (2025)
par: Zhao, Kangran, et autres
Publié: (2025)
EgoEsportsQA: An Egocentric Video Benchmark for Perception and Reasoning in Esports
par: Ma, Jianzhe, et autres
Publié: (2026)
par: Ma, Jianzhe, et autres
Publié: (2026)
Human-Machine Collaboration-Guided Space Design: Combination of Machine Learning Models and Humanistic Design Concepts
par: Yang, Yuxuan
Publié: (2025)
par: Yang, Yuxuan
Publié: (2025)
SIN-Bench: Tracing Native Evidence Chains in Long-Context Multimodal Scientific Interleaved Literature
par: Ren, Yiming, et autres
Publié: (2026)
par: Ren, Yiming, et autres
Publié: (2026)
Documents similaires
-
CineTechBench: A Benchmark for Cinematographic Technique Understanding and Generation
par: Wang, Xinran, et autres
Publié: (2025) -
Harnessing Caption Detailness for Data-Efficient Text-to-Image Generation
par: Wang, Xinran, et autres
Publié: (2025) -
From Simple to Professional: A Combinatorial Controllable Image Captioning Agent
par: Wang, Xinran, et autres
Publié: (2024) -
Omni-Captioner: Data Pipeline, Models, and Benchmark for Omni Detailed Perception
par: Ma, Ziyang, et autres
Publié: (2025) -
Mitigating Image Captioning Hallucinations in Vision-Language Models
par: Zhao, Fei, et autres
Publié: (2025)