DiffCap-Bench: A Comprehensive, Challenging, Robust Benchmark for Image Difference Captioning
Fuente:
arXiv
Salvato in:
| Autori principali: | Wei, Yuancheng, Zhang, Haojie, Yao, Linli, Li, Lei, Chen, Jiali, Huang, Tao, Lu, Yiting, Huang, Duojun, Li, Xin, Zhong, Zhao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Video Understanding Reward Modeling: A Robust Benchmark and Performant Reward Models
di: Wei, Yuancheng, et al.
Pubblicazione: (2026)
di: Wei, Yuancheng, et al.
Pubblicazione: (2026)
VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation
di: Zhang, Shi-Xue, et al.
Pubblicazione: (2025)
di: Zhang, Shi-Xue, et al.
Pubblicazione: (2025)
OmniDiff: A Comprehensive Benchmark for Fine-grained Image Difference Captioning
di: Liu, Yuan, et al.
Pubblicazione: (2025)
di: Liu, Yuan, et al.
Pubblicazione: (2025)
DiffCap: Diffusion-based Real-time Human Motion Capture using Sparse IMUs and a Monocular Camera
di: Pan, Shaohua, et al.
Pubblicazione: (2025)
di: Pan, Shaohua, et al.
Pubblicazione: (2025)
VidCapBench: A Comprehensive Benchmark of Video Captioning for Controllable Text-to-Video Generation
di: Chen, Xinlong, et al.
Pubblicazione: (2025)
di: Chen, Xinlong, et al.
Pubblicazione: (2025)
The Solution for the CVPR2024 NICE Image Captioning Challenge
di: Huang, Longfei, et al.
Pubblicazione: (2024)
di: Huang, Longfei, et al.
Pubblicazione: (2024)
MolCap-Arena: A Comprehensive Captioning Benchmark on Language-Enhanced Molecular Property Prediction
di: Edwards, Carl, et al.
Pubblicazione: (2024)
di: Edwards, Carl, et al.
Pubblicazione: (2024)
FingerCap: Fine-grained Finger-level Hand Motion Captioning
di: Shen, Xin, et al.
Pubblicazione: (2025)
di: Shen, Xin, et al.
Pubblicazione: (2025)
OneDiff: A Generalist Model for Image Difference Captioning
di: Hu, Erdong, et al.
Pubblicazione: (2024)
di: Hu, Erdong, et al.
Pubblicazione: (2024)
CapArena: Benchmarking and Analyzing Detailed Image Captioning in the LLM Era
di: Cheng, Kanzhi, et al.
Pubblicazione: (2025)
di: Cheng, Kanzhi, et al.
Pubblicazione: (2025)
RubiCap: Rubric-Guided Reinforcement Learning for Dense Image Captioning
di: Huang, Tzu-Heng, et al.
Pubblicazione: (2026)
di: Huang, Tzu-Heng, et al.
Pubblicazione: (2026)
CaReBench: A Fine-Grained Benchmark for Video Captioning and Retrieval
di: Xu, Yifan, et al.
Pubblicazione: (2024)
di: Xu, Yifan, et al.
Pubblicazione: (2024)
TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions
di: Yao, Linli, et al.
Pubblicazione: (2026)
di: Yao, Linli, et al.
Pubblicazione: (2026)
OSS-Bench: Benchmark Generator for Coding LLMs
di: Jiang, Yuancheng, et al.
Pubblicazione: (2025)
di: Jiang, Yuancheng, et al.
Pubblicazione: (2025)
XMeCap: Meme Caption Generation with Sub-Image Adaptability
di: Chen, Yuyan, et al.
Pubblicazione: (2024)
di: Chen, Yuyan, et al.
Pubblicazione: (2024)
VL-RewardBench: A Challenging Benchmark for Vision-Language Generative Reward Models
di: Li, Lei, et al.
Pubblicazione: (2024)
di: Li, Lei, et al.
Pubblicazione: (2024)
PAI-Bench: A Comprehensive Benchmark For Physical AI
di: Zhou, Fengzhe, et al.
Pubblicazione: (2025)
di: Zhou, Fengzhe, et al.
Pubblicazione: (2025)
MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding
di: Wang, Fei, et al.
Pubblicazione: (2024)
di: Wang, Fei, et al.
Pubblicazione: (2024)
HalDec-Bench: Benchmarking Hallucination Detector in Image Captioning
di: Saito, Kuniaki, et al.
Pubblicazione: (2026)
di: Saito, Kuniaki, et al.
Pubblicazione: (2026)
HalDec-Bench: Benchmarking Hallucination Detector in Image Captioning
di: Saito, Kuniaki, et al.
Pubblicazione: (2025)
di: Saito, Kuniaki, et al.
Pubblicazione: (2025)
Diff-3DCap: Shape Captioning with Diffusion Models
di: Shu, Zhenyu, et al.
Pubblicazione: (2025)
di: Shu, Zhenyu, et al.
Pubblicazione: (2025)
Mementos: A Comprehensive Benchmark for Multimodal Large Language Model Reasoning over Image Sequences
di: Wang, Xiyao, et al.
Pubblicazione: (2024)
di: Wang, Xiyao, et al.
Pubblicazione: (2024)
MedCondDiff: Lightweight, Robust, Semantically Guided Diffusion for Medical Image Segmentation
di: Huang, Ruirui, et al.
Pubblicazione: (2025)
di: Huang, Ruirui, et al.
Pubblicazione: (2025)
T2I-ConBench: Text-to-Image Benchmark for Continual Post-training
di: Huang, Zhehao, et al.
Pubblicazione: (2025)
di: Huang, Zhehao, et al.
Pubblicazione: (2025)
TIR-Bench: A Comprehensive Benchmark for Agentic Thinking-with-Images Reasoning
di: Li, Ming, et al.
Pubblicazione: (2025)
di: Li, Ming, et al.
Pubblicazione: (2025)
Do Large Multimodal Models Solve Caption Generation for Scientific Figures? Lessons Learned from SciCap Challenge 2023
di: Hsu, Ting-Yao E., et al.
Pubblicazione: (2025)
di: Hsu, Ting-Yao E., et al.
Pubblicazione: (2025)
CapRL: Stimulating Dense Image Caption Capabilities via Reinforcement Learning
di: Xing, Long, et al.
Pubblicazione: (2025)
di: Xing, Long, et al.
Pubblicazione: (2025)
ScaleCap: Inference-Time Scalable Image Captioning via Dual-Modality Debiasing
di: Xing, Long, et al.
Pubblicazione: (2025)
di: Xing, Long, et al.
Pubblicazione: (2025)
ProCap: Projection-Aware Captioning for Spatial Augmented Reality
di: Cao, Zimo, et al.
Pubblicazione: (2026)
di: Cao, Zimo, et al.
Pubblicazione: (2026)
DetailVerifyBench: A Benchmark for Dense Hallucination Localization in Long Image Captions
di: Wang, Xinran, et al.
Pubblicazione: (2026)
di: Wang, Xinran, et al.
Pubblicazione: (2026)
FigCaps-HF: A Figure-to-Caption Generative Framework and Benchmark with Human Feedback
di: Singh, Ashish, et al.
Pubblicazione: (2023)
di: Singh, Ashish, et al.
Pubblicazione: (2023)
PediaBench: A Comprehensive Chinese Pediatric Dataset for Benchmarking Large Language Models
di: Zhang, Qian, et al.
Pubblicazione: (2024)
di: Zhang, Qian, et al.
Pubblicazione: (2024)
AudioCapBench: Quick Evaluation on Audio Captioning across Sound, Music, and Speech
di: Qiu, Jielin, et al.
Pubblicazione: (2026)
di: Qiu, Jielin, et al.
Pubblicazione: (2026)
WAVES: Benchmarking the Robustness of Image Watermarks
di: An, Bang, et al.
Pubblicazione: (2024)
di: An, Bang, et al.
Pubblicazione: (2024)
GIR-Bench: Versatile Benchmark for Generating Images with Reasoning
di: Li, Hongxiang, et al.
Pubblicazione: (2025)
di: Li, Hongxiang, et al.
Pubblicazione: (2025)
DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding
di: Wu, Hao, et al.
Pubblicazione: (2024)
di: Wu, Hao, et al.
Pubblicazione: (2024)
S2Cap: A Benchmark and a Baseline for Singing Style Captioning
di: Ok, Hyunjong, et al.
Pubblicazione: (2024)
di: Ok, Hyunjong, et al.
Pubblicazione: (2024)
VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking
di: Meng, Desen, et al.
Pubblicazione: (2025)
di: Meng, Desen, et al.
Pubblicazione: (2025)
Sentinel2Cap: A Human-Annotated Benchmark Dataset for Multimodal Remote Sensing Image Captioning
di: Tosato, Lucrezia, et al.
Pubblicazione: (2026)
di: Tosato, Lucrezia, et al.
Pubblicazione: (2026)
OwlCap: Harmonizing Motion-Detail for Video Captioning via HMD-270K and Caption Set Equivalence Reward
di: Zhong, Chunlin, et al.
Pubblicazione: (2025)
di: Zhong, Chunlin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Video Understanding Reward Modeling: A Robust Benchmark and Performant Reward Models
di: Wei, Yuancheng, et al.
Pubblicazione: (2026) -
VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation
di: Zhang, Shi-Xue, et al.
Pubblicazione: (2025) -
OmniDiff: A Comprehensive Benchmark for Fine-grained Image Difference Captioning
di: Liu, Yuan, et al.
Pubblicazione: (2025) -
DiffCap: Diffusion-based Real-time Human Motion Capture using Sparse IMUs and a Monocular Camera
di: Pan, Shaohua, et al.
Pubblicazione: (2025) -
VidCapBench: A Comprehensive Benchmark of Video Captioning for Controllable Text-to-Video Generation
di: Chen, Xinlong, et al.
Pubblicazione: (2025)