HERBench: A Benchmark for Multi-Evidence Integration in Video Question Answering
Fuente:
arXiv
Saved in:
| Main Authors: | Ben-Ami, Dan, Serussi, Gabriele, Cohen, Kobi, Baskin, Chaim |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering
by: Ben-Ami, Dan, et al.
Published: (2026)
by: Ben-Ami, Dan, et al.
Published: (2026)
TEAM PILOT -- Learned Feasible Extendable Set of Dynamic MRI Acquisition Trajectories
by: Shor, Tamir, et al.
Published: (2024)
by: Shor, Tamir, et al.
Published: (2024)
Leveraging Latents for Efficient Thermography Classification and Segmentation
by: Shor, Tamir, et al.
Published: (2024)
by: Shor, Tamir, et al.
Published: (2024)
T1-PILOT: Optimized Trajectories for T1 Mapping Acceleration
by: Shor, Tamir, et al.
Published: (2025)
by: Shor, Tamir, et al.
Published: (2025)
Unifying Image Processing as Visual Prompting Question Answering
by: Liu, Yihao, et al.
Published: (2023)
by: Liu, Yihao, et al.
Published: (2023)
VideoQA-SC: Adaptive Semantic Communication for Video Question Answering
by: Guo, Jiangyuan, et al.
Published: (2024)
by: Guo, Jiangyuan, et al.
Published: (2024)
Goal-Oriented Semantic Communication for Wireless Visual Question Answering
by: Liu, Sige, et al.
Published: (2024)
by: Liu, Sige, et al.
Published: (2024)
GameScope: A Multi-Attribute, Multi-Codec Benchmark Dataset for Gaming Video Quality Assessment
by: Sureddi, Rajesh, et al.
Published: (2026)
by: Sureddi, Rajesh, et al.
Published: (2026)
Visual Question Answering in Ophthalmology: A Progressive and Practical Perspective
by: Chen, Xiaolan, et al.
Published: (2024)
by: Chen, Xiaolan, et al.
Published: (2024)
A Coding Framework and Benchmark towards Low-Bitrate Video Understanding
by: Tian, Yuan, et al.
Published: (2022)
by: Tian, Yuan, et al.
Published: (2022)
Segment Anything in Medical Images and Videos: Benchmark and Deployment
by: Ma, Jun, et al.
Published: (2024)
by: Ma, Jun, et al.
Published: (2024)
MSSIDD: A Benchmark for Multi-Sensor Denoising
by: Mei, Shibin, et al.
Published: (2024)
by: Mei, Shibin, et al.
Published: (2024)
USTC-TD: A Test Dataset and Benchmark for Image and Video Coding in 2020s
by: Li, Zhuoyuan, et al.
Published: (2024)
by: Li, Zhuoyuan, et al.
Published: (2024)
3DGS-VBench: A Comprehensive Video Quality Evaluation Benchmark for 3DGS Compression
by: Xing, Yuke, et al.
Published: (2025)
by: Xing, Yuke, et al.
Published: (2025)
A Multi-annotated and Multi-modal Dataset for Wide-angle Video Quality Assessment
by: Hu, Bo, et al.
Published: (2025)
by: Hu, Bo, et al.
Published: (2025)
SR+Codec: a Benchmark of Super-Resolution for Video Compression Bitrate Reduction
by: Bogatyrev, Evgeney, et al.
Published: (2023)
by: Bogatyrev, Evgeney, et al.
Published: (2023)
Efficient Bilinear Attention-based Fusion for Medical Visual Question Answering
by: Zhang, Zhilin, et al.
Published: (2024)
by: Zhang, Zhilin, et al.
Published: (2024)
A Temporal Convolutional Network-Based Approach and a Benchmark Dataset for Colonoscopy Video Temporal Segmentation
by: Biffi, Carlo, et al.
Published: (2025)
by: Biffi, Carlo, et al.
Published: (2025)
A-Eval: A Benchmark for Cross-Dataset Evaluation of Abdominal Multi-Organ Segmentation
by: Huang, Ziyan, et al.
Published: (2023)
by: Huang, Ziyan, et al.
Published: (2023)
A Clinical Benchmark of Public Self-Supervised Pathology Foundation Models
by: Campanella, Gabriele, et al.
Published: (2024)
by: Campanella, Gabriele, et al.
Published: (2024)
Towards a Benchmark for Colorectal Cancer Segmentation in Endorectal Ultrasound Videos: Dataset and Model Development
by: Jiang, Yuncheng, et al.
Published: (2024)
by: Jiang, Yuncheng, et al.
Published: (2024)
3D Multi-frame Fusion for Video Stabilization
by: Peng, Zhan, et al.
Published: (2024)
by: Peng, Zhan, et al.
Published: (2024)
BVI-CR: A Multi-View Human Dataset for Volumetric Video Compression
by: Gao, Ge, et al.
Published: (2024)
by: Gao, Ge, et al.
Published: (2024)
RAM-W600: A Multi-Task Wrist Dataset and Benchmark for Rheumatoid Arthritis
by: Yang, Songxiao, et al.
Published: (2025)
by: Yang, Songxiao, et al.
Published: (2025)
Semantic and Temporal Integration in Latent Diffusion Space for High-Fidelity Video Super-Resolution
by: Wang, Yiwen, et al.
Published: (2025)
by: Wang, Yiwen, et al.
Published: (2025)
Spatial-Temporal Multi-level Association for Video Object Segmentation
by: Miao, Deshui, et al.
Published: (2024)
by: Miao, Deshui, et al.
Published: (2024)
Multi-Class Abnormality Classification Task in Video Capsule Endoscopy
by: Verma, Dev Rishi, et al.
Published: (2024)
by: Verma, Dev Rishi, et al.
Published: (2024)
ViTaL: A Multimodality Dataset and Benchmark for Multi-pathological Ovarian Tumor Recognition
by: Zhou, You, et al.
Published: (2025)
by: Zhou, You, et al.
Published: (2025)
SAR-RAG: ATR Visual Question Answering by Semantic Search, Retrieval, and MLLM Generation
by: Ramirez, David F., et al.
Published: (2026)
by: Ramirez, David F., et al.
Published: (2026)
Benchmarking of Deep Learning Methods for Generic MRI Multi-Organ Abdominal Segmentation
by: Krishnaswamy, Deepa, et al.
Published: (2025)
by: Krishnaswamy, Deepa, et al.
Published: (2025)
Generative Human Video Compression with Multi-granularity Temporal Trajectory Factorization
by: Yin, Shanzhi, et al.
Published: (2024)
by: Yin, Shanzhi, et al.
Published: (2024)
MGFI-Net: A Multi-Grained Feature Integration Network for Enhanced Medical Image Segmentation
by: Zeng, Yucheng
Published: (2025)
by: Zeng, Yucheng
Published: (2025)
Towards a Large Language-Vision Question Answering Model for MSTAR Automatic Target Recognition
by: Ramirez, David F., et al.
Published: (2026)
by: Ramirez, David F., et al.
Published: (2026)
External Benchmarking of Lung Ultrasound Models for Pneumothorax-Related Signs: A Manifest-Based Multi-Source Study
by: Ishikawa, Takehiro
Published: (2026)
by: Ishikawa, Takehiro
Published: (2026)
Advancing Video Anomaly Detection: A Bi-Directional Hybrid Framework for Enhanced Single- and Multi-Task Approaches
by: Shen, Guodong, et al.
Published: (2025)
by: Shen, Guodong, et al.
Published: (2025)
Benchmarking Ophthalmology Foundation Models for Clinically Significant Age Macular Degeneration Detection
by: Cohen, Benjamin A., et al.
Published: (2025)
by: Cohen, Benjamin A., et al.
Published: (2025)
Unified Multi-Modal Image Synthesis for Missing Modality Imputation
by: Zhang, Yue, et al.
Published: (2023)
by: Zhang, Yue, et al.
Published: (2023)
BVI-VFI: A Video Quality Database for Video Frame Interpolation
by: Danier, Duolikun, et al.
Published: (2022)
by: Danier, Duolikun, et al.
Published: (2022)
Reconstruction Interval Z-Phase Dependence of AI Detection Sensitivity in CT Lung Nodule Screening
by: Soliman, Dan
Published: (2026)
by: Soliman, Dan
Published: (2026)
Benchmarking Conventional and Learned Video Codecs with a Low-Delay Configuration
by: Teng, Siyue, et al.
Published: (2024)
by: Teng, Siyue, et al.
Published: (2024)
Similar Items
-
HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering
by: Ben-Ami, Dan, et al.
Published: (2026) -
TEAM PILOT -- Learned Feasible Extendable Set of Dynamic MRI Acquisition Trajectories
by: Shor, Tamir, et al.
Published: (2024) -
Leveraging Latents for Efficient Thermography Classification and Segmentation
by: Shor, Tamir, et al.
Published: (2024) -
T1-PILOT: Optimized Trajectories for T1 Mapping Acceleration
by: Shor, Tamir, et al.
Published: (2025) -
Unifying Image Processing as Visual Prompting Question Answering
by: Liu, Yihao, et al.
Published: (2023)