QEVA: A Reference-Free Evaluation Metric for Narrative Video Summarization with Multimodal Question Answering
Fuente:
arXiv
Guardado en:
| Autores principales: | Jung, Woojun, Kim, Junyeong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Visual Funnel: Resolving Contextual Blindness in Multimodal Large Language Models
por: Jung, Woojun, et al.
Publicado: (2025)
por: Jung, Woojun, et al.
Publicado: (2025)
FIQ: Fundamental Question Generation with the Integration of Question Embeddings for Video Question Answering
por: Oh, Ju-Young, et al.
Publicado: (2025)
por: Oh, Ju-Young, et al.
Publicado: (2025)
Learning Question-Aware Keyframe Selection with Synthetic Supervision for Video Question Answering
por: Kwon, Minchan, et al.
Publicado: (2026)
por: Kwon, Minchan, et al.
Publicado: (2026)
SMILE: A Composite Lexical-Semantic Metric for Question-Answering Evaluation
por: Kendre, Shrikant, et al.
Publicado: (2025)
por: Kendre, Shrikant, et al.
Publicado: (2025)
HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering
por: Ben-Ami, Dan, et al.
Publicado: (2026)
por: Ben-Ami, Dan, et al.
Publicado: (2026)
Personalized Video Summarization by Multimodal Video Understanding
por: Chen, Brian, et al.
Publicado: (2024)
por: Chen, Brian, et al.
Publicado: (2024)
CRAFT: Critic-Refined Adaptive Key-Frame Targeting for Multimodal Video Question Answering
por: Bhosale, Mahesh, et al.
Publicado: (2026)
por: Bhosale, Mahesh, et al.
Publicado: (2026)
SCRA-VQA: Summarized Caption-Rerank for Augmented Large Language Models in Visual Question Answering
por: Zhang, Yan, et al.
Publicado: (2025)
por: Zhang, Yan, et al.
Publicado: (2025)
FLEUR: An Explainable Reference-Free Evaluation Metric for Image Captioning Using a Large Multimodal Model
por: Lee, Yebin, et al.
Publicado: (2024)
por: Lee, Yebin, et al.
Publicado: (2024)
Free Form Medical Visual Question Answering in Radiology
por: Narayanan, Abhishek, et al.
Publicado: (2024)
por: Narayanan, Abhishek, et al.
Publicado: (2024)
Question-Answering Dense Video Events
por: Qin, Hangyu, et al.
Publicado: (2024)
por: Qin, Hangyu, et al.
Publicado: (2024)
EgoCross: Benchmarking Multimodal Large Language Models for Cross-Domain Egocentric Video Question Answering
por: Li, Yanjun, et al.
Publicado: (2025)
por: Li, Yanjun, et al.
Publicado: (2025)
MA-EgoQA: Question Answering over Egocentric Videos from Multiple Embodied Agents
por: Kim, Kangsan, et al.
Publicado: (2026)
por: Kim, Kangsan, et al.
Publicado: (2026)
Weakly Supervised Gaussian Contrastive Grounding with Large Multimodal Models for Video Question Answering
por: Wang, Haibo, et al.
Publicado: (2024)
por: Wang, Haibo, et al.
Publicado: (2024)
Learning Trimodal Relation for Audio-Visual Question Answering with Missing Modality
por: Park, Kyu Ri, et al.
Publicado: (2024)
por: Park, Kyu Ri, et al.
Publicado: (2024)
Commonsense Video Question Answering through Video-Grounded Entailment Tree Reasoning
por: Liu, Huabin, et al.
Publicado: (2025)
por: Liu, Huabin, et al.
Publicado: (2025)
Semantic Event Graphs for Long-Form Video Question Answering
por: Dixit, Aradhya, et al.
Publicado: (2026)
por: Dixit, Aradhya, et al.
Publicado: (2026)
Explicit Abstention Knobs for Predictable Reliability in Video Question Answering
por: Ortiz, Jorge
Publicado: (2025)
por: Ortiz, Jorge
Publicado: (2025)
Uncertainty-Guided Self-Questioning and Answering for Video-Language Alignment
por: Chen, Jin, et al.
Publicado: (2024)
por: Chen, Jin, et al.
Publicado: (2024)
CogStream: Context-guided Streaming Video Question Answering
por: Zhao, Zicheng, et al.
Publicado: (2025)
por: Zhao, Zicheng, et al.
Publicado: (2025)
VQA$^2$: Visual Question Answering for Video Quality Assessment
por: Jia, Ziheng, et al.
Publicado: (2024)
por: Jia, Ziheng, et al.
Publicado: (2024)
InfoChartQA: A Benchmark for Multimodal Question Answering on Infographic Charts
por: Xie, Tianchi, et al.
Publicado: (2025)
por: Xie, Tianchi, et al.
Publicado: (2025)
Warehouse Spatial Question Answering with LLM Agent
por: Huang, Hsiang-Wei, et al.
Publicado: (2025)
por: Huang, Hsiang-Wei, et al.
Publicado: (2025)
Progressive Multimodal Search and Reasoning for Knowledge-Intensive Visual Question Answering
por: Choi, Changin, et al.
Publicado: (2025)
por: Choi, Changin, et al.
Publicado: (2025)
SPIQA: A Dataset for Multimodal Question Answering on Scientific Papers
por: Pramanick, Shraman, et al.
Publicado: (2024)
por: Pramanick, Shraman, et al.
Publicado: (2024)
Enhancing Long Video Question Answering with Scene-Localized Frame Grouping
por: Yang, Xuyi, et al.
Publicado: (2025)
por: Yang, Xuyi, et al.
Publicado: (2025)
Encoding and Controlling Global Semantics for Long-form Video Question Answering
por: Nguyen, Thong Thanh, et al.
Publicado: (2024)
por: Nguyen, Thong Thanh, et al.
Publicado: (2024)
Advancing Egocentric Video Question Answering with Multimodal Large Language Models
por: Patel, Alkesh, et al.
Publicado: (2025)
por: Patel, Alkesh, et al.
Publicado: (2025)
Ego-Grounding for Personalized Question-Answering in Egocentric Videos
por: Xiao, Junbin, et al.
Publicado: (2026)
por: Xiao, Junbin, et al.
Publicado: (2026)
STREAM: Spatio-TempoRal Evaluation and Analysis Metric for Video Generative Models
por: Kim, Pum Jun, et al.
Publicado: (2024)
por: Kim, Pum Jun, et al.
Publicado: (2024)
Evaluating Image Hallucination in Text-to-Image Generation with Question-Answering
por: Lim, Youngsun, et al.
Publicado: (2024)
por: Lim, Youngsun, et al.
Publicado: (2024)
ChartInsights: Evaluating Multimodal Large Language Models for Low-Level Chart Question Answering
por: Wu, Yifan, et al.
Publicado: (2024)
por: Wu, Yifan, et al.
Publicado: (2024)
LCV2: An Efficient Pretraining-Free Framework for Grounded Visual Question Answering
por: Chen, Yuhan, et al.
Publicado: (2024)
por: Chen, Yuhan, et al.
Publicado: (2024)
UpstreamQA: A Modular Framework for Explicit Reasoning on Video Question Answering Tasks
por: Nguyen, Jason, et al.
Publicado: (2026)
por: Nguyen, Jason, et al.
Publicado: (2026)
Foundation Models and Adaptive Feature Selection: A Synergistic Approach to Video Question Answering
por: Rongali, Sai Bhargav, et al.
Publicado: (2024)
por: Rongali, Sai Bhargav, et al.
Publicado: (2024)
Unlocking Financial Insights: An advanced Multimodal Summarization with Multimodal Output Framework for Financial Advisory Videos
por: Das, Sarmistha, et al.
Publicado: (2025)
por: Das, Sarmistha, et al.
Publicado: (2025)
WaymoQA: A Multi-View Visual Question Answering Dataset for Safety-Critical Reasoning in Autonomous Driving
por: Yu, Seungjun, et al.
Publicado: (2025)
por: Yu, Seungjun, et al.
Publicado: (2025)
MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering
por: Dang, Jisheng, et al.
Publicado: (2025)
por: Dang, Jisheng, et al.
Publicado: (2025)
Towards Fine-Grained Video Question Answering
por: Dai, Wei, et al.
Publicado: (2025)
por: Dai, Wei, et al.
Publicado: (2025)
Instruction-tuned Self-Questioning Framework for Multimodal Reasoning
por: Jang, You-Won, et al.
Publicado: (2025)
por: Jang, You-Won, et al.
Publicado: (2025)
Ejemplares similares
-
Visual Funnel: Resolving Contextual Blindness in Multimodal Large Language Models
por: Jung, Woojun, et al.
Publicado: (2025) -
FIQ: Fundamental Question Generation with the Integration of Question Embeddings for Video Question Answering
por: Oh, Ju-Young, et al.
Publicado: (2025) -
Learning Question-Aware Keyframe Selection with Synthetic Supervision for Video Question Answering
por: Kwon, Minchan, et al.
Publicado: (2026) -
SMILE: A Composite Lexical-Semantic Metric for Question-Answering Evaluation
por: Kendre, Shrikant, et al.
Publicado: (2025) -
HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering
por: Ben-Ami, Dan, et al.
Publicado: (2026)