Multi-object event graph representation learning for Video Question Answering
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wang, Yanan, Haruta, Shuichiro, Zeng, Donghuo, Vizcarra, Julio, Kurokawa, Mori |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Top-down Activity Representation Learning for Video Question Answering
von: Wang, Yanan, et al.
Veröffentlicht: (2024)
von: Wang, Yanan, et al.
Veröffentlicht: (2024)
CoTasks: Chain-of-Thought based Video Instruction Tuning Tasks
von: Wang, Yanan, et al.
Veröffentlicht: (2025)
von: Wang, Yanan, et al.
Veröffentlicht: (2025)
Overview of the NLPCC 2025 Shared Task 4: Multi-modal, Multilingual, and Multi-hop Medical Instructional Video Question Answering Challenge
von: Li, Bin, et al.
Veröffentlicht: (2025)
von: Li, Bin, et al.
Veröffentlicht: (2025)
Weakly Supervised Gaussian Contrastive Grounding with Large Multimodal Models for Video Question Answering
von: Wang, Haibo, et al.
Veröffentlicht: (2024)
von: Wang, Haibo, et al.
Veröffentlicht: (2024)
Synthetic Document Question Answering in Hungarian
von: Li, Jonathan, et al.
Veröffentlicht: (2025)
von: Li, Jonathan, et al.
Veröffentlicht: (2025)
TraveLER: A Modular Multi-LMM Agent Framework for Video Question-Answering
von: Shang, Chuyi, et al.
Veröffentlicht: (2024)
von: Shang, Chuyi, et al.
Veröffentlicht: (2024)
Hallucination Benchmark in Medical Visual Question Answering
von: Wu, Jinge, et al.
Veröffentlicht: (2024)
von: Wu, Jinge, et al.
Veröffentlicht: (2024)
Self-Adaptive Sampling for Efficient Video Question-Answering on Image--Text Models
von: Han, Wei, et al.
Veröffentlicht: (2023)
von: Han, Wei, et al.
Veröffentlicht: (2023)
SIMPLOT: Enhancing Chart Question Answering by Distilling Essentials
von: Kim, Wonjoong, et al.
Veröffentlicht: (2024)
von: Kim, Wonjoong, et al.
Veröffentlicht: (2024)
LOVA3: Learning to Visual Question Answering, Asking and Assessment
von: Zhao, Henry Hengyuan, et al.
Veröffentlicht: (2024)
von: Zhao, Henry Hengyuan, et al.
Veröffentlicht: (2024)
SPIQA: A Dataset for Multimodal Question Answering on Scientific Papers
von: Pramanick, Shraman, et al.
Veröffentlicht: (2024)
von: Pramanick, Shraman, et al.
Veröffentlicht: (2024)
SMILE: A Composite Lexical-Semantic Metric for Question-Answering Evaluation
von: Kendre, Shrikant, et al.
Veröffentlicht: (2025)
von: Kendre, Shrikant, et al.
Veröffentlicht: (2025)
Dynamic Clue Bottlenecks: Towards Interpretable-by-Design Visual Question Answering
von: Fu, Xingyu, et al.
Veröffentlicht: (2023)
von: Fu, Xingyu, et al.
Veröffentlicht: (2023)
An Image Grid Can Be Worth a Video: Zero-shot Video Question Answering Using a VLM
von: Kim, Wonkyun, et al.
Veröffentlicht: (2024)
von: Kim, Wonkyun, et al.
Veröffentlicht: (2024)
Adversarial Attacks on VQA-NLE: Exposing and Alleviating Inconsistencies in Visual Question Answering Explanations
von: Yeh, Yahsin, et al.
Veröffentlicht: (2025)
von: Yeh, Yahsin, et al.
Veröffentlicht: (2025)
UCSF-PDGM-VQA: Visual Question Answering dataset for brain tumor MRI interpretation
von: Ghosh, Shiv, et al.
Veröffentlicht: (2026)
von: Ghosh, Shiv, et al.
Veröffentlicht: (2026)
ChartInsights: Evaluating Multimodal Large Language Models for Low-Level Chart Question Answering
von: Wu, Yifan, et al.
Veröffentlicht: (2024)
von: Wu, Yifan, et al.
Veröffentlicht: (2024)
DermaBench: A Clinician-Annotated Benchmark Dataset for Dermatology Visual Question Answering and Reasoning
von: Yilmaz, Abdurrahim, et al.
Veröffentlicht: (2026)
von: Yilmaz, Abdurrahim, et al.
Veröffentlicht: (2026)
QA-Dragon: Query-Aware Dynamic RAG System for Knowledge-Intensive Visual Question Answering
von: Jiang, Zhuohang, et al.
Veröffentlicht: (2025)
von: Jiang, Zhuohang, et al.
Veröffentlicht: (2025)
WorldCuisines: A Massive-Scale Benchmark for Multilingual and Multicultural Visual Question Answering on Global Cuisines
von: Winata, Genta Indra, et al.
Veröffentlicht: (2024)
von: Winata, Genta Indra, et al.
Veröffentlicht: (2024)
Exploring Diverse Methods in Visual Question Answering
von: Li, Panfeng, et al.
Veröffentlicht: (2024)
von: Li, Panfeng, et al.
Veröffentlicht: (2024)
Towards Visual-Prompt Temporal Answering Grounding in Medical Instructional Video
von: Li, Bin, et al.
Veröffentlicht: (2022)
von: Li, Bin, et al.
Veröffentlicht: (2022)
RadImageNet-VQA: A Large-Scale CT and MRI Dataset for Radiologic Visual Question Answering
von: Butsanets, Léo, et al.
Veröffentlicht: (2025)
von: Butsanets, Léo, et al.
Veröffentlicht: (2025)
ReAG: Reasoning-Augmented Generation for Knowledge-based Visual Question Answering
von: Compagnoni, Alberto, et al.
Veröffentlicht: (2025)
von: Compagnoni, Alberto, et al.
Veröffentlicht: (2025)
POLYCHARTQA: Benchmarking Large Vision-Language Models with Multilingual Chart Question Answering
von: Xu, Yichen, et al.
Veröffentlicht: (2025)
von: Xu, Yichen, et al.
Veröffentlicht: (2025)
FIQ: Fundamental Question Generation with the Integration of Question Embeddings for Video Question Answering
von: Oh, Ju-Young, et al.
Veröffentlicht: (2025)
von: Oh, Ju-Young, et al.
Veröffentlicht: (2025)
MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering
von: Dang, Jisheng, et al.
Veröffentlicht: (2025)
von: Dang, Jisheng, et al.
Veröffentlicht: (2025)
Augmenting Multimodal LLMs with Self-Reflective Tokens for Knowledge-based Visual Question Answering
von: Cocchi, Federico, et al.
Veröffentlicht: (2024)
von: Cocchi, Federico, et al.
Veröffentlicht: (2024)
FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering
von: Huang, Chengyue, et al.
Veröffentlicht: (2025)
von: Huang, Chengyue, et al.
Veröffentlicht: (2025)
MMToM-QA: Multimodal Theory of Mind Question Answering
von: Jin, Chuanyang, et al.
Veröffentlicht: (2024)
von: Jin, Chuanyang, et al.
Veröffentlicht: (2024)
CVQA: Culturally-diverse Multilingual Visual Question Answering Benchmark
von: Romero, David, et al.
Veröffentlicht: (2024)
von: Romero, David, et al.
Veröffentlicht: (2024)
Find The Gap: Knowledge Base Reasoning For Visual Question Answering
von: Barezi, Elham J., et al.
Veröffentlicht: (2024)
von: Barezi, Elham J., et al.
Veröffentlicht: (2024)
Federated Document Visual Question Answering: A Pilot Study
von: Nguyen, Khanh, et al.
Veröffentlicht: (2024)
von: Nguyen, Khanh, et al.
Veröffentlicht: (2024)
DermaVQA-DAS: Dermatology Assessment Schema (DAS) & Datasets for Closed-Ended Question Answering & Segmentation in Patient-Generated Dermatology Images
von: Yim, Wen-wai, et al.
Veröffentlicht: (2025)
von: Yim, Wen-wai, et al.
Veröffentlicht: (2025)
Question-Answering Dense Video Events
von: Qin, Hangyu, et al.
Veröffentlicht: (2024)
von: Qin, Hangyu, et al.
Veröffentlicht: (2024)
Hierarchical Semantic Correlation-Aware Masked Autoencoder for Unsupervised Audio-Visual Representation Learning
von: Zeng, Donghuo, et al.
Veröffentlicht: (2026)
von: Zeng, Donghuo, et al.
Veröffentlicht: (2026)
Learning Question-Aware Keyframe Selection with Synthetic Supervision for Video Question Answering
von: Kwon, Minchan, et al.
Veröffentlicht: (2026)
von: Kwon, Minchan, et al.
Veröffentlicht: (2026)
When Big Models Train Small Ones: Label-Free Model Parity Alignment for Efficient Visual Question Answering using Small VLMs
von: Penamakuri, Abhirama Subramanyam, et al.
Veröffentlicht: (2025)
von: Penamakuri, Abhirama Subramanyam, et al.
Veröffentlicht: (2025)
Meta-Adaptive Prompt Distillation for Few-Shot Visual Question Answering
von: Gupta, Akash, et al.
Veröffentlicht: (2025)
von: Gupta, Akash, et al.
Veröffentlicht: (2025)
Beyond Single Plots: A Benchmark for Question Answering on Multi-Charts
von: Efat, Azher Ahmed, et al.
Veröffentlicht: (2026)
von: Efat, Azher Ahmed, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Top-down Activity Representation Learning for Video Question Answering
von: Wang, Yanan, et al.
Veröffentlicht: (2024) -
CoTasks: Chain-of-Thought based Video Instruction Tuning Tasks
von: Wang, Yanan, et al.
Veröffentlicht: (2025) -
Overview of the NLPCC 2025 Shared Task 4: Multi-modal, Multilingual, and Multi-hop Medical Instructional Video Question Answering Challenge
von: Li, Bin, et al.
Veröffentlicht: (2025) -
Weakly Supervised Gaussian Contrastive Grounding with Large Multimodal Models for Video Question Answering
von: Wang, Haibo, et al.
Veröffentlicht: (2024) -
Synthetic Document Question Answering in Hungarian
von: Li, Jonathan, et al.
Veröffentlicht: (2025)