Top-down Activity Representation Learning for Video Question Answering
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Yanan, Haruta, Shuichiro, Zeng, Donghuo, Vizcarra, Julio, Kurokawa, Mori |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Multi-object event graph representation learning for Video Question Answering
por: Wang, Yanan, et al.
Publicado: (2024)
por: Wang, Yanan, et al.
Publicado: (2024)
CoTasks: Chain-of-Thought based Video Instruction Tuning Tasks
por: Wang, Yanan, et al.
Publicado: (2025)
por: Wang, Yanan, et al.
Publicado: (2025)
Weakly Supervised Gaussian Contrastive Grounding with Large Multimodal Models for Video Question Answering
por: Wang, Haibo, et al.
Publicado: (2024)
por: Wang, Haibo, et al.
Publicado: (2024)
Hierarchical Semantic Correlation-Aware Masked Autoencoder for Unsupervised Audio-Visual Representation Learning
por: Zeng, Donghuo, et al.
Publicado: (2026)
por: Zeng, Donghuo, et al.
Publicado: (2026)
LOVA3: Learning to Visual Question Answering, Asking and Assessment
por: Zhao, Henry Hengyuan, et al.
Publicado: (2024)
por: Zhao, Henry Hengyuan, et al.
Publicado: (2024)
Synthetic Document Question Answering in Hungarian
por: Li, Jonathan, et al.
Publicado: (2025)
por: Li, Jonathan, et al.
Publicado: (2025)
Hallucination Benchmark in Medical Visual Question Answering
por: Wu, Jinge, et al.
Publicado: (2024)
por: Wu, Jinge, et al.
Publicado: (2024)
Self-Adaptive Sampling for Efficient Video Question-Answering on Image--Text Models
por: Han, Wei, et al.
Publicado: (2023)
por: Han, Wei, et al.
Publicado: (2023)
SIMPLOT: Enhancing Chart Question Answering by Distilling Essentials
por: Kim, Wonjoong, et al.
Publicado: (2024)
por: Kim, Wonjoong, et al.
Publicado: (2024)
SPIQA: A Dataset for Multimodal Question Answering on Scientific Papers
por: Pramanick, Shraman, et al.
Publicado: (2024)
por: Pramanick, Shraman, et al.
Publicado: (2024)
Overview of the NLPCC 2025 Shared Task 4: Multi-modal, Multilingual, and Multi-hop Medical Instructional Video Question Answering Challenge
por: Li, Bin, et al.
Publicado: (2025)
por: Li, Bin, et al.
Publicado: (2025)
SMILE: A Composite Lexical-Semantic Metric for Question-Answering Evaluation
por: Kendre, Shrikant, et al.
Publicado: (2025)
por: Kendre, Shrikant, et al.
Publicado: (2025)
Dynamic Clue Bottlenecks: Towards Interpretable-by-Design Visual Question Answering
por: Fu, Xingyu, et al.
Publicado: (2023)
por: Fu, Xingyu, et al.
Publicado: (2023)
ChartInsights: Evaluating Multimodal Large Language Models for Low-Level Chart Question Answering
por: Wu, Yifan, et al.
Publicado: (2024)
por: Wu, Yifan, et al.
Publicado: (2024)
TraveLER: A Modular Multi-LMM Agent Framework for Video Question-Answering
por: Shang, Chuyi, et al.
Publicado: (2024)
por: Shang, Chuyi, et al.
Publicado: (2024)
An Image Grid Can Be Worth a Video: Zero-shot Video Question Answering Using a VLM
por: Kim, Wonkyun, et al.
Publicado: (2024)
por: Kim, Wonkyun, et al.
Publicado: (2024)
Adversarial Attacks on VQA-NLE: Exposing and Alleviating Inconsistencies in Visual Question Answering Explanations
por: Yeh, Yahsin, et al.
Publicado: (2025)
por: Yeh, Yahsin, et al.
Publicado: (2025)
UCSF-PDGM-VQA: Visual Question Answering dataset for brain tumor MRI interpretation
por: Ghosh, Shiv, et al.
Publicado: (2026)
por: Ghosh, Shiv, et al.
Publicado: (2026)
Learning Question-Aware Keyframe Selection with Synthetic Supervision for Video Question Answering
por: Kwon, Minchan, et al.
Publicado: (2026)
por: Kwon, Minchan, et al.
Publicado: (2026)
POLYCHARTQA: Benchmarking Large Vision-Language Models with Multilingual Chart Question Answering
por: Xu, Yichen, et al.
Publicado: (2025)
por: Xu, Yichen, et al.
Publicado: (2025)
DermaBench: A Clinician-Annotated Benchmark Dataset for Dermatology Visual Question Answering and Reasoning
por: Yilmaz, Abdurrahim, et al.
Publicado: (2026)
por: Yilmaz, Abdurrahim, et al.
Publicado: (2026)
QA-Dragon: Query-Aware Dynamic RAG System for Knowledge-Intensive Visual Question Answering
por: Jiang, Zhuohang, et al.
Publicado: (2025)
por: Jiang, Zhuohang, et al.
Publicado: (2025)
WorldCuisines: A Massive-Scale Benchmark for Multilingual and Multicultural Visual Question Answering on Global Cuisines
por: Winata, Genta Indra, et al.
Publicado: (2024)
por: Winata, Genta Indra, et al.
Publicado: (2024)
Mavors: Multi-granularity Video Representation for Multimodal Large Language Model
por: Shi, Yang, et al.
Publicado: (2025)
por: Shi, Yang, et al.
Publicado: (2025)
Exploring Diverse Methods in Visual Question Answering
por: Li, Panfeng, et al.
Publicado: (2024)
por: Li, Panfeng, et al.
Publicado: (2024)
Towards Visual-Prompt Temporal Answering Grounding in Medical Instructional Video
por: Li, Bin, et al.
Publicado: (2022)
por: Li, Bin, et al.
Publicado: (2022)
VideoTree: Adaptive Tree-based Video Representation for LLM Reasoning on Long Videos
por: Wang, Ziyang, et al.
Publicado: (2024)
por: Wang, Ziyang, et al.
Publicado: (2024)
RadImageNet-VQA: A Large-Scale CT and MRI Dataset for Radiologic Visual Question Answering
por: Butsanets, Léo, et al.
Publicado: (2025)
por: Butsanets, Léo, et al.
Publicado: (2025)
ReAG: Reasoning-Augmented Generation for Knowledge-based Visual Question Answering
por: Compagnoni, Alberto, et al.
Publicado: (2025)
por: Compagnoni, Alberto, et al.
Publicado: (2025)
FIQ: Fundamental Question Generation with the Integration of Question Embeddings for Video Question Answering
por: Oh, Ju-Young, et al.
Publicado: (2025)
por: Oh, Ju-Young, et al.
Publicado: (2025)
Augmenting Multimodal LLMs with Self-Reflective Tokens for Knowledge-based Visual Question Answering
por: Cocchi, Federico, et al.
Publicado: (2024)
por: Cocchi, Federico, et al.
Publicado: (2024)
MMToM-QA: Multimodal Theory of Mind Question Answering
por: Jin, Chuanyang, et al.
Publicado: (2024)
por: Jin, Chuanyang, et al.
Publicado: (2024)
CVQA: Culturally-diverse Multilingual Visual Question Answering Benchmark
por: Romero, David, et al.
Publicado: (2024)
por: Romero, David, et al.
Publicado: (2024)
Find The Gap: Knowledge Base Reasoning For Visual Question Answering
por: Barezi, Elham J., et al.
Publicado: (2024)
por: Barezi, Elham J., et al.
Publicado: (2024)
Federated Document Visual Question Answering: A Pilot Study
por: Nguyen, Khanh, et al.
Publicado: (2024)
por: Nguyen, Khanh, et al.
Publicado: (2024)
CogStream: Context-guided Streaming Video Question Answering
por: Zhao, Zicheng, et al.
Publicado: (2025)
por: Zhao, Zicheng, et al.
Publicado: (2025)
DermaVQA-DAS: Dermatology Assessment Schema (DAS) & Datasets for Closed-Ended Question Answering & Segmentation in Patient-Generated Dermatology Images
por: Yim, Wen-wai, et al.
Publicado: (2025)
por: Yim, Wen-wai, et al.
Publicado: (2025)
Question-Answering Dense Video Events
por: Qin, Hangyu, et al.
Publicado: (2024)
por: Qin, Hangyu, et al.
Publicado: (2024)
When Big Models Train Small Ones: Label-Free Model Parity Alignment for Efficient Visual Question Answering using Small VLMs
por: Penamakuri, Abhirama Subramanyam, et al.
Publicado: (2025)
por: Penamakuri, Abhirama Subramanyam, et al.
Publicado: (2025)
MediFact at MEDIQA-M3G 2024: Medical Question Answering in Dermatology with Multimodal Learning
por: Saeed, Nadia
Publicado: (2024)
por: Saeed, Nadia
Publicado: (2024)
Ejemplares similares
-
Multi-object event graph representation learning for Video Question Answering
por: Wang, Yanan, et al.
Publicado: (2024) -
CoTasks: Chain-of-Thought based Video Instruction Tuning Tasks
por: Wang, Yanan, et al.
Publicado: (2025) -
Weakly Supervised Gaussian Contrastive Grounding with Large Multimodal Models for Video Question Answering
por: Wang, Haibo, et al.
Publicado: (2024) -
Hierarchical Semantic Correlation-Aware Masked Autoencoder for Unsupervised Audio-Visual Representation Learning
por: Zeng, Donghuo, et al.
Publicado: (2026) -
LOVA3: Learning to Visual Question Answering, Asking and Assessment
por: Zhao, Henry Hengyuan, et al.
Publicado: (2024)