Leveraging Static Relationships for Intra-Type and Inter-Type Message Passing in Video Question Answering
Fuente:
arXiv
Salvato in:
| Autori principali: | Liang, Lili, Sun, Guanglu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Unbiased Scene Graph Generation by Type-Aware Message Passing on Heterogeneous and Dual Graphs
di: Sun, Guanglu, et al.
Pubblicazione: (2024)
di: Sun, Guanglu, et al.
Pubblicazione: (2024)
Neural-Symbolic VideoQA: Learning Compositional Spatio-Temporal Reasoning for Real-world Video Question Answering
di: Liang, Lili, et al.
Pubblicazione: (2024)
di: Liang, Lili, et al.
Pubblicazione: (2024)
Semantic Event Graphs for Long-Form Video Question Answering
di: Dixit, Aradhya, et al.
Pubblicazione: (2026)
di: Dixit, Aradhya, et al.
Pubblicazione: (2026)
Uncertainty-Guided Self-Questioning and Answering for Video-Language Alignment
di: Chen, Jin, et al.
Pubblicazione: (2024)
di: Chen, Jin, et al.
Pubblicazione: (2024)
FIQ: Fundamental Question Generation with the Integration of Question Embeddings for Video Question Answering
di: Oh, Ju-Young, et al.
Pubblicazione: (2025)
di: Oh, Ju-Young, et al.
Pubblicazione: (2025)
VQA$^2$: Visual Question Answering for Video Quality Assessment
di: Jia, Ziheng, et al.
Pubblicazione: (2024)
di: Jia, Ziheng, et al.
Pubblicazione: (2024)
FaithSCAN: Model-Driven Single-Pass Hallucination Detection for Faithful Visual Question Answering
di: Tong, Chaodong, et al.
Pubblicazione: (2026)
di: Tong, Chaodong, et al.
Pubblicazione: (2026)
Question-Answering Dense Video Events
di: Qin, Hangyu, et al.
Pubblicazione: (2024)
di: Qin, Hangyu, et al.
Pubblicazione: (2024)
Learning Question-Aware Keyframe Selection with Synthetic Supervision for Video Question Answering
di: Kwon, Minchan, et al.
Pubblicazione: (2026)
di: Kwon, Minchan, et al.
Pubblicazione: (2026)
Commonsense Video Question Answering through Video-Grounded Entailment Tree Reasoning
di: Liu, Huabin, et al.
Pubblicazione: (2025)
di: Liu, Huabin, et al.
Pubblicazione: (2025)
Explicit Abstention Knobs for Predictable Reliability in Video Question Answering
di: Ortiz, Jorge
Pubblicazione: (2025)
di: Ortiz, Jorge
Pubblicazione: (2025)
CogStream: Context-guided Streaming Video Question Answering
di: Zhao, Zicheng, et al.
Pubblicazione: (2025)
di: Zhao, Zicheng, et al.
Pubblicazione: (2025)
Enhancing Long Video Question Answering with Scene-Localized Frame Grouping
di: Yang, Xuyi, et al.
Pubblicazione: (2025)
di: Yang, Xuyi, et al.
Pubblicazione: (2025)
Encoding and Controlling Global Semantics for Long-form Video Question Answering
di: Nguyen, Thong Thanh, et al.
Pubblicazione: (2024)
di: Nguyen, Thong Thanh, et al.
Pubblicazione: (2024)
Ego-Grounding for Personalized Question-Answering in Egocentric Videos
di: Xiao, Junbin, et al.
Pubblicazione: (2026)
di: Xiao, Junbin, et al.
Pubblicazione: (2026)
Weakly Supervised Gaussian Contrastive Grounding with Large Multimodal Models for Video Question Answering
di: Wang, Haibo, et al.
Pubblicazione: (2024)
di: Wang, Haibo, et al.
Pubblicazione: (2024)
MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering
di: Dang, Jisheng, et al.
Pubblicazione: (2025)
di: Dang, Jisheng, et al.
Pubblicazione: (2025)
HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering
di: Ben-Ami, Dan, et al.
Pubblicazione: (2026)
di: Ben-Ami, Dan, et al.
Pubblicazione: (2026)
Towards Fine-Grained Video Question Answering
di: Dai, Wei, et al.
Pubblicazione: (2025)
di: Dai, Wei, et al.
Pubblicazione: (2025)
Prompting Video-Language Foundation Models with Domain-specific Fine-grained Heuristics for Video Question Answering
di: Yu, Ting, et al.
Pubblicazione: (2024)
di: Yu, Ting, et al.
Pubblicazione: (2024)
VideoQA-SC: Adaptive Semantic Communication for Video Question Answering
di: Guo, Jiangyuan, et al.
Pubblicazione: (2024)
di: Guo, Jiangyuan, et al.
Pubblicazione: (2024)
Top-down Activity Representation Learning for Video Question Answering
di: Wang, Yanan, et al.
Pubblicazione: (2024)
di: Wang, Yanan, et al.
Pubblicazione: (2024)
MuKV: Multi-Grained KV Cache Compression for Long Streaming Video Question-Answering
di: Xiao, Junbin, et al.
Pubblicazione: (2026)
di: Xiao, Junbin, et al.
Pubblicazione: (2026)
Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering
di: Chowdhury, Md Intisar, et al.
Pubblicazione: (2025)
di: Chowdhury, Md Intisar, et al.
Pubblicazione: (2025)
CRAFT: Critic-Refined Adaptive Key-Frame Targeting for Multimodal Video Question Answering
di: Bhosale, Mahesh, et al.
Pubblicazione: (2026)
di: Bhosale, Mahesh, et al.
Pubblicazione: (2026)
Compositional 4D Dynamic Scenes Understanding with Physics Priors for Video Question Answering
di: Wang, Xingrui, et al.
Pubblicazione: (2024)
di: Wang, Xingrui, et al.
Pubblicazione: (2024)
Foundation Models and Adaptive Feature Selection: A Synergistic Approach to Video Question Answering
di: Rongali, Sai Bhargav, et al.
Pubblicazione: (2024)
di: Rongali, Sai Bhargav, et al.
Pubblicazione: (2024)
UpstreamQA: A Modular Framework for Explicit Reasoning on Video Question Answering Tasks
di: Nguyen, Jason, et al.
Pubblicazione: (2026)
di: Nguyen, Jason, et al.
Pubblicazione: (2026)
Adapting Lightweight Vision Language Models for Radiological Visual Question Answering
di: Shourya, Aditya, et al.
Pubblicazione: (2025)
di: Shourya, Aditya, et al.
Pubblicazione: (2025)
FashionFlow: Leveraging Diffusion Models for Dynamic Fashion Video Synthesis from Static Imagery
di: Islam, Tasin, et al.
Pubblicazione: (2023)
di: Islam, Tasin, et al.
Pubblicazione: (2023)
X2SAM: Any Segmentation in Images and Videos
di: Wang, Hao, et al.
Pubblicazione: (2026)
di: Wang, Hao, et al.
Pubblicazione: (2026)
VidCtx: Context-aware Video Question Answering with Image Models
di: Goulas, Andreas, et al.
Pubblicazione: (2024)
di: Goulas, Andreas, et al.
Pubblicazione: (2024)
Multi-object event graph representation learning for Video Question Answering
di: Wang, Yanan, et al.
Pubblicazione: (2024)
di: Wang, Yanan, et al.
Pubblicazione: (2024)
LeAdQA: LLM-Driven Context-Aware Temporal Grounding for Video Question Answering
di: Dong, Xinxin, et al.
Pubblicazione: (2025)
di: Dong, Xinxin, et al.
Pubblicazione: (2025)
QEVA: A Reference-Free Evaluation Metric for Narrative Video Summarization with Multimodal Question Answering
di: Jung, Woojun, et al.
Pubblicazione: (2026)
di: Jung, Woojun, et al.
Pubblicazione: (2026)
Vista: Scene-Aware Optimization for Streaming Video Question Answering under Post-Hoc Queries
di: Lu, Haocheng, et al.
Pubblicazione: (2026)
di: Lu, Haocheng, et al.
Pubblicazione: (2026)
MA-EgoQA: Question Answering over Egocentric Videos from Multiple Embodied Agents
di: Kim, Kangsan, et al.
Pubblicazione: (2026)
di: Kim, Kangsan, et al.
Pubblicazione: (2026)
Intra-view and Inter-view Correlation Guided Multi-view Novel Class Discovery
di: Wan, Xinhang, et al.
Pubblicazione: (2025)
di: Wan, Xinhang, et al.
Pubblicazione: (2025)
Seeing Right but Saying Wrong: Inter- and Intra-Layer Refinement in MLLMs without Training
di: Song, Shezheng, et al.
Pubblicazione: (2026)
di: Song, Shezheng, et al.
Pubblicazione: (2026)
DuetFair: Coupling Inter- and Intra-Subgroup Robustness for Fair Medical Image Segmentation
di: Tian, Yiqi, et al.
Pubblicazione: (2026)
di: Tian, Yiqi, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Unbiased Scene Graph Generation by Type-Aware Message Passing on Heterogeneous and Dual Graphs
di: Sun, Guanglu, et al.
Pubblicazione: (2024) -
Neural-Symbolic VideoQA: Learning Compositional Spatio-Temporal Reasoning for Real-world Video Question Answering
di: Liang, Lili, et al.
Pubblicazione: (2024) -
Semantic Event Graphs for Long-Form Video Question Answering
di: Dixit, Aradhya, et al.
Pubblicazione: (2026) -
Uncertainty-Guided Self-Questioning and Answering for Video-Language Alignment
di: Chen, Jin, et al.
Pubblicazione: (2024) -
FIQ: Fundamental Question Generation with the Integration of Question Embeddings for Video Question Answering
di: Oh, Ju-Young, et al.
Pubblicazione: (2025)