Semantic Event Graphs for Long-Form Video Question Answering
Fuente:
arXiv
Salvato in:
| Autori principali: | Dixit, Aradhya, Liang, Tianxi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Encoding and Controlling Global Semantics for Long-form Video Question Answering
di: Nguyen, Thong Thanh, et al.
Pubblicazione: (2024)
di: Nguyen, Thong Thanh, et al.
Pubblicazione: (2024)
Question-Answering Dense Video Events
di: Qin, Hangyu, et al.
Pubblicazione: (2024)
di: Qin, Hangyu, et al.
Pubblicazione: (2024)
Enhancing Long Video Question Answering with Scene-Localized Frame Grouping
di: Yang, Xuyi, et al.
Pubblicazione: (2025)
di: Yang, Xuyi, et al.
Pubblicazione: (2025)
Free Form Medical Visual Question Answering in Radiology
di: Narayanan, Abhishek, et al.
Pubblicazione: (2024)
di: Narayanan, Abhishek, et al.
Pubblicazione: (2024)
HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering
di: Ben-Ami, Dan, et al.
Pubblicazione: (2026)
di: Ben-Ami, Dan, et al.
Pubblicazione: (2026)
FIQ: Fundamental Question Generation with the Integration of Question Embeddings for Video Question Answering
di: Oh, Ju-Young, et al.
Pubblicazione: (2025)
di: Oh, Ju-Young, et al.
Pubblicazione: (2025)
Evaluating Self-Correcting Vision Agents Through Quantitative and Qualitative Metrics
di: Dixit, Aradhya
Pubblicazione: (2026)
di: Dixit, Aradhya
Pubblicazione: (2026)
Leveraging Static Relationships for Intra-Type and Inter-Type Message Passing in Video Question Answering
di: Liang, Lili, et al.
Pubblicazione: (2025)
di: Liang, Lili, et al.
Pubblicazione: (2025)
Video-EM: Event-Centric Episodic Memory for Long-Form Video Understanding
di: Wang, Yun, et al.
Pubblicazione: (2025)
di: Wang, Yun, et al.
Pubblicazione: (2025)
VideoQA-SC: Adaptive Semantic Communication for Video Question Answering
di: Guo, Jiangyuan, et al.
Pubblicazione: (2024)
di: Guo, Jiangyuan, et al.
Pubblicazione: (2024)
Learning Question-Aware Keyframe Selection with Synthetic Supervision for Video Question Answering
di: Kwon, Minchan, et al.
Pubblicazione: (2026)
di: Kwon, Minchan, et al.
Pubblicazione: (2026)
Multi-granularity Contrastive Cross-modal Collaborative Generation for End-to-End Long-term Video Question Answering
di: Yu, Ting, et al.
Pubblicazione: (2024)
di: Yu, Ting, et al.
Pubblicazione: (2024)
Commonsense Video Question Answering through Video-Grounded Entailment Tree Reasoning
di: Liu, Huabin, et al.
Pubblicazione: (2025)
di: Liu, Huabin, et al.
Pubblicazione: (2025)
Explicit Abstention Knobs for Predictable Reliability in Video Question Answering
di: Ortiz, Jorge
Pubblicazione: (2025)
di: Ortiz, Jorge
Pubblicazione: (2025)
Uncertainty-Guided Self-Questioning and Answering for Video-Language Alignment
di: Chen, Jin, et al.
Pubblicazione: (2024)
di: Chen, Jin, et al.
Pubblicazione: (2024)
CogStream: Context-guided Streaming Video Question Answering
di: Zhao, Zicheng, et al.
Pubblicazione: (2025)
di: Zhao, Zicheng, et al.
Pubblicazione: (2025)
VQA$^2$: Visual Question Answering for Video Quality Assessment
di: Jia, Ziheng, et al.
Pubblicazione: (2024)
di: Jia, Ziheng, et al.
Pubblicazione: (2024)
MuKV: Multi-Grained KV Cache Compression for Long Streaming Video Question-Answering
di: Xiao, Junbin, et al.
Pubblicazione: (2026)
di: Xiao, Junbin, et al.
Pubblicazione: (2026)
Ego-Grounding for Personalized Question-Answering in Egocentric Videos
di: Xiao, Junbin, et al.
Pubblicazione: (2026)
di: Xiao, Junbin, et al.
Pubblicazione: (2026)
VideoAtlas: Navigating Long-Form Video in Logarithmic Compute
di: Eltahir, Mohamed, et al.
Pubblicazione: (2026)
di: Eltahir, Mohamed, et al.
Pubblicazione: (2026)
MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering
di: Dang, Jisheng, et al.
Pubblicazione: (2025)
di: Dang, Jisheng, et al.
Pubblicazione: (2025)
Towards Fine-Grained Video Question Answering
di: Dai, Wei, et al.
Pubblicazione: (2025)
di: Dai, Wei, et al.
Pubblicazione: (2025)
Prompting Video-Language Foundation Models with Domain-specific Fine-grained Heuristics for Video Question Answering
di: Yu, Ting, et al.
Pubblicazione: (2024)
di: Yu, Ting, et al.
Pubblicazione: (2024)
Top-down Activity Representation Learning for Video Question Answering
di: Wang, Yanan, et al.
Pubblicazione: (2024)
di: Wang, Yanan, et al.
Pubblicazione: (2024)
SMILE: A Composite Lexical-Semantic Metric for Question-Answering Evaluation
di: Kendre, Shrikant, et al.
Pubblicazione: (2025)
di: Kendre, Shrikant, et al.
Pubblicazione: (2025)
Narrative Aligned Long Form Video Question Answering
di: Jain, Rahul, et al.
Pubblicazione: (2026)
di: Jain, Rahul, et al.
Pubblicazione: (2026)
Explore until Confident: Efficient Exploration for Embodied Question Answering
di: Ren, Allen Z., et al.
Pubblicazione: (2024)
di: Ren, Allen Z., et al.
Pubblicazione: (2024)
CRAFT: Critic-Refined Adaptive Key-Frame Targeting for Multimodal Video Question Answering
di: Bhosale, Mahesh, et al.
Pubblicazione: (2026)
di: Bhosale, Mahesh, et al.
Pubblicazione: (2026)
UpstreamQA: A Modular Framework for Explicit Reasoning on Video Question Answering Tasks
di: Nguyen, Jason, et al.
Pubblicazione: (2026)
di: Nguyen, Jason, et al.
Pubblicazione: (2026)
Compositional 4D Dynamic Scenes Understanding with Physics Priors for Video Question Answering
di: Wang, Xingrui, et al.
Pubblicazione: (2024)
di: Wang, Xingrui, et al.
Pubblicazione: (2024)
Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering
di: Chowdhury, Md Intisar, et al.
Pubblicazione: (2025)
di: Chowdhury, Md Intisar, et al.
Pubblicazione: (2025)
Foundation Models and Adaptive Feature Selection: A Synergistic Approach to Video Question Answering
di: Rongali, Sai Bhargav, et al.
Pubblicazione: (2024)
di: Rongali, Sai Bhargav, et al.
Pubblicazione: (2024)
Leveraging the Video-level Semantic Consistency of Event for Audio-visual Event Localization
di: Jiang, Yuanyuan, et al.
Pubblicazione: (2022)
di: Jiang, Yuanyuan, et al.
Pubblicazione: (2022)
VidCtx: Context-aware Video Question Answering with Image Models
di: Goulas, Andreas, et al.
Pubblicazione: (2024)
di: Goulas, Andreas, et al.
Pubblicazione: (2024)
SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis
di: Kim, Junho, et al.
Pubblicazione: (2024)
di: Kim, Junho, et al.
Pubblicazione: (2024)
Boosting Audio Visual Question Answering via Key Semantic-Aware Cues
di: Li, Guangyao, et al.
Pubblicazione: (2024)
di: Li, Guangyao, et al.
Pubblicazione: (2024)
Multi-object event graph representation learning for Video Question Answering
di: Wang, Yanan, et al.
Pubblicazione: (2024)
di: Wang, Yanan, et al.
Pubblicazione: (2024)
QEVA: A Reference-Free Evaluation Metric for Narrative Video Summarization with Multimodal Question Answering
di: Jung, Woojun, et al.
Pubblicazione: (2026)
di: Jung, Woojun, et al.
Pubblicazione: (2026)
Vista: Scene-Aware Optimization for Streaming Video Question Answering under Post-Hoc Queries
di: Lu, Haocheng, et al.
Pubblicazione: (2026)
di: Lu, Haocheng, et al.
Pubblicazione: (2026)
MA-EgoQA: Question Answering over Egocentric Videos from Multiple Embodied Agents
di: Kim, Kangsan, et al.
Pubblicazione: (2026)
di: Kim, Kangsan, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Encoding and Controlling Global Semantics for Long-form Video Question Answering
di: Nguyen, Thong Thanh, et al.
Pubblicazione: (2024) -
Question-Answering Dense Video Events
di: Qin, Hangyu, et al.
Pubblicazione: (2024) -
Enhancing Long Video Question Answering with Scene-Localized Frame Grouping
di: Yang, Xuyi, et al.
Pubblicazione: (2025) -
Free Form Medical Visual Question Answering in Radiology
di: Narayanan, Abhishek, et al.
Pubblicazione: (2024) -
HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering
di: Ben-Ami, Dan, et al.
Pubblicazione: (2026)