Neuro Symbolic Knowledge Reasoning for Procedural Video Question Answering
Fuente:
arXiv
Guardado en:
| Autores principales: | Fernando, Basura, Nguyen, Thanh-Son, Yang, Hong, Neoh, Tzeh Yuan, Zhang, Hao, Keat, Ee Yeo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
RCA: Region Conditioned Adaptation for Visual Abductive Reasoning
por: Zhang, Hao, et al.
Publicado: (2023)
por: Zhang, Hao, et al.
Publicado: (2023)
Training-Free Action Recognition and Goal Inference with Dynamic Frame Selection
por: Keat, Ee Yeo, et al.
Publicado: (2024)
por: Keat, Ee Yeo, et al.
Publicado: (2024)
Improving Temporal Action Segmentation via Constraint-Aware Decoding
por: Ee, Yeo Keat, et al.
Publicado: (2026)
por: Ee, Yeo Keat, et al.
Publicado: (2026)
IMoRe: Implicit Program-Guided Reasoning for Human Motion Q&A
por: Li, Chen, et al.
Publicado: (2025)
por: Li, Chen, et al.
Publicado: (2025)
Mitigating Easy Option Bias in Multiple-Choice Question Answering
por: Zhang, Hao, et al.
Publicado: (2025)
por: Zhang, Hao, et al.
Publicado: (2025)
ChainReaction: Causal Chain-Guided Reasoning for Modular and Explainable Causal-Why Video Question Answering
por: Parmar, Paritosh, et al.
Publicado: (2025)
por: Parmar, Paritosh, et al.
Publicado: (2025)
Inferring Past Human Actions in Homes with Abductive Reasoning
por: Tan, Clement, et al.
Publicado: (2022)
por: Tan, Clement, et al.
Publicado: (2022)
Tool-Augmented Spatiotemporal Reasoning for Streamlining Video Question Answering Task
por: Fan, Sunqi, et al.
Publicado: (2025)
por: Fan, Sunqi, et al.
Publicado: (2025)
Advancing Vietnamese Visual Question Answering with Transformer and Convolutional Integration
por: Nguyen, Ngoc Son, et al.
Publicado: (2024)
por: Nguyen, Ngoc Son, et al.
Publicado: (2024)
Know-Show: Benchmarking Video-Language Models on Spatio-Temporal Grounded Reasoning
por: Sugandhika, Chinthani, et al.
Publicado: (2025)
por: Sugandhika, Chinthani, et al.
Publicado: (2025)
Neural-Symbolic VideoQA: Learning Compositional Spatio-Temporal Reasoning for Real-world Video Question Answering
por: Liang, Lili, et al.
Publicado: (2024)
por: Liang, Lili, et al.
Publicado: (2024)
Agentic Keyframe Search for Video Question Answering
por: Fan, Sunqi, et al.
Publicado: (2025)
por: Fan, Sunqi, et al.
Publicado: (2025)
Effectively Leveraging CLIP for Generating Situational Summaries of Images and Videos
por: Verma, Dhruv, et al.
Publicado: (2024)
por: Verma, Dhruv, et al.
Publicado: (2024)
Encoding and Controlling Global Semantics for Long-form Video Question Answering
por: Nguyen, Thong Thanh, et al.
Publicado: (2024)
por: Nguyen, Thong Thanh, et al.
Publicado: (2024)
Neuro-Symbolic Spatial Reasoning in Segmentation
por: Lin, Jiayi, et al.
Publicado: (2025)
por: Lin, Jiayi, et al.
Publicado: (2025)
SilVar: Speech Driven Multimodal Model for Reasoning Visual Question Answering and Object Localization
por: Pham, Tan-Hanh, et al.
Publicado: (2024)
por: Pham, Tan-Hanh, et al.
Publicado: (2024)
Towards Neuro-Symbolic Video Understanding
por: Choi, Minkyu, et al.
Publicado: (2024)
por: Choi, Minkyu, et al.
Publicado: (2024)
See the Forest and the Trees: A Synergistic Reasoning Framework for Knowledge-Based Visual Question Answering
por: Wang, Junjie, et al.
Publicado: (2025)
por: Wang, Junjie, et al.
Publicado: (2025)
UpstreamQA: A Modular Framework for Explicit Reasoning on Video Question Answering Tasks
por: Nguyen, Jason, et al.
Publicado: (2026)
por: Nguyen, Jason, et al.
Publicado: (2026)
Streaming Video Question-Answering with In-context Video KV-Cache Retrieval
por: Di, Shangzhe, et al.
Publicado: (2025)
por: Di, Shangzhe, et al.
Publicado: (2025)
Align and Aggregate: Compositional Reasoning with Video Alignment and Answer Aggregation for Video Question-Answering
por: Liao, Zhaohe, et al.
Publicado: (2024)
por: Liao, Zhaohe, et al.
Publicado: (2024)
NeuS-QA: Grounding Long-Form Video Understanding in Temporal Logic and Neuro-Symbolic Reasoning
por: Shah, Sahil, et al.
Publicado: (2025)
por: Shah, Sahil, et al.
Publicado: (2025)
Towards Signboard-Oriented Visual Question Answering: ViSignVQA Dataset, Method and Benchmark
por: Nguyen, Hieu Minh, et al.
Publicado: (2025)
por: Nguyen, Hieu Minh, et al.
Publicado: (2025)
VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering
por: Meng, Yiran, et al.
Publicado: (2025)
por: Meng, Yiran, et al.
Publicado: (2025)
ReasonVQA: A Multi-hop Reasoning Benchmark with Structural Knowledge for Visual Question Answering
por: Tran, Duong T., et al.
Publicado: (2025)
por: Tran, Duong T., et al.
Publicado: (2025)
GHR-VQA: Graph-guided Hierarchical Relational Reasoning for Video Question Answering
por: Brilli, Dionysia Danai, et al.
Publicado: (2025)
por: Brilli, Dionysia Danai, et al.
Publicado: (2025)
Bridging Vision Language Models and Symbolic Grounding for Video Question Answering
por: Ma, Haodi, et al.
Publicado: (2025)
por: Ma, Haodi, et al.
Publicado: (2025)
StaR-KVQA: Structured Reasoning Traces for Implicit-Knowledge Visual Question Answering
por: Wen, Zhihao, et al.
Publicado: (2025)
por: Wen, Zhihao, et al.
Publicado: (2025)
MA-EgoQA: Question Answering over Egocentric Videos from Multiple Embodied Agents
por: Kim, Kangsan, et al.
Publicado: (2026)
por: Kim, Kangsan, et al.
Publicado: (2026)
VideoDistill: Language-aware Vision Distillation for Video Question Answering
por: Zou, Bo, et al.
Publicado: (2024)
por: Zou, Bo, et al.
Publicado: (2024)
Learning to Compress Contexts for Efficient Knowledge-based Visual Question Answering
por: Weng, Weixi, et al.
Publicado: (2024)
por: Weng, Weixi, et al.
Publicado: (2024)
Commonsense Video Question Answering through Video-Grounded Entailment Tree Reasoning
por: Liu, Huabin, et al.
Publicado: (2025)
por: Liu, Huabin, et al.
Publicado: (2025)
Self-Bootstrapped Visual-Language Model for Knowledge Selection and Question Answering
por: Hao, Dongze, et al.
Publicado: (2024)
por: Hao, Dongze, et al.
Publicado: (2024)
Predicting the Next Action by Modeling the Abstract Goal
por: Roy, Debaditya, et al.
Publicado: (2022)
por: Roy, Debaditya, et al.
Publicado: (2022)
ViLA: Efficient Video-Language Alignment for Video Question Answering
por: Wang, Xijun, et al.
Publicado: (2023)
por: Wang, Xijun, et al.
Publicado: (2023)
MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering
por: Dang, Jisheng, et al.
Publicado: (2025)
por: Dang, Jisheng, et al.
Publicado: (2025)
Progressive Multimodal Search and Reasoning for Knowledge-Intensive Visual Question Answering
por: Choi, Changin, et al.
Publicado: (2025)
por: Choi, Changin, et al.
Publicado: (2025)
CaST-Bench: Benchmarking Causal Chain-Grounded Spatio-Temporal Reasoning for Video Question Answering
por: Zhang, Mingfang, et al.
Publicado: (2026)
por: Zhang, Mingfang, et al.
Publicado: (2026)
Grounded Question-Answering in Long Egocentric Videos
por: Di, Shangzhe, et al.
Publicado: (2023)
por: Di, Shangzhe, et al.
Publicado: (2023)
Learning to Reason Iteratively and Parallelly for Complex Visual Reasoning Scenarios
por: Jaiswal, Shantanu, et al.
Publicado: (2024)
por: Jaiswal, Shantanu, et al.
Publicado: (2024)
Ejemplares similares
-
RCA: Region Conditioned Adaptation for Visual Abductive Reasoning
por: Zhang, Hao, et al.
Publicado: (2023) -
Training-Free Action Recognition and Goal Inference with Dynamic Frame Selection
por: Keat, Ee Yeo, et al.
Publicado: (2024) -
Improving Temporal Action Segmentation via Constraint-Aware Decoding
por: Ee, Yeo Keat, et al.
Publicado: (2026) -
IMoRe: Implicit Program-Guided Reasoning for Human Motion Q&A
por: Li, Chen, et al.
Publicado: (2025) -
Mitigating Easy Option Bias in Multiple-Choice Question Answering
por: Zhang, Hao, et al.
Publicado: (2025)