Align and Aggregate: Compositional Reasoning with Video Alignment and Answer Aggregation for Video Question-Answering
Fuente:
arXiv
Salvato in:
| Autori principali: | Liao, Zhaohe, Li, Jiangtong, Niu, Li, Zhang, Liqing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Admitting Ignorance Helps the Video Question Answering Models to Answer
di: Li, Haopeng, et al.
Pubblicazione: (2025)
di: Li, Haopeng, et al.
Pubblicazione: (2025)
Narrative Aligned Long Form Video Question Answering
di: Jain, Rahul, et al.
Pubblicazione: (2026)
di: Jain, Rahul, et al.
Pubblicazione: (2026)
ViLA: Efficient Video-Language Alignment for Video Question Answering
di: Wang, Xijun, et al.
Pubblicazione: (2023)
di: Wang, Xijun, et al.
Pubblicazione: (2023)
Neural-Symbolic VideoQA: Learning Compositional Spatio-Temporal Reasoning for Real-world Video Question Answering
di: Liang, Lili, et al.
Pubblicazione: (2024)
di: Liang, Lili, et al.
Pubblicazione: (2024)
DreamCom: Finetuning Text-guided Inpainting Model for Image Composition
di: Lu, Lingxiao, et al.
Pubblicazione: (2023)
di: Lu, Lingxiao, et al.
Pubblicazione: (2023)
Can I Trust Your Answer? Visually Grounded Video Question Answering
di: Xiao, Junbin, et al.
Pubblicazione: (2023)
di: Xiao, Junbin, et al.
Pubblicazione: (2023)
Neuro Symbolic Knowledge Reasoning for Procedural Video Question Answering
di: Fernando, Basura, et al.
Pubblicazione: (2025)
di: Fernando, Basura, et al.
Pubblicazione: (2025)
Streaming Video Question-Answering with In-context Video KV-Cache Retrieval
di: Di, Shangzhe, et al.
Pubblicazione: (2025)
di: Di, Shangzhe, et al.
Pubblicazione: (2025)
An Empirical Study on How Video-LLMs Answer Video Questions
di: Gou, Chenhui, et al.
Pubblicazione: (2025)
di: Gou, Chenhui, et al.
Pubblicazione: (2025)
VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering
di: Meng, Yiran, et al.
Pubblicazione: (2025)
di: Meng, Yiran, et al.
Pubblicazione: (2025)
ETVA: Evaluation of Text-to-Video Alignment via Fine-grained Question Generation and Answering
di: Guan, Kaisi, et al.
Pubblicazione: (2025)
di: Guan, Kaisi, et al.
Pubblicazione: (2025)
Tool-Augmented Spatiotemporal Reasoning for Streamlining Video Question Answering Task
di: Fan, Sunqi, et al.
Pubblicazione: (2025)
di: Fan, Sunqi, et al.
Pubblicazione: (2025)
Uncertainty-Guided Self-Questioning and Answering for Video-Language Alignment
di: Chen, Jin, et al.
Pubblicazione: (2024)
di: Chen, Jin, et al.
Pubblicazione: (2024)
VideoMix: Aggregating How-To Videos for Task-Oriented Learning
di: Yang, Saelyne, et al.
Pubblicazione: (2025)
di: Yang, Saelyne, et al.
Pubblicazione: (2025)
Video Detective: Seek Critical Clues Recurrently to Answer Question from Long Videos
di: Du, Henghui, et al.
Pubblicazione: (2025)
di: Du, Henghui, et al.
Pubblicazione: (2025)
Reasoning to Align: Implicit Reasoning in Diffusion Transformers for Video Editing
di: Li, Yan, et al.
Pubblicazione: (2026)
di: Li, Yan, et al.
Pubblicazione: (2026)
Video Deblurring with Deconvolution and Aggregation Networks
di: Choi, Giyong, et al.
Pubblicazione: (2025)
di: Choi, Giyong, et al.
Pubblicazione: (2025)
Commonsense Video Question Answering through Video-Grounded Entailment Tree Reasoning
di: Liu, Huabin, et al.
Pubblicazione: (2025)
di: Liu, Huabin, et al.
Pubblicazione: (2025)
LaneTCA: Enhancing Video Lane Detection with Temporal Context Aggregation
di: Zhou, Keyi, et al.
Pubblicazione: (2024)
di: Zhou, Keyi, et al.
Pubblicazione: (2024)
MovieChat+: Question-aware Sparse Memory for Long Video Question Answering
di: Song, Enxin, et al.
Pubblicazione: (2024)
di: Song, Enxin, et al.
Pubblicazione: (2024)
GHR-VQA: Graph-guided Hierarchical Relational Reasoning for Video Question Answering
di: Brilli, Dionysia Danai, et al.
Pubblicazione: (2025)
di: Brilli, Dionysia Danai, et al.
Pubblicazione: (2025)
Answering from Sure to Uncertain: Uncertainty-Aware Curriculum Learning for Video Question Answering
di: Li, Haopeng, et al.
Pubblicazione: (2024)
di: Li, Haopeng, et al.
Pubblicazione: (2024)
Looking Beyond Visible Cues: Implicit Video Question Answering via Dual-Clue Reasoning
di: Chen, Tieyuan, et al.
Pubblicazione: (2025)
di: Chen, Tieyuan, et al.
Pubblicazione: (2025)
LLMs Meet Long Video: Advancing Long Video Question Answering with An Interactive Visual Adapter in LLMs
di: Li, Yunxin, et al.
Pubblicazione: (2024)
di: Li, Yunxin, et al.
Pubblicazione: (2024)
Grounded Question-Answering in Long Egocentric Videos
di: Di, Shangzhe, et al.
Pubblicazione: (2023)
di: Di, Shangzhe, et al.
Pubblicazione: (2023)
Agentic Keyframe Search for Video Question Answering
di: Fan, Sunqi, et al.
Pubblicazione: (2025)
di: Fan, Sunqi, et al.
Pubblicazione: (2025)
VideoDistill: Language-aware Vision Distillation for Video Question Answering
di: Zou, Bo, et al.
Pubblicazione: (2024)
di: Zou, Bo, et al.
Pubblicazione: (2024)
REVEAL: Relation-based Video Representation Learning for Video-Question-Answering
di: Chaybouti, Sofian, et al.
Pubblicazione: (2025)
di: Chaybouti, Sofian, et al.
Pubblicazione: (2025)
Video-as-Answer: Predict and Generate Next Video Event with Joint-GRPO
di: Cheng, Junhao, et al.
Pubblicazione: (2025)
di: Cheng, Junhao, et al.
Pubblicazione: (2025)
ProTA: Probabilistic Token Aggregation for Text-Video Retrieval
di: Fang, Han, et al.
Pubblicazione: (2024)
di: Fang, Han, et al.
Pubblicazione: (2024)
MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering
di: Dang, Jisheng, et al.
Pubblicazione: (2025)
di: Dang, Jisheng, et al.
Pubblicazione: (2025)
SurgLQA: Scalable Long-Horizon Surgical Video Question Answering
di: Guo, Diandian, et al.
Pubblicazione: (2026)
di: Guo, Diandian, et al.
Pubblicazione: (2026)
Practical Video Object Detection via Feature Selection and Aggregation
di: Shi, Yuheng, et al.
Pubblicazione: (2024)
di: Shi, Yuheng, et al.
Pubblicazione: (2024)
STAIR: Spatial-Temporal Reasoning with Auditable Intermediate Results for Video Question Answering
di: Wang, Yueqian, et al.
Pubblicazione: (2024)
di: Wang, Yueqian, et al.
Pubblicazione: (2024)
PolySmart @ TRECVid 2024 Medical Video Question Answering
di: Wu, Jiaxin, et al.
Pubblicazione: (2024)
di: Wu, Jiaxin, et al.
Pubblicazione: (2024)
Question-Instructed Visual Descriptions for Zero-Shot Video Question Answering
di: Romero, David, et al.
Pubblicazione: (2024)
di: Romero, David, et al.
Pubblicazione: (2024)
VideoMultiAgents: A Multi-Agent Framework for Video Question Answering
di: Kugo, Noriyuki, et al.
Pubblicazione: (2025)
di: Kugo, Noriyuki, et al.
Pubblicazione: (2025)
Dynamic Spatial-Temporal Aggregation for Skeleton-Aware Sign Language Recognition
di: Hu, Lianyu, et al.
Pubblicazione: (2024)
di: Hu, Lianyu, et al.
Pubblicazione: (2024)
ChineseVideoBench: Benchmarking Multi-modal Large Models for Chinese Video Question Answering
di: Nie, Yuxiang, et al.
Pubblicazione: (2025)
di: Nie, Yuxiang, et al.
Pubblicazione: (2025)
CaST-Bench: Benchmarking Causal Chain-Grounded Spatio-Temporal Reasoning for Video Question Answering
di: Zhang, Mingfang, et al.
Pubblicazione: (2026)
di: Zhang, Mingfang, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Admitting Ignorance Helps the Video Question Answering Models to Answer
di: Li, Haopeng, et al.
Pubblicazione: (2025) -
Narrative Aligned Long Form Video Question Answering
di: Jain, Rahul, et al.
Pubblicazione: (2026) -
ViLA: Efficient Video-Language Alignment for Video Question Answering
di: Wang, Xijun, et al.
Pubblicazione: (2023) -
Neural-Symbolic VideoQA: Learning Compositional Spatio-Temporal Reasoning for Real-world Video Question Answering
di: Liang, Lili, et al.
Pubblicazione: (2024) -
DreamCom: Finetuning Text-guided Inpainting Model for Image Composition
di: Lu, Lingxiao, et al.
Pubblicazione: (2023)