A.I.R.: Enabling Adaptive, Iterative, and Reasoning-based Frame Selection For Video Question Answering
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zou, Yuanhao, Jin, Shengji, Deng, Andong, Zhao, Youpeng, Wang, Jun, Chen, Chen |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
How Should Video LLMs Output Time? An Analysis of Efficient Temporal Grounding Paradigms
von: Jin, Shengji, et al.
Veröffentlicht: (2026)
von: Jin, Shengji, et al.
Veröffentlicht: (2026)
Alignment, Mining and Fusion: Representation Alignment with Hard Negative Mining and Selective Knowledge Fusion for Medical Visual Question Answering
von: Zou, Yuanhao, et al.
Veröffentlicht: (2025)
von: Zou, Yuanhao, et al.
Veröffentlicht: (2025)
End-to-End Video Question Answering with Frame Scoring Mechanisms and Adaptive Sampling
von: Liang, Jianxin, et al.
Veröffentlicht: (2024)
von: Liang, Jianxin, et al.
Veröffentlicht: (2024)
Sports-QA: A Large-Scale Video Question Answering Benchmark for Complex and Professional Sports
von: Li, Haopeng, et al.
Veröffentlicht: (2024)
von: Li, Haopeng, et al.
Veröffentlicht: (2024)
HORNet: Task-Guided Frame Selection for Video Question Answering with Vision-Language Models
von: Bai, Xiangyu, et al.
Veröffentlicht: (2026)
von: Bai, Xiangyu, et al.
Veröffentlicht: (2026)
FocusGraph: Graph-Structured Frame Selection for Embodied Long Video Question Answering
von: Zemskova, Tatiana, et al.
Veröffentlicht: (2026)
von: Zemskova, Tatiana, et al.
Veröffentlicht: (2026)
HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering
von: Ben-Ami, Dan, et al.
Veröffentlicht: (2026)
von: Ben-Ami, Dan, et al.
Veröffentlicht: (2026)
CRAFT: Critic-Refined Adaptive Key-Frame Targeting for Multimodal Video Question Answering
von: Bhosale, Mahesh, et al.
Veröffentlicht: (2026)
von: Bhosale, Mahesh, et al.
Veröffentlicht: (2026)
Enhancing Long Video Question Answering with Scene-Localized Frame Grouping
von: Yang, Xuyi, et al.
Veröffentlicht: (2025)
von: Yang, Xuyi, et al.
Veröffentlicht: (2025)
STAIR: Spatial-Temporal Reasoning with Auditable Intermediate Results for Video Question Answering
von: Wang, Yueqian, et al.
Veröffentlicht: (2024)
von: Wang, Yueqian, et al.
Veröffentlicht: (2024)
Static or Dynamic: Towards Query-Adaptive Token Selection for Video Question Answering
von: Shi, Yumeng, et al.
Veröffentlicht: (2025)
von: Shi, Yumeng, et al.
Veröffentlicht: (2025)
VideoDistill: Language-aware Vision Distillation for Video Question Answering
von: Zou, Bo, et al.
Veröffentlicht: (2024)
von: Zou, Bo, et al.
Veröffentlicht: (2024)
DreamFrame: Enhancing Video Understanding via Automatically Generated QA and Style-Consistent Keyframes
von: Song, Zhende, et al.
Veröffentlicht: (2024)
von: Song, Zhende, et al.
Veröffentlicht: (2024)
VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering
von: Meng, Yiran, et al.
Veröffentlicht: (2025)
von: Meng, Yiran, et al.
Veröffentlicht: (2025)
VideoQA-SC: Adaptive Semantic Communication for Video Question Answering
von: Guo, Jiangyuan, et al.
Veröffentlicht: (2024)
von: Guo, Jiangyuan, et al.
Veröffentlicht: (2024)
Foundation Models and Adaptive Feature Selection: A Synergistic Approach to Video Question Answering
von: Rongali, Sai Bhargav, et al.
Veröffentlicht: (2024)
von: Rongali, Sai Bhargav, et al.
Veröffentlicht: (2024)
Neuro Symbolic Knowledge Reasoning for Procedural Video Question Answering
von: Fernando, Basura, et al.
Veröffentlicht: (2025)
von: Fernando, Basura, et al.
Veröffentlicht: (2025)
Neural-Symbolic VideoQA: Learning Compositional Spatio-Temporal Reasoning for Real-world Video Question Answering
von: Liang, Lili, et al.
Veröffentlicht: (2024)
von: Liang, Lili, et al.
Veröffentlicht: (2024)
DMC$^3$: Dual-Modal Counterfactual Contrastive Construction for Egocentric Video Question Answering
von: Zou, Jiayi, et al.
Veröffentlicht: (2025)
von: Zou, Jiayi, et al.
Veröffentlicht: (2025)
Leveraging LLMs with Iterative Loop Structure for Enhanced Social Intelligence in Video Question Answering
von: Mori, Erika, et al.
Veröffentlicht: (2025)
von: Mori, Erika, et al.
Veröffentlicht: (2025)
VideoAuto-R1: Video Auto Reasoning via Thinking Once, Answering Twice
von: Liu, Shuming, et al.
Veröffentlicht: (2026)
von: Liu, Shuming, et al.
Veröffentlicht: (2026)
Tool-Augmented Spatiotemporal Reasoning for Streamlining Video Question Answering Task
von: Fan, Sunqi, et al.
Veröffentlicht: (2025)
von: Fan, Sunqi, et al.
Veröffentlicht: (2025)
BIMBA: Selective-Scan Compression for Long-Range Video Question Answering
von: Islam, Md Mohaiminul, et al.
Veröffentlicht: (2025)
von: Islam, Md Mohaiminul, et al.
Veröffentlicht: (2025)
Align and Aggregate: Compositional Reasoning with Video Alignment and Answer Aggregation for Video Question-Answering
von: Liao, Zhaohe, et al.
Veröffentlicht: (2024)
von: Liao, Zhaohe, et al.
Veröffentlicht: (2024)
ViLA: Efficient Video-Language Alignment for Video Question Answering
von: Wang, Xijun, et al.
Veröffentlicht: (2023)
von: Wang, Xijun, et al.
Veröffentlicht: (2023)
Learning Question-Aware Keyframe Selection with Synthetic Supervision for Video Question Answering
von: Kwon, Minchan, et al.
Veröffentlicht: (2026)
von: Kwon, Minchan, et al.
Veröffentlicht: (2026)
REVEAL: Relation-based Video Representation Learning for Video-Question-Answering
von: Chaybouti, Sofian, et al.
Veröffentlicht: (2025)
von: Chaybouti, Sofian, et al.
Veröffentlicht: (2025)
Uncertainty-Guided Self-Questioning and Answering for Video-Language Alignment
von: Chen, Jin, et al.
Veröffentlicht: (2024)
von: Chen, Jin, et al.
Veröffentlicht: (2024)
SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models
von: Deng, Andong, et al.
Veröffentlicht: (2025)
von: Deng, Andong, et al.
Veröffentlicht: (2025)
Answering from Sure to Uncertain: Uncertainty-Aware Curriculum Learning for Video Question Answering
von: Li, Haopeng, et al.
Veröffentlicht: (2024)
von: Li, Haopeng, et al.
Veröffentlicht: (2024)
Looking Beyond Visible Cues: Implicit Video Question Answering via Dual-Clue Reasoning
von: Chen, Tieyuan, et al.
Veröffentlicht: (2025)
von: Chen, Tieyuan, et al.
Veröffentlicht: (2025)
Do You See What I Am Pointing At? Gesture-Based Egocentric Video Question Answering
von: Choi, Yura, et al.
Veröffentlicht: (2026)
von: Choi, Yura, et al.
Veröffentlicht: (2026)
From Frames to Clips: Training-free Adaptive Key Clip Selection for Long-Form Video Understanding
von: Sun, Guangyu, et al.
Veröffentlicht: (2025)
von: Sun, Guangyu, et al.
Veröffentlicht: (2025)
Commonsense Video Question Answering through Video-Grounded Entailment Tree Reasoning
von: Liu, Huabin, et al.
Veröffentlicht: (2025)
von: Liu, Huabin, et al.
Veröffentlicht: (2025)
Glance and Focus: Memory Prompting for Multi-Event Video Question Answering
von: Bai, Ziyi, et al.
Veröffentlicht: (2024)
von: Bai, Ziyi, et al.
Veröffentlicht: (2024)
GHR-VQA: Graph-guided Hierarchical Relational Reasoning for Video Question Answering
von: Brilli, Dionysia Danai, et al.
Veröffentlicht: (2025)
von: Brilli, Dionysia Danai, et al.
Veröffentlicht: (2025)
Self-Adaptive Sampling for Efficient Video Question-Answering on Image--Text Models
von: Han, Wei, et al.
Veröffentlicht: (2023)
von: Han, Wei, et al.
Veröffentlicht: (2023)
AIR-HLoc: Adaptive Retrieved Images Selection for Efficient Visual Localisation
von: Liu, Changkun, et al.
Veröffentlicht: (2024)
von: Liu, Changkun, et al.
Veröffentlicht: (2024)
Selectively Answering Visual Questions
von: Eisenschlos, Julian Martin, et al.
Veröffentlicht: (2024)
von: Eisenschlos, Julian Martin, et al.
Veröffentlicht: (2024)
Object-centric Video Question Answering with Visual Grounding and Referring
von: Wang, Haochen, et al.
Veröffentlicht: (2025)
von: Wang, Haochen, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
How Should Video LLMs Output Time? An Analysis of Efficient Temporal Grounding Paradigms
von: Jin, Shengji, et al.
Veröffentlicht: (2026) -
Alignment, Mining and Fusion: Representation Alignment with Hard Negative Mining and Selective Knowledge Fusion for Medical Visual Question Answering
von: Zou, Yuanhao, et al.
Veröffentlicht: (2025) -
End-to-End Video Question Answering with Frame Scoring Mechanisms and Adaptive Sampling
von: Liang, Jianxin, et al.
Veröffentlicht: (2024) -
Sports-QA: A Large-Scale Video Question Answering Benchmark for Complex and Professional Sports
von: Li, Haopeng, et al.
Veröffentlicht: (2024) -
HORNet: Task-Guided Frame Selection for Video Question Answering with Vision-Language Models
von: Bai, Xiangyu, et al.
Veröffentlicht: (2026)