Narrative Aligned Long Form Video Question Answering
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jain, Rahul, Doshi, Keval, Uzkent, Burak, Kessler, Garin |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
From Frames to Clips: Training-free Adaptive Key Clip Selection for Long-Form Video Understanding
par: Sun, Guangyu, et autres
Publié: (2025)
par: Sun, Guangyu, et autres
Publié: (2025)
Learning to Rank Caption Chains for Video-Text Alignment
par: Blume, Ansel, et autres
Publié: (2026)
par: Blume, Ansel, et autres
Publié: (2026)
CounterVid: Counterfactual Video Generation for Mitigating Action and Temporal Hallucinations in Video-Language Models
par: Poppi, Tobia, et autres
Publié: (2026)
par: Poppi, Tobia, et autres
Publié: (2026)
Semantic Event Graphs for Long-Form Video Question Answering
par: Dixit, Aradhya, et autres
Publié: (2026)
par: Dixit, Aradhya, et autres
Publié: (2026)
Grounded Question-Answering in Long Egocentric Videos
par: Di, Shangzhe, et autres
Publié: (2023)
par: Di, Shangzhe, et autres
Publié: (2023)
Align and Aggregate: Compositional Reasoning with Video Alignment and Answer Aggregation for Video Question-Answering
par: Liao, Zhaohe, et autres
Publié: (2024)
par: Liao, Zhaohe, et autres
Publié: (2024)
MovieChat+: Question-aware Sparse Memory for Long Video Question Answering
par: Song, Enxin, et autres
Publié: (2024)
par: Song, Enxin, et autres
Publié: (2024)
Free Form Medical Visual Question Answering in Radiology
par: Narayanan, Abhishek, et autres
Publié: (2024)
par: Narayanan, Abhishek, et autres
Publié: (2024)
FlowNar: Scalable Streaming Narration for Long-Form Videos
par: Zhong, Zeyun, et autres
Publié: (2026)
par: Zhong, Zeyun, et autres
Publié: (2026)
SurgLQA: Scalable Long-Horizon Surgical Video Question Answering
par: Guo, Diandian, et autres
Publié: (2026)
par: Guo, Diandian, et autres
Publié: (2026)
A Simple LLM Framework for Long-Range Video Question-Answering
par: Zhang, Ce, et autres
Publié: (2023)
par: Zhang, Ce, et autres
Publié: (2023)
BIMBA: Selective-Scan Compression for Long-Range Video Question Answering
par: Islam, Md Mohaiminul, et autres
Publié: (2025)
par: Islam, Md Mohaiminul, et autres
Publié: (2025)
CG-Bench: Clue-grounded Question Answering Benchmark for Long Video Understanding
par: Chen, Guo, et autres
Publié: (2024)
par: Chen, Guo, et autres
Publié: (2024)
LLMs Meet Long Video: Advancing Long Video Question Answering with An Interactive Visual Adapter in LLMs
par: Li, Yunxin, et autres
Publié: (2024)
par: Li, Yunxin, et autres
Publié: (2024)
FocusGraph: Graph-Structured Frame Selection for Embodied Long Video Question Answering
par: Zemskova, Tatiana, et autres
Publié: (2026)
par: Zemskova, Tatiana, et autres
Publié: (2026)
Agentic Keyframe Search for Video Question Answering
par: Fan, Sunqi, et autres
Publié: (2025)
par: Fan, Sunqi, et autres
Publié: (2025)
Question-Instructed Visual Descriptions for Zero-Shot Video Question Answering
par: Romero, David, et autres
Publié: (2024)
par: Romero, David, et autres
Publié: (2024)
QEVA: A Reference-Free Evaluation Metric for Narrative Video Summarization with Multimodal Question Answering
par: Jung, Woojun, et autres
Publié: (2026)
par: Jung, Woojun, et autres
Publié: (2026)
Enhancing Long Video Question Answering with Scene-Localized Frame Grouping
par: Yang, Xuyi, et autres
Publié: (2025)
par: Yang, Xuyi, et autres
Publié: (2025)
Encoding and Controlling Global Semantics for Long-form Video Question Answering
par: Nguyen, Thong Thanh, et autres
Publié: (2024)
par: Nguyen, Thong Thanh, et autres
Publié: (2024)
ViLA: Efficient Video-Language Alignment for Video Question Answering
par: Wang, Xijun, et autres
Publié: (2023)
par: Wang, Xijun, et autres
Publié: (2023)
REVEAL: Relation-based Video Representation Learning for Video-Question-Answering
par: Chaybouti, Sofian, et autres
Publié: (2025)
par: Chaybouti, Sofian, et autres
Publié: (2025)
VideoDistill: Language-aware Vision Distillation for Video Question Answering
par: Zou, Bo, et autres
Publié: (2024)
par: Zou, Bo, et autres
Publié: (2024)
Streaming Video Question-Answering with In-context Video KV-Cache Retrieval
par: Di, Shangzhe, et autres
Publié: (2025)
par: Di, Shangzhe, et autres
Publié: (2025)
Foundational Question Generation for Video Question Answering via an Embedding-Integrated Approach
par: Oh, Ju-Young
Publié: (2025)
par: Oh, Ju-Young
Publié: (2025)
LvBench: A Benchmark for Long-form Video Understanding with Versatile Multi-modal Question Answering
par: Zhang, Hongjie, et autres
Publié: (2023)
par: Zhang, Hongjie, et autres
Publié: (2023)
VideoMultiAgents: A Multi-Agent Framework for Video Question Answering
par: Kugo, Noriyuki, et autres
Publié: (2025)
par: Kugo, Noriyuki, et autres
Publié: (2025)
Answering from Sure to Uncertain: Uncertainty-Aware Curriculum Learning for Video Question Answering
par: Li, Haopeng, et autres
Publié: (2024)
par: Li, Haopeng, et autres
Publié: (2024)
HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering
par: Ben-Ami, Dan, et autres
Publié: (2026)
par: Ben-Ami, Dan, et autres
Publié: (2026)
CinePile: A Long Video Question Answering Dataset and Benchmark
par: Rawal, Ruchit, et autres
Publié: (2024)
par: Rawal, Ruchit, et autres
Publié: (2024)
VideoAuteur: Towards Long Narrative Video Generation
par: Xiao, Junfei, et autres
Publié: (2025)
par: Xiao, Junfei, et autres
Publié: (2025)
Neuro Symbolic Knowledge Reasoning for Procedural Video Question Answering
par: Fernando, Basura, et autres
Publié: (2025)
par: Fernando, Basura, et autres
Publié: (2025)
VDMA: Video Question Answering with Dynamically Generated Multi-Agents
par: Kugo, Noriyuki, et autres
Publié: (2024)
par: Kugo, Noriyuki, et autres
Publié: (2024)
Object-centric Video Question Answering with Visual Grounding and Referring
par: Wang, Haochen, et autres
Publié: (2025)
par: Wang, Haochen, et autres
Publié: (2025)
Admitting Ignorance Helps the Video Question Answering Models to Answer
par: Li, Haopeng, et autres
Publié: (2025)
par: Li, Haopeng, et autres
Publié: (2025)
FIQ: Fundamental Question Generation with the Integration of Question Embeddings for Video Question Answering
par: Oh, Ju-Young, et autres
Publié: (2025)
par: Oh, Ju-Young, et autres
Publié: (2025)
STRIVE: Structured Spatiotemporal Exploration for Reinforcement Learning in Video Question Answering
par: Bahrami, Emad, et autres
Publié: (2026)
par: Bahrami, Emad, et autres
Publié: (2026)
Reflective Dialogue between Teacher and Solver Agents for Video Question Answering
par: Murakawa, Takuya, et autres
Publié: (2026)
par: Murakawa, Takuya, et autres
Publié: (2026)
Ranking Distillation for Open-Ended Video Question Answering with Insufficient Labels
par: Liang, Tianming, et autres
Publié: (2024)
par: Liang, Tianming, et autres
Publié: (2024)
Tool-Augmented Spatiotemporal Reasoning for Streamlining Video Question Answering Task
par: Fan, Sunqi, et autres
Publié: (2025)
par: Fan, Sunqi, et autres
Publié: (2025)
Documents similaires
-
From Frames to Clips: Training-free Adaptive Key Clip Selection for Long-Form Video Understanding
par: Sun, Guangyu, et autres
Publié: (2025) -
Learning to Rank Caption Chains for Video-Text Alignment
par: Blume, Ansel, et autres
Publié: (2026) -
CounterVid: Counterfactual Video Generation for Mitigating Action and Temporal Hallucinations in Video-Language Models
par: Poppi, Tobia, et autres
Publié: (2026) -
Semantic Event Graphs for Long-Form Video Question Answering
par: Dixit, Aradhya, et autres
Publié: (2026) -
Grounded Question-Answering in Long Egocentric Videos
par: Di, Shangzhe, et autres
Publié: (2023)