Grounded Multi-Hop VideoQA in Long-Form Egocentric Videos
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Qirui, Di, Shangzhe, Xie, Weidi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Grounded Question-Answering in Long Egocentric Videos
por: Di, Shangzhe, et al.
Publicado: (2023)
por: Di, Shangzhe, et al.
Publicado: (2023)
Enhancing Video-LLM Reasoning via Agent-of-Thoughts Distillation
por: Shi, Yudi, et al.
Publicado: (2024)
por: Shi, Yudi, et al.
Publicado: (2024)
Multi-Sentence Grounding for Long-term Instructional Video
por: Li, Zeqian, et al.
Publicado: (2023)
por: Li, Zeqian, et al.
Publicado: (2023)
Universal Video Temporal Grounding with Generative Multi-modal Large Language Models
por: Li, Zeqian, et al.
Publicado: (2025)
por: Li, Zeqian, et al.
Publicado: (2025)
Beyond Isolated Facts: Synthesizing Narrative and Grounded Supervision for VideoQA
por: Liang, Jianxin, et al.
Publicado: (2025)
por: Liang, Jianxin, et al.
Publicado: (2025)
Revisiting Multi-Task Visual Representation Learning
por: Di, Shangzhe, et al.
Publicado: (2026)
por: Di, Shangzhe, et al.
Publicado: (2026)
Reading Between the Lanes: Text VideoQA on the Road
por: Tom, George, et al.
Publicado: (2023)
por: Tom, George, et al.
Publicado: (2023)
Weaver: End-to-End Agentic System Training for Video Interleaved Reasoning
por: Shi, Yudi, et al.
Publicado: (2026)
por: Shi, Yudi, et al.
Publicado: (2026)
VideoQA in the Era of LLMs: An Empirical Study
por: Xiao, Junbin, et al.
Publicado: (2024)
por: Xiao, Junbin, et al.
Publicado: (2024)
Learning Streaming Video Representation via Multitask Training
por: Yan, Yibin, et al.
Publicado: (2025)
por: Yan, Yibin, et al.
Publicado: (2025)
Understanding Complexity in VideoQA via Visual Program Generation
por: Eyzaguirre, Cristobal, et al.
Publicado: (2025)
por: Eyzaguirre, Cristobal, et al.
Publicado: (2025)
ENTER: Event Based Interpretable Reasoning for VideoQA
por: Ayyubi, Hammad, et al.
Publicado: (2025)
por: Ayyubi, Hammad, et al.
Publicado: (2025)
ReasVQA: Advancing VideoQA with Imperfect Reasoning Process
por: Liang, Jianxin, et al.
Publicado: (2025)
por: Liang, Jianxin, et al.
Publicado: (2025)
QTG-VQA: Question-Type-Guided Architectural for VideoQA Systems
por: He, Zhixian, et al.
Publicado: (2024)
por: He, Zhixian, et al.
Publicado: (2024)
CCTVBench: Contrastive Consistency Traffic VideoQA Benchmark for Multimodal LLMs
por: Zhou, Xingcheng, et al.
Publicado: (2026)
por: Zhou, Xingcheng, et al.
Publicado: (2026)
TUMTraffic-VideoQA: A Benchmark for Unified Spatio-Temporal Video Understanding in Traffic Scenes
por: Zhou, Xingcheng, et al.
Publicado: (2025)
por: Zhou, Xingcheng, et al.
Publicado: (2025)
Video Flow as Time Series: Discovering Temporal Consistency and Variability for VideoQA
por: Song, Zijie, et al.
Publicado: (2025)
por: Song, Zijie, et al.
Publicado: (2025)
VideoQA-SC: Adaptive Semantic Communication for Video Question Answering
por: Guo, Jiangyuan, et al.
Publicado: (2024)
por: Guo, Jiangyuan, et al.
Publicado: (2024)
ActionAtlas: A VideoQA Benchmark for Domain-specialized Action Recognition
por: Salehi, Mohammadreza, et al.
Publicado: (2024)
por: Salehi, Mohammadreza, et al.
Publicado: (2024)
Retrieval-Augmented Egocentric Video Captioning
por: Xu, Jilan, et al.
Publicado: (2024)
por: Xu, Jilan, et al.
Publicado: (2024)
DenseStep2M: A Scalable, Training-Free Pipeline for Dense Instructional Video Annotation
por: Ge, Mingji, et al.
Publicado: (2026)
por: Ge, Mingji, et al.
Publicado: (2026)
Dissecting Multimodality in VideoQA Transformer Models by Impairing Modality Fusion
por: Rawal, Ishaan Singh, et al.
Publicado: (2023)
por: Rawal, Ishaan Singh, et al.
Publicado: (2023)
Object-centric Video Question Answering with Visual Grounding and Referring
por: Wang, Haochen, et al.
Publicado: (2025)
por: Wang, Haochen, et al.
Publicado: (2025)
Neural-Symbolic VideoQA: Learning Compositional Spatio-Temporal Reasoning for Real-world Video Question Answering
por: Liang, Lili, et al.
Publicado: (2024)
por: Liang, Lili, et al.
Publicado: (2024)
Perception Test 2024: Challenge Summary and a Novel Hour-Long VideoQA Benchmark
por: Heyward, Joseph, et al.
Publicado: (2024)
por: Heyward, Joseph, et al.
Publicado: (2024)
RoadSocial: A Diverse VideoQA Dataset and Benchmark for Road Event Understanding from Social Video Narratives
por: Parikh, Chirag, et al.
Publicado: (2025)
por: Parikh, Chirag, et al.
Publicado: (2025)
StreamingCoT: A Dataset for Temporal Dynamics and Multimodal Chain-of-Thought Reasoning in Streaming VideoQA
por: Hu, Yuhang, et al.
Publicado: (2025)
por: Hu, Yuhang, et al.
Publicado: (2025)
Video-in-the-Loop: Span-Grounded Long Video QA with Interleaved Reasoning
por: Wang, Chendong, et al.
Publicado: (2025)
por: Wang, Chendong, et al.
Publicado: (2025)
NeuS-QA: Grounding Long-Form Video Understanding in Temporal Logic and Neuro-Symbolic Reasoning
por: Shah, Sahil, et al.
Publicado: (2025)
por: Shah, Sahil, et al.
Publicado: (2025)
Moment Sampling in Video LLMs for Long-Form Video QA
por: Chasmai, Mustafa, et al.
Publicado: (2025)
por: Chasmai, Mustafa, et al.
Publicado: (2025)
OmniStream: Mastering Perception, Reconstruction and Action in Continuous Streams
por: Yan, Yibin, et al.
Publicado: (2026)
por: Yan, Yibin, et al.
Publicado: (2026)
Multi-sentence Video Grounding for Long Video Generation
por: Feng, Wei, et al.
Publicado: (2024)
por: Feng, Wei, et al.
Publicado: (2024)
Towards Long-Form Spatio-Temporal Video Grounding
por: Gu, Xin, et al.
Publicado: (2026)
por: Gu, Xin, et al.
Publicado: (2026)
Modeling Fine-Grained Hand-Object Dynamics for Egocentric Video Representation Learning
por: Pei, Baoqi, et al.
Publicado: (2025)
por: Pei, Baoqi, et al.
Publicado: (2025)
Too Many Frames, Not All Useful: Efficient Strategies for Long-Form Video QA
por: Park, Jongwoo, et al.
Publicado: (2024)
por: Park, Jongwoo, et al.
Publicado: (2024)
Fine-grained Spatiotemporal Grounding on Egocentric Videos
por: Liang, Shuo, et al.
Publicado: (2025)
por: Liang, Shuo, et al.
Publicado: (2025)
Hierarchical Memory for Long Video QA
por: Wang, Yiqin, et al.
Publicado: (2024)
por: Wang, Yiqin, et al.
Publicado: (2024)
Spatial-Conditioned Reasoning in Long-Egocentric Videos
por: Tribble, James, et al.
Publicado: (2026)
por: Tribble, James, et al.
Publicado: (2026)
Video-o3: Native Interleaved Clue Seeking for Long Video Multi-Hop Reasoning
por: Zeng, Xiangyu, et al.
Publicado: (2026)
por: Zeng, Xiangyu, et al.
Publicado: (2026)
EgoEsportsQA: An Egocentric Video Benchmark for Perception and Reasoning in Esports
por: Ma, Jianzhe, et al.
Publicado: (2026)
por: Ma, Jianzhe, et al.
Publicado: (2026)
Ejemplares similares
-
Grounded Question-Answering in Long Egocentric Videos
por: Di, Shangzhe, et al.
Publicado: (2023) -
Enhancing Video-LLM Reasoning via Agent-of-Thoughts Distillation
por: Shi, Yudi, et al.
Publicado: (2024) -
Multi-Sentence Grounding for Long-term Instructional Video
por: Li, Zeqian, et al.
Publicado: (2023) -
Universal Video Temporal Grounding with Generative Multi-modal Large Language Models
por: Li, Zeqian, et al.
Publicado: (2025) -
Beyond Isolated Facts: Synthesizing Narrative and Grounded Supervision for VideoQA
por: Liang, Jianxin, et al.
Publicado: (2025)