Glance and Focus: Memory Prompting for Multi-Event Video Question Answering
Fuente:
arXiv
Guardado en:
| Autores principales: | Bai, Ziyi, Wang, Ruiping, Chen, Xilin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Glance and Focus Reinforcement for Pan-cancer Screening
por: Wu, Linshan, et al.
Publicado: (2026)
por: Wu, Linshan, et al.
Publicado: (2026)
MovieChat+: Question-aware Sparse Memory for Long Video Question Answering
por: Song, Enxin, et al.
Publicado: (2024)
por: Song, Enxin, et al.
Publicado: (2024)
RoboPCA: Pose-centered Affordance Learning from Human Demonstrations for Robot Manipulation
por: Xiao, Zhanqi, et al.
Publicado: (2026)
por: Xiao, Zhanqi, et al.
Publicado: (2026)
Robotic Programmer: Video Instructed Policy Code Generation for Robotic Manipulation
por: Xie, Senwei, et al.
Publicado: (2025)
por: Xie, Senwei, et al.
Publicado: (2025)
Question-Answering Dense Video Events
por: Qin, Hangyu, et al.
Publicado: (2024)
por: Qin, Hangyu, et al.
Publicado: (2024)
GlanceVAD: Exploring Glance Supervision for Label-efficient Video Anomaly Detection
por: Zhang, Huaxin, et al.
Publicado: (2024)
por: Zhang, Huaxin, et al.
Publicado: (2024)
A Survey on Interpretability in Visual Recognition
por: Wan, Qiyang, et al.
Publicado: (2025)
por: Wan, Qiyang, et al.
Publicado: (2025)
VisKnow: Constructing Visual Knowledge Base for Object Understanding
por: Yao, Ziwei, et al.
Publicado: (2025)
por: Yao, Ziwei, et al.
Publicado: (2025)
Empowering Large Language Model for Continual Video Question Answering with Collaborative Prompting
por: Cai, Chen, et al.
Publicado: (2024)
por: Cai, Chen, et al.
Publicado: (2024)
FocusGraph: Graph-Structured Frame Selection for Embodied Long Video Question Answering
por: Zemskova, Tatiana, et al.
Publicado: (2026)
por: Zemskova, Tatiana, et al.
Publicado: (2026)
StreamKV: Streaming Video Question-Answering with Segment-based KV Cache Retrieval and Compression
por: Chen, Yilong, et al.
Publicado: (2025)
por: Chen, Yilong, et al.
Publicado: (2025)
BitVLA: 1-bit Vision-Language-Action Models for Robotics Manipulation
por: Wang, Hongyu, et al.
Publicado: (2025)
por: Wang, Hongyu, et al.
Publicado: (2025)
Semantic Event Graphs for Long-Form Video Question Answering
por: Dixit, Aradhya, et al.
Publicado: (2026)
por: Dixit, Aradhya, et al.
Publicado: (2026)
VDMA: Video Question Answering with Dynamically Generated Multi-Agents
por: Kugo, Noriyuki, et al.
Publicado: (2024)
por: Kugo, Noriyuki, et al.
Publicado: (2024)
ChineseVideoBench: Benchmarking Multi-modal Large Models for Chinese Video Question Answering
por: Nie, Yuxiang, et al.
Publicado: (2025)
por: Nie, Yuxiang, et al.
Publicado: (2025)
HORNet: Task-Guided Frame Selection for Video Question Answering with Vision-Language Models
por: Bai, Xiangyu, et al.
Publicado: (2026)
por: Bai, Xiangyu, et al.
Publicado: (2026)
GEAR: GEometry-motion Alternating Refinement for Articulated Object Modeling with Gaussian Splatting
por: Li, Jialin, et al.
Publicado: (2026)
por: Li, Jialin, et al.
Publicado: (2026)
Reconstruction as a Bridge for Event-Based Visual Question Answering
por: Lou, Hanyue, et al.
Publicado: (2025)
por: Lou, Hanyue, et al.
Publicado: (2025)
Glance-or-Gaze: Incentivizing LMMs to Adaptively Focus Search via Reinforcement Learning
por: Bai, Hongbo, et al.
Publicado: (2026)
por: Bai, Hongbo, et al.
Publicado: (2026)
Targeted Visual Prompting for Medical Visual Question Answering
por: Tascon-Morales, Sergio, et al.
Publicado: (2024)
por: Tascon-Morales, Sergio, et al.
Publicado: (2024)
ViLA: Efficient Video-Language Alignment for Video Question Answering
por: Wang, Xijun, et al.
Publicado: (2023)
por: Wang, Xijun, et al.
Publicado: (2023)
Object-centric Video Question Answering with Visual Grounding and Referring
por: Wang, Haochen, et al.
Publicado: (2025)
por: Wang, Haochen, et al.
Publicado: (2025)
DriveXQA: Cross-modal Visual Question Answering for Adverse Driving Scene Understanding
por: Tao, Mingzhe, et al.
Publicado: (2026)
por: Tao, Mingzhe, et al.
Publicado: (2026)
Prompting Video-Language Foundation Models with Domain-specific Fine-grained Heuristics for Video Question Answering
por: Yu, Ting, et al.
Publicado: (2024)
por: Yu, Ting, et al.
Publicado: (2024)
Grounded Question-Answering in Long Egocentric Videos
por: Di, Shangzhe, et al.
Publicado: (2023)
por: Di, Shangzhe, et al.
Publicado: (2023)
Agentic Keyframe Search for Video Question Answering
por: Fan, Sunqi, et al.
Publicado: (2025)
por: Fan, Sunqi, et al.
Publicado: (2025)
VideoMultiAgents: A Multi-Agent Framework for Video Question Answering
por: Kugo, Noriyuki, et al.
Publicado: (2025)
por: Kugo, Noriyuki, et al.
Publicado: (2025)
GS-LTS: 3D Gaussian Splatting-Based Adaptive Modeling for Long-Term Service Robots
por: Fu, Bin, et al.
Publicado: (2025)
por: Fu, Bin, et al.
Publicado: (2025)
Multi-Focus Temporal Shifting for Precise Event Spotting in Sports Videos
por: Xu, Hao, et al.
Publicado: (2025)
por: Xu, Hao, et al.
Publicado: (2025)
Question-Instructed Visual Descriptions for Zero-Shot Video Question Answering
por: Romero, David, et al.
Publicado: (2024)
por: Romero, David, et al.
Publicado: (2024)
VQAttack: Transferable Adversarial Attacks on Visual Question Answering via Pre-trained Models
por: Yin, Ziyi, et al.
Publicado: (2024)
por: Yin, Ziyi, et al.
Publicado: (2024)
Prompt Relay: Inference-Time Temporal Control for Multi-Event Video Generation
por: Chen, Gordon, et al.
Publicado: (2026)
por: Chen, Gordon, et al.
Publicado: (2026)
MoTE: Mixture of Ternary Experts for Memory-efficient Large Multimodal Models
por: Wang, Hongyu, et al.
Publicado: (2025)
por: Wang, Hongyu, et al.
Publicado: (2025)
CG-Bench: Clue-grounded Question Answering Benchmark for Long Video Understanding
por: Chen, Guo, et al.
Publicado: (2024)
por: Chen, Guo, et al.
Publicado: (2024)
LvBench: A Benchmark for Long-form Video Understanding with Versatile Multi-modal Question Answering
por: Zhang, Hongjie, et al.
Publicado: (2023)
por: Zhang, Hongjie, et al.
Publicado: (2023)
STAIR: Spatial-Temporal Reasoning with Auditable Intermediate Results for Video Question Answering
por: Wang, Yueqian, et al.
Publicado: (2024)
por: Wang, Yueqian, et al.
Publicado: (2024)
Narrative Aligned Long Form Video Question Answering
por: Jain, Rahul, et al.
Publicado: (2026)
por: Jain, Rahul, et al.
Publicado: (2026)
Unifying Image Processing as Visual Prompting Question Answering
por: Liu, Yihao, et al.
Publicado: (2023)
por: Liu, Yihao, et al.
Publicado: (2023)
VideoDistill: Language-aware Vision Distillation for Video Question Answering
por: Zou, Bo, et al.
Publicado: (2024)
por: Zou, Bo, et al.
Publicado: (2024)
REVEAL: Relation-based Video Representation Learning for Video-Question-Answering
por: Chaybouti, Sofian, et al.
Publicado: (2025)
por: Chaybouti, Sofian, et al.
Publicado: (2025)
Ejemplares similares
-
Glance and Focus Reinforcement for Pan-cancer Screening
por: Wu, Linshan, et al.
Publicado: (2026) -
MovieChat+: Question-aware Sparse Memory for Long Video Question Answering
por: Song, Enxin, et al.
Publicado: (2024) -
RoboPCA: Pose-centered Affordance Learning from Human Demonstrations for Robot Manipulation
por: Xiao, Zhanqi, et al.
Publicado: (2026) -
Robotic Programmer: Video Instructed Policy Code Generation for Robotic Manipulation
por: Xie, Senwei, et al.
Publicado: (2025) -
Question-Answering Dense Video Events
por: Qin, Hangyu, et al.
Publicado: (2024)