MovieChat+: Question-aware Sparse Memory for Long Video Question Answering
Fuente:
arXiv
Salvato in:
| Autori principali: | Song, Enxin, Chai, Wenhao, Ye, Tian, Hwang, Jenq-Neng, Li, Xi, Wang, Gaoang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MovieChat: From Dense Token to Sparse Memory for Long Video Understanding
di: Song, Enxin, et al.
Pubblicazione: (2023)
di: Song, Enxin, et al.
Pubblicazione: (2023)
AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding
di: Xu, Weili, et al.
Pubblicazione: (2025)
di: Xu, Weili, et al.
Pubblicazione: (2025)
Recent Advances in Embedding Methods for Multi-Object Tracking: A Survey
di: Wang, Gaoang, et al.
Pubblicazione: (2022)
di: Wang, Gaoang, et al.
Pubblicazione: (2022)
MPM: A Unified 2D-3D Human Pose Representation via Masked Pose Modeling
di: Zhang, Zhenyu, et al.
Pubblicazione: (2023)
di: Zhang, Zhenyu, et al.
Pubblicazione: (2023)
Pointmap Association and Piecewise-Plane Constraint for Consistent and Compact 3D Gaussian Segmentation Field
di: Hu, Wenhao, et al.
Pubblicazione: (2025)
di: Hu, Wenhao, et al.
Pubblicazione: (2025)
Video-MMLU: A Massive Multi-Discipline Lecture Understanding Benchmark
di: Song, Enxin, et al.
Pubblicazione: (2025)
di: Song, Enxin, et al.
Pubblicazione: (2025)
AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark
di: Chai, Wenhao, et al.
Pubblicazione: (2024)
di: Chai, Wenhao, et al.
Pubblicazione: (2024)
VersaT2I: Improving Text-to-Image Models with Versatile Reward
di: Guo, Jianshu, et al.
Pubblicazione: (2024)
di: Guo, Jianshu, et al.
Pubblicazione: (2024)
SAMURAI: Adapting Segment Anything Model for Zero-Shot Visual Tracking with Motion-Aware Memory
di: Yang, Cheng-Yen, et al.
Pubblicazione: (2024)
di: Yang, Cheng-Yen, et al.
Pubblicazione: (2024)
CityGen: Infinite and Controllable City Layout Generation
di: Deng, Jie, et al.
Pubblicazione: (2023)
di: Deng, Jie, et al.
Pubblicazione: (2023)
Warehouse Spatial Question Answering with LLM Agent
di: Huang, Hsiang-Wei, et al.
Pubblicazione: (2025)
di: Huang, Hsiang-Wei, et al.
Pubblicazione: (2025)
CityCraft: A Real Crafter for 3D City Generation
di: Deng, Jie, et al.
Pubblicazione: (2024)
di: Deng, Jie, et al.
Pubblicazione: (2024)
MovieRecapsQA: A Multimodal Open-Ended Video Question-Answering Benchmark
di: Shaar, Shaden, et al.
Pubblicazione: (2026)
di: Shaar, Shaden, et al.
Pubblicazione: (2026)
Grounded Question-Answering in Long Egocentric Videos
di: Di, Shangzhe, et al.
Pubblicazione: (2023)
di: Di, Shangzhe, et al.
Pubblicazione: (2023)
MambaMOT: State-Space Model as Motion Predictor for Multi-Object Tracking
di: Huang, Hsiang-Wei, et al.
Pubblicazione: (2024)
di: Huang, Hsiang-Wei, et al.
Pubblicazione: (2024)
VideoDistill: Language-aware Vision Distillation for Video Question Answering
di: Zou, Bo, et al.
Pubblicazione: (2024)
di: Zou, Bo, et al.
Pubblicazione: (2024)
VideoNSA: Native Sparse Attention Scales Video Understanding
di: Song, Enxin, et al.
Pubblicazione: (2025)
di: Song, Enxin, et al.
Pubblicazione: (2025)
UniHPR: Unified Human Pose Representation via Singular Value Contrastive Learning
di: Jiang, Zhongyu, et al.
Pubblicazione: (2025)
di: Jiang, Zhongyu, et al.
Pubblicazione: (2025)
Enhancing Long Video Question Answering with Scene-Localized Frame Grouping
di: Yang, Xuyi, et al.
Pubblicazione: (2025)
di: Yang, Xuyi, et al.
Pubblicazione: (2025)
Narrative Aligned Long Form Video Question Answering
di: Jain, Rahul, et al.
Pubblicazione: (2026)
di: Jain, Rahul, et al.
Pubblicazione: (2026)
ToSA: Token Merging with Spatial Awareness
di: Huang, Hsiang-Wei, et al.
Pubblicazione: (2025)
di: Huang, Hsiang-Wei, et al.
Pubblicazione: (2025)
SurgLQA: Scalable Long-Horizon Surgical Video Question Answering
di: Guo, Diandian, et al.
Pubblicazione: (2026)
di: Guo, Diandian, et al.
Pubblicazione: (2026)
DSG-World: Learning a 3D Gaussian World Model from Dual State Videos
di: Hu, Wenhao, et al.
Pubblicazione: (2025)
di: Hu, Wenhao, et al.
Pubblicazione: (2025)
Glance and Focus: Memory Prompting for Multi-Event Video Question Answering
di: Bai, Ziyi, et al.
Pubblicazione: (2024)
di: Bai, Ziyi, et al.
Pubblicazione: (2024)
A Simple LLM Framework for Long-Range Video Question-Answering
di: Zhang, Ce, et al.
Pubblicazione: (2023)
di: Zhang, Ce, et al.
Pubblicazione: (2023)
BIMBA: Selective-Scan Compression for Long-Range Video Question Answering
di: Islam, Md Mohaiminul, et al.
Pubblicazione: (2025)
di: Islam, Md Mohaiminul, et al.
Pubblicazione: (2025)
Question-Instructed Visual Descriptions for Zero-Shot Video Question Answering
di: Romero, David, et al.
Pubblicazione: (2024)
di: Romero, David, et al.
Pubblicazione: (2024)
Semantic Event Graphs for Long-Form Video Question Answering
di: Dixit, Aradhya, et al.
Pubblicazione: (2026)
di: Dixit, Aradhya, et al.
Pubblicazione: (2026)
FIQ: Fundamental Question Generation with the Integration of Question Embeddings for Video Question Answering
di: Oh, Ju-Young, et al.
Pubblicazione: (2025)
di: Oh, Ju-Young, et al.
Pubblicazione: (2025)
CG-Bench: Clue-grounded Question Answering Benchmark for Long Video Understanding
di: Chen, Guo, et al.
Pubblicazione: (2024)
di: Chen, Guo, et al.
Pubblicazione: (2024)
Foundational Question Generation for Video Question Answering via an Embedding-Integrated Approach
di: Oh, Ju-Young
Pubblicazione: (2025)
di: Oh, Ju-Young
Pubblicazione: (2025)
VidCtx: Context-aware Video Question Answering with Image Models
di: Goulas, Andreas, et al.
Pubblicazione: (2024)
di: Goulas, Andreas, et al.
Pubblicazione: (2024)
Agentic Keyframe Search for Video Question Answering
di: Fan, Sunqi, et al.
Pubblicazione: (2025)
di: Fan, Sunqi, et al.
Pubblicazione: (2025)
Blind Inpainting with Object-aware Discrimination for Artificial Marker Removal
di: Guo, Xuechen, et al.
Pubblicazione: (2023)
di: Guo, Xuechen, et al.
Pubblicazione: (2023)
InViC: Intent-aware Visual Cues for Medical Visual Question Answering
di: Wang, Zhisong, et al.
Pubblicazione: (2026)
di: Wang, Zhisong, et al.
Pubblicazione: (2026)
LLMs Meet Long Video: Advancing Long Video Question Answering with An Interactive Visual Adapter in LLMs
di: Li, Yunxin, et al.
Pubblicazione: (2024)
di: Li, Yunxin, et al.
Pubblicazione: (2024)
DocPrune:Efficient Document Question Answering via Background, Question, and Comprehension-aware Token Pruning
di: Choi, Joonmyung, et al.
Pubblicazione: (2026)
di: Choi, Joonmyung, et al.
Pubblicazione: (2026)
Streaming Video Question-Answering with In-context Video KV-Cache Retrieval
di: Di, Shangzhe, et al.
Pubblicazione: (2025)
di: Di, Shangzhe, et al.
Pubblicazione: (2025)
Encoding and Controlling Global Semantics for Long-form Video Question Answering
di: Nguyen, Thong Thanh, et al.
Pubblicazione: (2024)
di: Nguyen, Thong Thanh, et al.
Pubblicazione: (2024)
FocusGraph: Graph-Structured Frame Selection for Embodied Long Video Question Answering
di: Zemskova, Tatiana, et al.
Pubblicazione: (2026)
di: Zemskova, Tatiana, et al.
Pubblicazione: (2026)
Documenti analoghi
-
MovieChat: From Dense Token to Sparse Memory for Long Video Understanding
di: Song, Enxin, et al.
Pubblicazione: (2023) -
AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding
di: Xu, Weili, et al.
Pubblicazione: (2025) -
Recent Advances in Embedding Methods for Multi-Object Tracking: A Survey
di: Wang, Gaoang, et al.
Pubblicazione: (2022) -
MPM: A Unified 2D-3D Human Pose Representation via Masked Pose Modeling
di: Zhang, Zhenyu, et al.
Pubblicazione: (2023) -
Pointmap Association and Piecewise-Plane Constraint for Consistent and Compact 3D Gaussian Segmentation Field
di: Hu, Wenhao, et al.
Pubblicazione: (2025)