MovieChat: From Dense Token to Sparse Memory for Long Video Understanding
Fuente:
arXiv
Salvato in:
| Autori principali: | Song, Enxin, Chai, Wenhao, Wang, Guanhong, Zhang, Yucheng, Zhou, Haoyang, Wu, Feiyang, Chi, Haozhe, Guo, Xun, Ye, Tian, Zhang, Yanting, Lu, Yan, Hwang, Jenq-Neng, Wang, Gaoang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MovieChat+: Question-aware Sparse Memory for Long Video Question Answering
di: Song, Enxin, et al.
Pubblicazione: (2024)
di: Song, Enxin, et al.
Pubblicazione: (2024)
Recent Advances in Embedding Methods for Multi-Object Tracking: A Survey
di: Wang, Gaoang, et al.
Pubblicazione: (2022)
di: Wang, Gaoang, et al.
Pubblicazione: (2022)
Pointmap Association and Piecewise-Plane Constraint for Consistent and Compact 3D Gaussian Segmentation Field
di: Hu, Wenhao, et al.
Pubblicazione: (2025)
di: Hu, Wenhao, et al.
Pubblicazione: (2025)
Video-MMLU: A Massive Multi-Discipline Lecture Understanding Benchmark
di: Song, Enxin, et al.
Pubblicazione: (2025)
di: Song, Enxin, et al.
Pubblicazione: (2025)
MPM: A Unified 2D-3D Human Pose Representation via Masked Pose Modeling
di: Zhang, Zhenyu, et al.
Pubblicazione: (2023)
di: Zhang, Zhenyu, et al.
Pubblicazione: (2023)
AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding
di: Xu, Weili, et al.
Pubblicazione: (2025)
di: Xu, Weili, et al.
Pubblicazione: (2025)
User-Aware Prefix-Tuning is a Good Learner for Personalized Image Captioning
di: Wang, Xuan, et al.
Pubblicazione: (2023)
di: Wang, Xuan, et al.
Pubblicazione: (2023)
ToSA: Token Merging with Spatial Awareness
di: Huang, Hsiang-Wei, et al.
Pubblicazione: (2025)
di: Huang, Hsiang-Wei, et al.
Pubblicazione: (2025)
CityGen: Infinite and Controllable City Layout Generation
di: Deng, Jie, et al.
Pubblicazione: (2023)
di: Deng, Jie, et al.
Pubblicazione: (2023)
SAMURAI: Adapting Segment Anything Model for Zero-Shot Visual Tracking with Motion-Aware Memory
di: Yang, Cheng-Yen, et al.
Pubblicazione: (2024)
di: Yang, Cheng-Yen, et al.
Pubblicazione: (2024)
VersaT2I: Improving Text-to-Image Models with Versatile Reward
di: Guo, Jianshu, et al.
Pubblicazione: (2024)
di: Guo, Jianshu, et al.
Pubblicazione: (2024)
Dense Video Understanding with Gated Residual Tokenization
di: Zhang, Haichao, et al.
Pubblicazione: (2025)
di: Zhang, Haichao, et al.
Pubblicazione: (2025)
AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark
di: Chai, Wenhao, et al.
Pubblicazione: (2024)
di: Chai, Wenhao, et al.
Pubblicazione: (2024)
VideoNSA: Native Sparse Attention Scales Video Understanding
di: Song, Enxin, et al.
Pubblicazione: (2025)
di: Song, Enxin, et al.
Pubblicazione: (2025)
MambaMOT: State-Space Model as Motion Predictor for Multi-Object Tracking
di: Huang, Hsiang-Wei, et al.
Pubblicazione: (2024)
di: Huang, Hsiang-Wei, et al.
Pubblicazione: (2024)
CityCraft: A Real Crafter for 3D City Generation
di: Deng, Jie, et al.
Pubblicazione: (2024)
di: Deng, Jie, et al.
Pubblicazione: (2024)
Hierarchical Auto-Organizing System for Open-Ended Multi-Agent Navigation
di: Zhao, Zhonghan, et al.
Pubblicazione: (2024)
di: Zhao, Zhonghan, et al.
Pubblicazione: (2024)
UniHPR: Unified Human Pose Representation via Singular Value Contrastive Learning
di: Jiang, Zhongyu, et al.
Pubblicazione: (2025)
di: Jiang, Zhongyu, et al.
Pubblicazione: (2025)
ChatMotion: A Multimodal Multi-Agent for Human Motion Analysis
di: Li, Lei, et al.
Pubblicazione: (2025)
di: Li, Lei, et al.
Pubblicazione: (2025)
Memory-Efficient Visual Autoregressive Modeling with Scale-Aware KV Cache Compression
di: Li, Kunjun, et al.
Pubblicazione: (2025)
di: Li, Kunjun, et al.
Pubblicazione: (2025)
MovieTeller: Tool-augmented Movie Synopsis with ID Consistent Progressive Abstraction
di: Li, Yizhi, et al.
Pubblicazione: (2026)
di: Li, Yizhi, et al.
Pubblicazione: (2026)
PackDiT: Joint Human Motion and Text Generation via Mutual Prompting
di: Jiang, Zhongyu, et al.
Pubblicazione: (2025)
di: Jiang, Zhongyu, et al.
Pubblicazione: (2025)
Do We Really Need a Complex Agent System? Distill Embodied Agent into a Single Model
di: Zhao, Zhonghan, et al.
Pubblicazione: (2024)
di: Zhao, Zhonghan, et al.
Pubblicazione: (2024)
LLaVA-Ultra: Large Chinese Language and Vision Assistant for Ultrasound
di: Guo, Xuechen, et al.
Pubblicazione: (2024)
di: Guo, Xuechen, et al.
Pubblicazione: (2024)
Reasoning Matters for 3D Visual Grounding
di: Huang, Hsiang-Wei, et al.
Pubblicazione: (2026)
di: Huang, Hsiang-Wei, et al.
Pubblicazione: (2026)
STEVE Series: Step-by-Step Construction of Agent Systems in Minecraft
di: Zhao, Zhonghan, et al.
Pubblicazione: (2024)
di: Zhao, Zhonghan, et al.
Pubblicazione: (2024)
Understanding Identity Continuity in Thermal Video through Scene-Level Consistency
di: Sun, Wei-Chieh, et al.
Pubblicazione: (2026)
di: Sun, Wei-Chieh, et al.
Pubblicazione: (2026)
DAug: Diffusion-based Channel Augmentation for Radiology Image Retrieval and Classification
di: Jin, Ying, et al.
Pubblicazione: (2024)
di: Jin, Ying, et al.
Pubblicazione: (2024)
Blind Inpainting with Object-aware Discrimination for Artificial Marker Removal
di: Guo, Xuechen, et al.
Pubblicazione: (2023)
di: Guo, Xuechen, et al.
Pubblicazione: (2023)
Memory-Augmented Query Intent Understanding for Efficient Chat-based Image Retrieval
di: Chen, Xianke, et al.
Pubblicazione: (2026)
di: Chen, Xianke, et al.
Pubblicazione: (2026)
ProTPS: Prototype-Guided Text Prompt Selection for Continual Learning
di: Mei, Jie, et al.
Pubblicazione: (2026)
di: Mei, Jie, et al.
Pubblicazione: (2026)
EVAN: Evolutional Video Streaming Adaptation via Neural Representation
di: Liu, Mufan, et al.
Pubblicazione: (2024)
di: Liu, Mufan, et al.
Pubblicazione: (2024)
Sam-Guided Enhanced Fine-Grained Encoding with Mixed Semantic Learning for Medical Image Captioning
di: Zhang, Zhenyu, et al.
Pubblicazione: (2023)
di: Zhang, Zhenyu, et al.
Pubblicazione: (2023)
Video Streaming with Kairos: An MPC-Based ABR with Streaming-Aware Throughput Prediction
di: Zhong, Ziyu, et al.
Pubblicazione: (2025)
di: Zhong, Ziyu, et al.
Pubblicazione: (2025)
Attention Consistency for LLMs Explanation
di: Lan, Tian, et al.
Pubblicazione: (2025)
di: Lan, Tian, et al.
Pubblicazione: (2025)
Modeling LLM Agent Reviewer Dynamics in Elo-Ranked Review System
di: Huang, Hsiang-Wei, et al.
Pubblicazione: (2026)
di: Huang, Hsiang-Wei, et al.
Pubblicazione: (2026)
From Global to Local: Rethinking CLIP Feature Aggregation for Person Re-Identification
di: Zheng, Aotian, et al.
Pubblicazione: (2026)
di: Zheng, Aotian, et al.
Pubblicazione: (2026)
Technical Report for ReID-SAM on SkiTB Visual Tracking Challenge 2025
di: Li, Kunjun, et al.
Pubblicazione: (2025)
di: Li, Kunjun, et al.
Pubblicazione: (2025)
TVMC: Time-Varying Mesh Compression via Multi-Stage Anchor Mesh Generation
di: Huang, He, et al.
Pubblicazione: (2025)
di: Huang, He, et al.
Pubblicazione: (2025)
FreeQ-Graph: Free-form Querying with Semantic Consistent Scene Graph for 3D Scene Understanding
di: Zhan, Chenlu, et al.
Pubblicazione: (2025)
di: Zhan, Chenlu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
MovieChat+: Question-aware Sparse Memory for Long Video Question Answering
di: Song, Enxin, et al.
Pubblicazione: (2024) -
Recent Advances in Embedding Methods for Multi-Object Tracking: A Survey
di: Wang, Gaoang, et al.
Pubblicazione: (2022) -
Pointmap Association and Piecewise-Plane Constraint for Consistent and Compact 3D Gaussian Segmentation Field
di: Hu, Wenhao, et al.
Pubblicazione: (2025) -
Video-MMLU: A Massive Multi-Discipline Lecture Understanding Benchmark
di: Song, Enxin, et al.
Pubblicazione: (2025) -
MPM: A Unified 2D-3D Human Pose Representation via Masked Pose Modeling
di: Zhang, Zhenyu, et al.
Pubblicazione: (2023)