LongViTU: Instruction Tuning for Long-Form Video Understanding
Fuente:
arXiv
Salvato in:
| Autori principali: | Wu, Rujie, Ma, Xiaojian, Ci, Hai, Fan, Yue, Wang, Yuxuan, Zhao, Haozhe, Li, Qing, Wang, Yizhou |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning
di: Wu, Rujie, et al.
Pubblicazione: (2026)
di: Wu, Rujie, et al.
Pubblicazione: (2026)
VideoAgent: A Memory-augmented Multimodal Agent for Video Understanding
di: Fan, Yue, et al.
Pubblicazione: (2024)
di: Fan, Yue, et al.
Pubblicazione: (2024)
Embodied VideoAgent: Persistent Memory from Egocentric Videos and Embodied Sensors Enables Dynamic Scene Understanding
di: Fan, Yue, et al.
Pubblicazione: (2024)
di: Fan, Yue, et al.
Pubblicazione: (2024)
UltraEdit: Instruction-based Fine-Grained Image Editing at Scale
di: Zhao, Haozhe, et al.
Pubblicazione: (2024)
di: Zhao, Haozhe, et al.
Pubblicazione: (2024)
NEP: Autoregressive Image Editing via Next Editing Token Prediction
di: Wu, Huimin, et al.
Pubblicazione: (2025)
di: Wu, Huimin, et al.
Pubblicazione: (2025)
T*: Re-thinking Temporal Search for Long-Form Video Understanding
di: Ye, Jinhui, et al.
Pubblicazione: (2025)
di: Ye, Jinhui, et al.
Pubblicazione: (2025)
SeViCES: Unifying Semantic-Visual Evidence Consensus for Long Video Understanding
di: Sheng, Yuan, et al.
Pubblicazione: (2025)
di: Sheng, Yuan, et al.
Pubblicazione: (2025)
Zero-Shot Long-Form Video Understanding through Screenplay
di: Wu, Yongliang, et al.
Pubblicazione: (2024)
di: Wu, Yongliang, et al.
Pubblicazione: (2024)
Video-EM: Event-Centric Episodic Memory for Long-Form Video Understanding
di: Wang, Yun, et al.
Pubblicazione: (2025)
di: Wang, Yun, et al.
Pubblicazione: (2025)
Long-VMNet: Accelerating Long-Form Video Understanding via Fixed Memory
di: Gurukar, Saket, et al.
Pubblicazione: (2025)
di: Gurukar, Saket, et al.
Pubblicazione: (2025)
Text-Conditioned Resampler For Long Form Video Understanding
di: Korbar, Bruno, et al.
Pubblicazione: (2023)
di: Korbar, Bruno, et al.
Pubblicazione: (2023)
Video Token Merging for Long-form Video Understanding
di: Lee, Seon-Ho, et al.
Pubblicazione: (2024)
di: Lee, Seon-Ho, et al.
Pubblicazione: (2024)
Semantic Gaussians: Open-Vocabulary Scene Understanding with 3D Gaussian Splatting
di: Guo, Jun, et al.
Pubblicazione: (2024)
di: Guo, Jun, et al.
Pubblicazione: (2024)
TimeSuite: Improving MLLMs for Long Video Understanding via Grounded Tuning
di: Zeng, Xiangyu, et al.
Pubblicazione: (2024)
di: Zeng, Xiangyu, et al.
Pubblicazione: (2024)
Query-Conditioned Evidential Keyframe Sampling for MLLM-Based Long-Form Video Understanding
di: Wang, Yiheng, et al.
Pubblicazione: (2026)
di: Wang, Yiheng, et al.
Pubblicazione: (2026)
Temporal Preference Optimization for Long-Form Video Understanding
di: Li, Rui, et al.
Pubblicazione: (2025)
di: Li, Rui, et al.
Pubblicazione: (2025)
ChronoEarth-492K: A Large Scale and Long Horizon Spatiotemporal Hyperspectral Earth Observation Dataset and Benchmark
di: Si, Haozhe, et al.
Pubblicazione: (2026)
di: Si, Haozhe, et al.
Pubblicazione: (2026)
VideoLLaMB: Long Streaming Video Understanding with Recurrent Memory Bridges
di: Wang, Yuxuan, et al.
Pubblicazione: (2024)
di: Wang, Yuxuan, et al.
Pubblicazione: (2024)
MMBench-Video: A Long-Form Multi-Shot Benchmark for Holistic Video Understanding
di: Fang, Xinyu, et al.
Pubblicazione: (2024)
di: Fang, Xinyu, et al.
Pubblicazione: (2024)
MovieChat: From Dense Token to Sparse Memory for Long Video Understanding
di: Song, Enxin, et al.
Pubblicazione: (2023)
di: Song, Enxin, et al.
Pubblicazione: (2023)
Towards Long-Form Spatio-Temporal Video Grounding
di: Gu, Xin, et al.
Pubblicazione: (2026)
di: Gu, Xin, et al.
Pubblicazione: (2026)
AdaptToken: Entropy-based Adaptive Token Selection for MLLM Long Video Understanding
di: Qi, Haozhe, et al.
Pubblicazione: (2026)
di: Qi, Haozhe, et al.
Pubblicazione: (2026)
Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models
di: Ma, Martin Q., et al.
Pubblicazione: (2026)
di: Ma, Martin Q., et al.
Pubblicazione: (2026)
Long Context Tuning for Video Generation
di: Guo, Yuwei, et al.
Pubblicazione: (2025)
di: Guo, Yuwei, et al.
Pubblicazione: (2025)
LoViC: Efficient Long Video Generation with Context Compression
di: Jiang, Jiaxiu, et al.
Pubblicazione: (2025)
di: Jiang, Jiaxiu, et al.
Pubblicazione: (2025)
Tuning-Free Long Video Generation via Global-Local Collaborative Diffusion
di: Ma, Yongjia, et al.
Pubblicazione: (2025)
di: Ma, Yongjia, et al.
Pubblicazione: (2025)
Prompt2LVideos: Exploring Prompts for Understanding Long-Form Multimodal Videos
di: Jahagirdar, Soumya Shamarao, et al.
Pubblicazione: (2025)
di: Jahagirdar, Soumya Shamarao, et al.
Pubblicazione: (2025)
CacheFlow: Compressive Streaming Memory for Efficient Long-Form Video Understanding
di: Patel, Shrenik, et al.
Pubblicazione: (2025)
di: Patel, Shrenik, et al.
Pubblicazione: (2025)
FreeCloth: Free-form Generation Enhances Challenging Clothed Human Modeling
di: Ye, Hang, et al.
Pubblicazione: (2024)
di: Ye, Hang, et al.
Pubblicazione: (2024)
LiViBench: An Omnimodal Benchmark for Interactive Livestream Video Understanding
di: Wang, Xiaodong, et al.
Pubblicazione: (2026)
di: Wang, Xiaodong, et al.
Pubblicazione: (2026)
MR. Video: "MapReduce" is the Principle for Long Video Understanding
di: Pang, Ziqi, et al.
Pubblicazione: (2025)
di: Pang, Ziqi, et al.
Pubblicazione: (2025)
Linear Scaling Video VLMs for Long Video Understanding
di: Eyzaguirre, Cristobal, et al.
Pubblicazione: (2026)
di: Eyzaguirre, Cristobal, et al.
Pubblicazione: (2026)
ViMix-14M: A Curated Multi-Source Video-Text Dataset with Long-Form, High-Quality Captions and Crawl-Free Access
di: Yang, Timing, et al.
Pubblicazione: (2025)
di: Yang, Timing, et al.
Pubblicazione: (2025)
Multi-Sentence Grounding for Long-term Instructional Video
di: Li, Zeqian, et al.
Pubblicazione: (2023)
di: Li, Zeqian, et al.
Pubblicazione: (2023)
LVAgent: Long Video Understanding by Multi-Round Dynamical Collaboration of MLLM Agents
di: Chen, Boyu, et al.
Pubblicazione: (2025)
di: Chen, Boyu, et al.
Pubblicazione: (2025)
VideoAgent2: Enhancing the LLM-Based Agent System for Long-Form Video Understanding by Uncertainty-Aware CoT
di: Zhi, Zhuo, et al.
Pubblicazione: (2025)
di: Zhi, Zhuo, et al.
Pubblicazione: (2025)
LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding
di: Shen, Xiaoqian, et al.
Pubblicazione: (2024)
di: Shen, Xiaoqian, et al.
Pubblicazione: (2024)
AdaSpark: Adaptive Sparsity for Efficient Long-Video Understanding
di: Li, Handong, et al.
Pubblicazione: (2026)
di: Li, Handong, et al.
Pubblicazione: (2026)
VideoARM: Agentic Reasoning over Hierarchical Memory for Long-Form Video Understanding
di: Yin, Yufei, et al.
Pubblicazione: (2025)
di: Yin, Yufei, et al.
Pubblicazione: (2025)
MSJoE: Jointly Evolving MLLM and Sampler for Efficient Long-Form Video Understanding
di: Tan, Wenhui, et al.
Pubblicazione: (2026)
di: Tan, Wenhui, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning
di: Wu, Rujie, et al.
Pubblicazione: (2026) -
VideoAgent: A Memory-augmented Multimodal Agent for Video Understanding
di: Fan, Yue, et al.
Pubblicazione: (2024) -
Embodied VideoAgent: Persistent Memory from Egocentric Videos and Embodied Sensors Enables Dynamic Scene Understanding
di: Fan, Yue, et al.
Pubblicazione: (2024) -
UltraEdit: Instruction-based Fine-Grained Image Editing at Scale
di: Zhao, Haozhe, et al.
Pubblicazione: (2024) -
NEP: Autoregressive Image Editing via Next Editing Token Prediction
di: Wu, Huimin, et al.
Pubblicazione: (2025)