Salvato in:
| Autori principali: | Weng, Yuetian, Han, Mingfei, He, Haoyu, Chang, Xiaojun, Zhuang, Bohan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2404.03384 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Shot2Story: A New Benchmark for Comprehensive Understanding of Multi-shot Videos
di: Han, Mingfei, et al.
Pubblicazione: (2023)
di: Han, Mingfei, et al.
Pubblicazione: (2023)
BlockVid: Block Diffusion for High-Quality and Consistent Minute-Long Video Generation
di: Zhang, Zeyu, et al.
Pubblicazione: (2025)
di: Zhang, Zeyu, et al.
Pubblicazione: (2025)
SlowFast-LLaVA-1.5: A Family of Token-Efficient Video Large Language Models for Long-Form Video Understanding
di: Xu, Mingze, et al.
Pubblicazione: (2025)
di: Xu, Mingze, et al.
Pubblicazione: (2025)
Streaming Long Video Understanding with Large Language Models
di: Qian, Rui, et al.
Pubblicazione: (2024)
di: Qian, Rui, et al.
Pubblicazione: (2024)
VirtueBench: Evaluating Trustworthiness under Uncertainty in Long Video Understanding
di: Yu, Xueqing, et al.
Pubblicazione: (2026)
di: Yu, Xueqing, et al.
Pubblicazione: (2026)
LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding
di: Shen, Xiaoqian, et al.
Pubblicazione: (2024)
di: Shen, Xiaoqian, et al.
Pubblicazione: (2024)
FlashBlock: Attention Caching for Efficient Long-Context Block Diffusion
di: Chen, Zhuokun, et al.
Pubblicazione: (2026)
di: Chen, Zhuokun, et al.
Pubblicazione: (2026)
Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism
di: Chen, Tao, et al.
Pubblicazione: (2026)
di: Chen, Tao, et al.
Pubblicazione: (2026)
Understanding Long Videos with Multimodal Language Models
di: Ranasinghe, Kanchana, et al.
Pubblicazione: (2024)
di: Ranasinghe, Kanchana, et al.
Pubblicazione: (2024)
Order from Chaos: Physical World Understanding from Glitchy Gameplay Videos
di: Cao, Meng, et al.
Pubblicazione: (2026)
di: Cao, Meng, et al.
Pubblicazione: (2026)
Motion Mamba: Efficient and Long Sequence Motion Generation
di: Zhang, Zeyu, et al.
Pubblicazione: (2024)
di: Zhang, Zeyu, et al.
Pubblicazione: (2024)
Learning Compact Video Representations for Efficient Long-form Video Understanding in Large Multimodal Models
di: Chen, Yuxiao, et al.
Pubblicazione: (2026)
di: Chen, Yuxiao, et al.
Pubblicazione: (2026)
TemporalVLM: Video LLMs for Temporal Reasoning in Long Videos
di: Fateh, Fawad Javed, et al.
Pubblicazione: (2024)
di: Fateh, Fawad Javed, et al.
Pubblicazione: (2024)
Long Video Understanding with Learnable Retrieval in Video-Language Models
di: Xu, Jiaqi, et al.
Pubblicazione: (2023)
di: Xu, Jiaqi, et al.
Pubblicazione: (2023)
Language Repository for Long Video Understanding
di: Kahatapitiya, Kumara, et al.
Pubblicazione: (2024)
di: Kahatapitiya, Kumara, et al.
Pubblicazione: (2024)
TriAttention: Efficient Long Reasoning with Trigonometric KV Compression
di: Mao, Weian, et al.
Pubblicazione: (2026)
di: Mao, Weian, et al.
Pubblicazione: (2026)
Mitigating Data Redundancy to Revitalize Transformer-based Long-Term Time Series Forecasting System
di: Li, Mingjie, et al.
Pubblicazione: (2022)
di: Li, Mingjie, et al.
Pubblicazione: (2022)
Efficient Stitchable Task Adaptation
di: He, Haoyu, et al.
Pubblicazione: (2023)
di: He, Haoyu, et al.
Pubblicazione: (2023)
Beyond Dense Futures: World Models as Structured Planners for Robotic Manipulation
di: Jin, Minghao, et al.
Pubblicazione: (2026)
di: Jin, Minghao, et al.
Pubblicazione: (2026)
WorldWeaver: Generating Long-Horizon Video Worlds via Rich Perception
di: Liu, Zhiheng, et al.
Pubblicazione: (2025)
di: Liu, Zhiheng, et al.
Pubblicazione: (2025)
Progressive Online Video Understanding with Evidence-Aligned Timing and Transparent Decisions
di: Zhang, Kecheng, et al.
Pubblicazione: (2026)
di: Zhang, Kecheng, et al.
Pubblicazione: (2026)
Self-ReS: Self-Reflection in Large Vision-Language Models for Long Video Understanding
di: Pereira, Joao, et al.
Pubblicazione: (2025)
di: Pereira, Joao, et al.
Pubblicazione: (2025)
LongVILA: Scaling Long-Context Visual Language Models for Long Videos
di: Chen, Yukang, et al.
Pubblicazione: (2024)
di: Chen, Yukang, et al.
Pubblicazione: (2024)
STORM: Token-Efficient Long Video Understanding for Multimodal LLMs
di: Jiang, Jindong, et al.
Pubblicazione: (2025)
di: Jiang, Jindong, et al.
Pubblicazione: (2025)
Towards Effective Long Video Understanding of Multimodal Large Language Models via One-shot Clip Retrieval
di: Chen, Tao, et al.
Pubblicazione: (2025)
di: Chen, Tao, et al.
Pubblicazione: (2025)
OmniSparse: Training-Aware Fine-Grained Sparse Attention for Long-Video MLLMs
di: Chen, Feng, et al.
Pubblicazione: (2025)
di: Chen, Feng, et al.
Pubblicazione: (2025)
MA-LMM: Memory-Augmented Large Multimodal Model for Long-Term Video Understanding
di: He, Bo, et al.
Pubblicazione: (2024)
di: He, Bo, et al.
Pubblicazione: (2024)
LongCaptioning: Unlocking the Power of Long Video Caption Generation in Large Multimodal Models
di: Wei, Hongchen, et al.
Pubblicazione: (2025)
di: Wei, Hongchen, et al.
Pubblicazione: (2025)
CogVLM2: Visual Language Models for Image and Video Understanding
di: Hong, Wenyi, et al.
Pubblicazione: (2024)
di: Hong, Wenyi, et al.
Pubblicazione: (2024)
Implicit Geometry Representations for Vision-and-Language Navigation from Web Videos
di: Han, Mingfei, et al.
Pubblicazione: (2026)
di: Han, Mingfei, et al.
Pubblicazione: (2026)
BOLT: Boost Large Vision-Language Model Without Training for Long-form Video Understanding
di: Liu, Shuming, et al.
Pubblicazione: (2025)
di: Liu, Shuming, et al.
Pubblicazione: (2025)
Towards Event-oriented Long Video Understanding
di: Du, Yifan, et al.
Pubblicazione: (2024)
di: Du, Yifan, et al.
Pubblicazione: (2024)
ReCA: Multi-Shot Long Video Extrapolation via Recursive Context Allocation
di: Liu, Akide, et al.
Pubblicazione: (2026)
di: Liu, Akide, et al.
Pubblicazione: (2026)
Long-VMNet: Accelerating Long-Form Video Understanding via Fixed Memory
di: Gurukar, Saket, et al.
Pubblicazione: (2025)
di: Gurukar, Saket, et al.
Pubblicazione: (2025)
PersonaVLM: Long-Term Personalized Multimodal LLMs
di: Nie, Chang, et al.
Pubblicazione: (2026)
di: Nie, Chang, et al.
Pubblicazione: (2026)
Goldfish: Vision-Language Understanding of Arbitrarily Long Videos
di: Ataallah, Kirolos, et al.
Pubblicazione: (2024)
di: Ataallah, Kirolos, et al.
Pubblicazione: (2024)
Self-Consistency as a Free Lunch: Reducing Hallucinations in Vision-Language Models via Self-Reflection
di: Han, Mingfei, et al.
Pubblicazione: (2025)
di: Han, Mingfei, et al.
Pubblicazione: (2025)
ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification
di: He, Yefei, et al.
Pubblicazione: (2024)
di: He, Yefei, et al.
Pubblicazione: (2024)
Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding
di: Shu, Yan, et al.
Pubblicazione: (2024)
di: Shu, Yan, et al.
Pubblicazione: (2024)
PSA: Pyramid Sparse Attention for Efficient Video Understanding and Generation
di: Li, Xiaolong, et al.
Pubblicazione: (2025)
di: Li, Xiaolong, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Shot2Story: A New Benchmark for Comprehensive Understanding of Multi-shot Videos
di: Han, Mingfei, et al.
Pubblicazione: (2023) -
BlockVid: Block Diffusion for High-Quality and Consistent Minute-Long Video Generation
di: Zhang, Zeyu, et al.
Pubblicazione: (2025) -
SlowFast-LLaVA-1.5: A Family of Token-Efficient Video Large Language Models for Long-Form Video Understanding
di: Xu, Mingze, et al.
Pubblicazione: (2025) -
Streaming Long Video Understanding with Large Language Models
di: Qian, Rui, et al.
Pubblicazione: (2024) -
VirtueBench: Evaluating Trustworthiness under Uncertainty in Long Video Understanding
di: Yu, Xueqing, et al.
Pubblicazione: (2026)