LongVideo-R1: Smart Navigation for Low-cost Long Video Understanding
Fuente:
arXiv
Guardado en:
| Autores principales: | Qiu, Jihao, Xie, Lingxi, Huo, Xinyue, Tian, Qi, Ye, Qixiang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Adaptive Keyframe Sampling for Long Video Understanding
por: Tang, Xi, et al.
Publicado: (2025)
por: Tang, Xi, et al.
Publicado: (2025)
Artemis: Towards Referential Understanding in Complex Videos
por: Qiu, Jihao, et al.
Publicado: (2024)
por: Qiu, Jihao, et al.
Publicado: (2024)
Fast-iTPN: Integrally Pre-Trained Transformer Pyramid Network with Token Migration
por: Tian, Yunjie, et al.
Publicado: (2022)
por: Tian, Yunjie, et al.
Publicado: (2022)
ChatterBox: Multi-round Multimodal Referring and Grounding
por: Tian, Yunjie, et al.
Publicado: (2024)
por: Tian, Yunjie, et al.
Publicado: (2024)
ClawMachine: Learning to Fetch Visual Tokens for Referential Comprehension
por: Ma, Tianren, et al.
Publicado: (2024)
por: Ma, Tianren, et al.
Publicado: (2024)
Long Video Understanding with Learnable Retrieval in Video-Language Models
por: Xu, Jiaqi, et al.
Publicado: (2023)
por: Xu, Jiaqi, et al.
Publicado: (2023)
VAU-R1: Advancing Video Anomaly Understanding via Reinforcement Fine-Tuning
por: Zhu, Liyun, et al.
Publicado: (2025)
por: Zhu, Liyun, et al.
Publicado: (2025)
Video-MTR: Reinforced Multi-Turn Reasoning for Long Video Understanding
por: Xie, Yuan, et al.
Publicado: (2025)
por: Xie, Yuan, et al.
Publicado: (2025)
View while Moving: Efficient Video Recognition in Long-untrimmed Videos
por: Tian, Ye, et al.
Publicado: (2023)
por: Tian, Ye, et al.
Publicado: (2023)
ALLVB: All-in-One Long Video Understanding Benchmark
por: Tan, Xichen, et al.
Publicado: (2025)
por: Tan, Xichen, et al.
Publicado: (2025)
Video-XL-Pro: Reconstructive Token Compression for Extremely Long Video Understanding
por: Liu, Xiangrui, et al.
Publicado: (2025)
por: Liu, Xiangrui, et al.
Publicado: (2025)
AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding
por: Xu, Weili, et al.
Publicado: (2025)
por: Xu, Weili, et al.
Publicado: (2025)
Linear Scaling Video VLMs for Long Video Understanding
por: Eyzaguirre, Cristobal, et al.
Publicado: (2026)
por: Eyzaguirre, Cristobal, et al.
Publicado: (2026)
Video Token Merging for Long-form Video Understanding
por: Lee, Seon-Ho, et al.
Publicado: (2024)
por: Lee, Seon-Ho, et al.
Publicado: (2024)
Hallucination Mitigation Prompts Long-term Video Understanding
por: Sun, Yiwei, et al.
Publicado: (2024)
por: Sun, Yiwei, et al.
Publicado: (2024)
Towards Event-oriented Long Video Understanding
por: Du, Yifan, et al.
Publicado: (2024)
por: Du, Yifan, et al.
Publicado: (2024)
Video Panels for Long Video Understanding
por: Doorenbos, Lars, et al.
Publicado: (2025)
por: Doorenbos, Lars, et al.
Publicado: (2025)
Language Repository for Long Video Understanding
por: Kahatapitiya, Kumara, et al.
Publicado: (2024)
por: Kahatapitiya, Kumara, et al.
Publicado: (2024)
VideoTIR: Accurate Understanding for Long Videos with Efficient Tool-Integrated Reasoning
por: Gao, Zhe, et al.
Publicado: (2026)
por: Gao, Zhe, et al.
Publicado: (2026)
VideoLLaMB: Long Streaming Video Understanding with Recurrent Memory Bridges
por: Wang, Yuxuan, et al.
Publicado: (2024)
por: Wang, Yuxuan, et al.
Publicado: (2024)
VideoPro: Adaptive Program Reasoning for Long Video Understanding
por: Li, Chenglin, et al.
Publicado: (2025)
por: Li, Chenglin, et al.
Publicado: (2025)
VideoLucy: Deep Memory Backtracking for Long Video Understanding
por: Zuo, Jialong, et al.
Publicado: (2025)
por: Zuo, Jialong, et al.
Publicado: (2025)
DrVideo: Document Retrieval Based Long Video Understanding
por: Ma, Ziyu, et al.
Publicado: (2024)
por: Ma, Ziyu, et al.
Publicado: (2024)
MR. Video: "MapReduce" is the Principle for Long Video Understanding
por: Pang, Ziqi, et al.
Publicado: (2025)
por: Pang, Ziqi, et al.
Publicado: (2025)
LOVE-R1: Advancing Long Video Understanding with an Adaptive Zoom-in Mechanism via Multi-Step Reasoning
por: Fu, Shenghao, et al.
Publicado: (2025)
por: Fu, Shenghao, et al.
Publicado: (2025)
Event-Anchored Frame Selection for Effective Long-Video Understanding
por: Chen, Wang, et al.
Publicado: (2026)
por: Chen, Wang, et al.
Publicado: (2026)
AdaVideoRAG: Omni-Contextual Adaptive Retrieval-Augmented Efficient Long Video Understanding
por: Xue, Zhucun, et al.
Publicado: (2025)
por: Xue, Zhucun, et al.
Publicado: (2025)
LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding
por: Shen, Xiaoqian, et al.
Publicado: (2024)
por: Shen, Xiaoqian, et al.
Publicado: (2024)
Understanding Long Videos with Multimodal Language Models
por: Ranasinghe, Kanchana, et al.
Publicado: (2024)
por: Ranasinghe, Kanchana, et al.
Publicado: (2024)
Progressive Video Condensation with MLLM Agent for Long-form Video Understanding
por: Yin, Yufei, et al.
Publicado: (2026)
por: Yin, Yufei, et al.
Publicado: (2026)
VideoEval-Pro: Robust and Realistic Long Video Understanding Evaluation
por: Ma, Wentao, et al.
Publicado: (2025)
por: Ma, Wentao, et al.
Publicado: (2025)
Zero-Shot Long-Form Video Understanding through Screenplay
por: Wu, Yongliang, et al.
Publicado: (2024)
por: Wu, Yongliang, et al.
Publicado: (2024)
Small Vision-Language Models are Smart Compressors for Long Video Understanding
por: Fei, Junjie, et al.
Publicado: (2026)
por: Fei, Junjie, et al.
Publicado: (2026)
T*: Re-thinking Temporal Search for Long-Form Video Understanding
por: Ye, Jinhui, et al.
Publicado: (2025)
por: Ye, Jinhui, et al.
Publicado: (2025)
HLV-1K: A Large-scale Hour-Long Video Benchmark for Time-Specific Long Video Understanding
por: Zou, Heqing, et al.
Publicado: (2025)
por: Zou, Heqing, et al.
Publicado: (2025)
Text-guided Fine-Grained Video Anomaly Understanding
por: Gu, Jihao, et al.
Publicado: (2025)
por: Gu, Jihao, et al.
Publicado: (2025)
MovieChat: From Dense Token to Sparse Memory for Long Video Understanding
por: Song, Enxin, et al.
Publicado: (2023)
por: Song, Enxin, et al.
Publicado: (2023)
TextVidBench: A Benchmark for Long Video Scene Text Understanding
por: Zhong, Yangyang, et al.
Publicado: (2025)
por: Zhong, Yangyang, et al.
Publicado: (2025)
VideoAtlas: Navigating Long-Form Video in Logarithmic Compute
por: Eltahir, Mohamed, et al.
Publicado: (2026)
por: Eltahir, Mohamed, et al.
Publicado: (2026)
Question-guided Visual Compression with Memory Feedback for Long-Term Video Understanding
por: Yamao, Sosuke, et al.
Publicado: (2026)
por: Yamao, Sosuke, et al.
Publicado: (2026)
Ejemplares similares
-
Adaptive Keyframe Sampling for Long Video Understanding
por: Tang, Xi, et al.
Publicado: (2025) -
Artemis: Towards Referential Understanding in Complex Videos
por: Qiu, Jihao, et al.
Publicado: (2024) -
Fast-iTPN: Integrally Pre-Trained Transformer Pyramid Network with Token Migration
por: Tian, Yunjie, et al.
Publicado: (2022) -
ChatterBox: Multi-round Multimodal Referring and Grounding
por: Tian, Yunjie, et al.
Publicado: (2024) -
ClawMachine: Learning to Fetch Visual Tokens for Referential Comprehension
por: Ma, Tianren, et al.
Publicado: (2024)