VideoZoomer: Reinforcement-Learned Temporal Focusing for Long Video Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Ding, Yang, Zhang, Yizhen, Lai, Xin, Chu, Ruihang, Yang, Yujiu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
O-DisCo-Edit: Object Distortion Control for Unified Realistic Video Editing
di: Chen, Yuqing, et al.
Pubblicazione: (2025)
di: Chen, Yuqing, et al.
Pubblicazione: (2025)
Zoomer: Adaptive Image Focus Optimization for Black-box MLLM
di: Qian, Jiaxu, et al.
Pubblicazione: (2025)
di: Qian, Jiaxu, et al.
Pubblicazione: (2025)
From Narrow to Panoramic Vision: Attention-Guided Cold-Start Reshapes Multimodal Reasoning
di: Luo, Ruilin, et al.
Pubblicazione: (2026)
di: Luo, Ruilin, et al.
Pubblicazione: (2026)
Generative Universal Verifier as Multimodal Meta-Reasoner
di: Zhang, Xinchen, et al.
Pubblicazione: (2025)
di: Zhang, Xinchen, et al.
Pubblicazione: (2025)
PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning
di: Zhang, Yizhen, et al.
Pubblicazione: (2025)
di: Zhang, Yizhen, et al.
Pubblicazione: (2025)
Think with Grounding: Curriculum Reinforced Reasoning with Video Grounding for Long Video Understanding
di: Chen, Houlun, et al.
Pubblicazione: (2026)
di: Chen, Houlun, et al.
Pubblicazione: (2026)
TimeSearch-R: Adaptive Temporal Search for Long-Form Video Understanding via Self-Verification Reinforcement Learning
di: Pan, Junwen, et al.
Pubblicazione: (2025)
di: Pan, Junwen, et al.
Pubblicazione: (2025)
The Devil is in Temporal Token: High Quality Video Reasoning Segmentation
di: Gong, Sitong, et al.
Pubblicazione: (2025)
di: Gong, Sitong, et al.
Pubblicazione: (2025)
Video-Zero: Self-Evolution Video Understanding
di: Zhang, Ruixu, et al.
Pubblicazione: (2026)
di: Zhang, Ruixu, et al.
Pubblicazione: (2026)
Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning
di: Yue, Feng, et al.
Pubblicazione: (2025)
di: Yue, Feng, et al.
Pubblicazione: (2025)
Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning
di: Chen, Ruizhe, et al.
Pubblicazione: (2025)
di: Chen, Ruizhe, et al.
Pubblicazione: (2025)
Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events
di: Liu, Xiaolin, et al.
Pubblicazione: (2026)
di: Liu, Xiaolin, et al.
Pubblicazione: (2026)
TimeScope: Towards Task-Oriented Temporal Grounding In Long Videos
di: Liu, Xiangrui, et al.
Pubblicazione: (2025)
di: Liu, Xiangrui, et al.
Pubblicazione: (2025)
UI-Zoomer: Uncertainty-Driven Adaptive Zoom-In for GUI Grounding
di: Tang, Fei, et al.
Pubblicazione: (2026)
di: Tang, Fei, et al.
Pubblicazione: (2026)
Video-Infinity: Distributed Long Video Generation
di: Tan, Zhenxiong, et al.
Pubblicazione: (2024)
di: Tan, Zhenxiong, et al.
Pubblicazione: (2024)
Mitigating the Reasoning Tax in Vision-Language Fine-Tuning with Input-Adaptive Depth Aggregation
di: Ren, Yiming, et al.
Pubblicazione: (2026)
di: Ren, Yiming, et al.
Pubblicazione: (2026)
PaSBench-Video: A Streaming Video Benchmark for Proactive Safety Warning
di: Zhao, Yusong, et al.
Pubblicazione: (2026)
di: Zhao, Yusong, et al.
Pubblicazione: (2026)
Space-time Reinforcement Network for Video Object Segmentation
di: Chen, Yadang, et al.
Pubblicazione: (2024)
di: Chen, Yadang, et al.
Pubblicazione: (2024)
Reasoning via Video: The First Evaluation of Video Models' Reasoning Abilities through Maze-Solving Tasks
di: Yang, Cheng, et al.
Pubblicazione: (2025)
di: Yang, Cheng, et al.
Pubblicazione: (2025)
Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding
di: Li, Chenglin, et al.
Pubblicazione: (2025)
di: Li, Chenglin, et al.
Pubblicazione: (2025)
VideoStir: Understanding Long Videos via Spatio-Temporally Structured and Intent-Aware RAG
di: Fu, Honghao, et al.
Pubblicazione: (2026)
di: Fu, Honghao, et al.
Pubblicazione: (2026)
DeepSport: A Multimodal Large Language Model for Comprehensive Sports Video Reasoning via Agentic Reinforcement Learning
di: Zou, Junbo, et al.
Pubblicazione: (2025)
di: Zou, Junbo, et al.
Pubblicazione: (2025)
ReVSeg: Incentivizing the Reasoning Chain for Video Segmentation with Reinforcement Learning
di: Li, Yifan, et al.
Pubblicazione: (2025)
di: Li, Yifan, et al.
Pubblicazione: (2025)
VCA: Video Curious Agent for Long Video Understanding
di: Yang, Zeyuan, et al.
Pubblicazione: (2024)
di: Yang, Zeyuan, et al.
Pubblicazione: (2024)
Bridging Modalities, Spanning Time: Structured Memory for Ultra-Long Agentic Video Reasoning
di: Li, Jiazheng, et al.
Pubblicazione: (2026)
di: Li, Jiazheng, et al.
Pubblicazione: (2026)
AdaFocus: Adaptive Relevance-Diversity Sampling with Zero-Cache Look-back for Efficient Long Video Understanding
di: Yang, Xiao, et al.
Pubblicazione: (2026)
di: Yang, Xiao, et al.
Pubblicazione: (2026)
VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos
di: Yu, Jiashuo, et al.
Pubblicazione: (2025)
di: Yu, Jiashuo, et al.
Pubblicazione: (2025)
Learning Local and Global Temporal Contexts for Video Semantic Segmentation
di: Sun, Guolei, et al.
Pubblicazione: (2022)
di: Sun, Guolei, et al.
Pubblicazione: (2022)
AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models
di: Yang, Jialiang, et al.
Pubblicazione: (2026)
di: Yang, Jialiang, et al.
Pubblicazione: (2026)
VideoMind: A Chain-of-LoRA Agent for Temporal-Grounded Video Reasoning
di: Liu, Ye, et al.
Pubblicazione: (2025)
di: Liu, Ye, et al.
Pubblicazione: (2025)
FrameMind: Frame-Interleaved Video Reasoning via Reinforcement Learning
di: Ge, Haonan, et al.
Pubblicazione: (2025)
di: Ge, Haonan, et al.
Pubblicazione: (2025)
Mining Multi-Modality Spatio-Temporal Cues for Video Important Person Identification
di: Wang, Xiao, et al.
Pubblicazione: (2026)
di: Wang, Xiao, et al.
Pubblicazione: (2026)
SANA-Video: Efficient Video Generation with Block Linear Diffusion Transformer
di: Chen, Junsong, et al.
Pubblicazione: (2025)
di: Chen, Junsong, et al.
Pubblicazione: (2025)
Zoom In, Reason Out: Efficient Far-field Anomaly Detection in Expressway Surveillance Videos via Focused VLM Reasoning Guided by Bayesian Inference
di: Mao, Xiaowei, et al.
Pubblicazione: (2026)
di: Mao, Xiaowei, et al.
Pubblicazione: (2026)
Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning
di: Tian, Shulin, et al.
Pubblicazione: (2025)
di: Tian, Shulin, et al.
Pubblicazione: (2025)
StyleCrafter: Enhancing Stylized Text-to-Video Generation with Style Adapter
di: Liu, Gongye, et al.
Pubblicazione: (2023)
di: Liu, Gongye, et al.
Pubblicazione: (2023)
1st Place Solution for 5th LSVOS Challenge: Referring Video Object Segmentation
di: Luo, Zhuoyan, et al.
Pubblicazione: (2024)
di: Luo, Zhuoyan, et al.
Pubblicazione: (2024)
TimeSearch: Hierarchical Video Search with Spotlight and Reflection for Human-like Long Video Understanding
di: Pan, Junwen, et al.
Pubblicazione: (2025)
di: Pan, Junwen, et al.
Pubblicazione: (2025)
Slot-ID: Identity-Preserving Video Generation from Reference Videos via Slot-Based Temporal Identity Encoding
di: Lai, Yixuan, et al.
Pubblicazione: (2026)
di: Lai, Yixuan, et al.
Pubblicazione: (2026)
Unified and Dynamic Graph for Temporal Character Grouping in Long Videos
di: Shu, Xiujun, et al.
Pubblicazione: (2023)
di: Shu, Xiujun, et al.
Pubblicazione: (2023)
Documenti analoghi
-
O-DisCo-Edit: Object Distortion Control for Unified Realistic Video Editing
di: Chen, Yuqing, et al.
Pubblicazione: (2025) -
Zoomer: Adaptive Image Focus Optimization for Black-box MLLM
di: Qian, Jiaxu, et al.
Pubblicazione: (2025) -
From Narrow to Panoramic Vision: Attention-Guided Cold-Start Reshapes Multimodal Reasoning
di: Luo, Ruilin, et al.
Pubblicazione: (2026) -
Generative Universal Verifier as Multimodal Meta-Reasoner
di: Zhang, Xinchen, et al.
Pubblicazione: (2025) -
PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning
di: Zhang, Yizhen, et al.
Pubblicazione: (2025)