VideoZoomer: Reinforcement-Learned Temporal Focusing for Long Video Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ding, Yang, Zhang, Yizhen, Lai, Xin, Chu, Ruihang, Yang, Yujiu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
O-DisCo-Edit: Object Distortion Control for Unified Realistic Video Editing
par: Chen, Yuqing, et autres
Publié: (2025)
par: Chen, Yuqing, et autres
Publié: (2025)
Zoomer: Adaptive Image Focus Optimization for Black-box MLLM
par: Qian, Jiaxu, et autres
Publié: (2025)
par: Qian, Jiaxu, et autres
Publié: (2025)
From Narrow to Panoramic Vision: Attention-Guided Cold-Start Reshapes Multimodal Reasoning
par: Luo, Ruilin, et autres
Publié: (2026)
par: Luo, Ruilin, et autres
Publié: (2026)
Generative Universal Verifier as Multimodal Meta-Reasoner
par: Zhang, Xinchen, et autres
Publié: (2025)
par: Zhang, Xinchen, et autres
Publié: (2025)
PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning
par: Zhang, Yizhen, et autres
Publié: (2025)
par: Zhang, Yizhen, et autres
Publié: (2025)
Think with Grounding: Curriculum Reinforced Reasoning with Video Grounding for Long Video Understanding
par: Chen, Houlun, et autres
Publié: (2026)
par: Chen, Houlun, et autres
Publié: (2026)
TimeSearch-R: Adaptive Temporal Search for Long-Form Video Understanding via Self-Verification Reinforcement Learning
par: Pan, Junwen, et autres
Publié: (2025)
par: Pan, Junwen, et autres
Publié: (2025)
The Devil is in Temporal Token: High Quality Video Reasoning Segmentation
par: Gong, Sitong, et autres
Publié: (2025)
par: Gong, Sitong, et autres
Publié: (2025)
Video-Zero: Self-Evolution Video Understanding
par: Zhang, Ruixu, et autres
Publié: (2026)
par: Zhang, Ruixu, et autres
Publié: (2026)
Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning
par: Yue, Feng, et autres
Publié: (2025)
par: Yue, Feng, et autres
Publié: (2025)
Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning
par: Chen, Ruizhe, et autres
Publié: (2025)
par: Chen, Ruizhe, et autres
Publié: (2025)
Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events
par: Liu, Xiaolin, et autres
Publié: (2026)
par: Liu, Xiaolin, et autres
Publié: (2026)
TimeScope: Towards Task-Oriented Temporal Grounding In Long Videos
par: Liu, Xiangrui, et autres
Publié: (2025)
par: Liu, Xiangrui, et autres
Publié: (2025)
UI-Zoomer: Uncertainty-Driven Adaptive Zoom-In for GUI Grounding
par: Tang, Fei, et autres
Publié: (2026)
par: Tang, Fei, et autres
Publié: (2026)
Video-Infinity: Distributed Long Video Generation
par: Tan, Zhenxiong, et autres
Publié: (2024)
par: Tan, Zhenxiong, et autres
Publié: (2024)
Mitigating the Reasoning Tax in Vision-Language Fine-Tuning with Input-Adaptive Depth Aggregation
par: Ren, Yiming, et autres
Publié: (2026)
par: Ren, Yiming, et autres
Publié: (2026)
PaSBench-Video: A Streaming Video Benchmark for Proactive Safety Warning
par: Zhao, Yusong, et autres
Publié: (2026)
par: Zhao, Yusong, et autres
Publié: (2026)
Space-time Reinforcement Network for Video Object Segmentation
par: Chen, Yadang, et autres
Publié: (2024)
par: Chen, Yadang, et autres
Publié: (2024)
Reasoning via Video: The First Evaluation of Video Models' Reasoning Abilities through Maze-Solving Tasks
par: Yang, Cheng, et autres
Publié: (2025)
par: Yang, Cheng, et autres
Publié: (2025)
Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding
par: Li, Chenglin, et autres
Publié: (2025)
par: Li, Chenglin, et autres
Publié: (2025)
VideoStir: Understanding Long Videos via Spatio-Temporally Structured and Intent-Aware RAG
par: Fu, Honghao, et autres
Publié: (2026)
par: Fu, Honghao, et autres
Publié: (2026)
DeepSport: A Multimodal Large Language Model for Comprehensive Sports Video Reasoning via Agentic Reinforcement Learning
par: Zou, Junbo, et autres
Publié: (2025)
par: Zou, Junbo, et autres
Publié: (2025)
ReVSeg: Incentivizing the Reasoning Chain for Video Segmentation with Reinforcement Learning
par: Li, Yifan, et autres
Publié: (2025)
par: Li, Yifan, et autres
Publié: (2025)
VCA: Video Curious Agent for Long Video Understanding
par: Yang, Zeyuan, et autres
Publié: (2024)
par: Yang, Zeyuan, et autres
Publié: (2024)
Bridging Modalities, Spanning Time: Structured Memory for Ultra-Long Agentic Video Reasoning
par: Li, Jiazheng, et autres
Publié: (2026)
par: Li, Jiazheng, et autres
Publié: (2026)
AdaFocus: Adaptive Relevance-Diversity Sampling with Zero-Cache Look-back for Efficient Long Video Understanding
par: Yang, Xiao, et autres
Publié: (2026)
par: Yang, Xiao, et autres
Publié: (2026)
VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos
par: Yu, Jiashuo, et autres
Publié: (2025)
par: Yu, Jiashuo, et autres
Publié: (2025)
Learning Local and Global Temporal Contexts for Video Semantic Segmentation
par: Sun, Guolei, et autres
Publié: (2022)
par: Sun, Guolei, et autres
Publié: (2022)
AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models
par: Yang, Jialiang, et autres
Publié: (2026)
par: Yang, Jialiang, et autres
Publié: (2026)
VideoMind: A Chain-of-LoRA Agent for Temporal-Grounded Video Reasoning
par: Liu, Ye, et autres
Publié: (2025)
par: Liu, Ye, et autres
Publié: (2025)
FrameMind: Frame-Interleaved Video Reasoning via Reinforcement Learning
par: Ge, Haonan, et autres
Publié: (2025)
par: Ge, Haonan, et autres
Publié: (2025)
Mining Multi-Modality Spatio-Temporal Cues for Video Important Person Identification
par: Wang, Xiao, et autres
Publié: (2026)
par: Wang, Xiao, et autres
Publié: (2026)
SANA-Video: Efficient Video Generation with Block Linear Diffusion Transformer
par: Chen, Junsong, et autres
Publié: (2025)
par: Chen, Junsong, et autres
Publié: (2025)
Zoom In, Reason Out: Efficient Far-field Anomaly Detection in Expressway Surveillance Videos via Focused VLM Reasoning Guided by Bayesian Inference
par: Mao, Xiaowei, et autres
Publié: (2026)
par: Mao, Xiaowei, et autres
Publié: (2026)
Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning
par: Tian, Shulin, et autres
Publié: (2025)
par: Tian, Shulin, et autres
Publié: (2025)
StyleCrafter: Enhancing Stylized Text-to-Video Generation with Style Adapter
par: Liu, Gongye, et autres
Publié: (2023)
par: Liu, Gongye, et autres
Publié: (2023)
1st Place Solution for 5th LSVOS Challenge: Referring Video Object Segmentation
par: Luo, Zhuoyan, et autres
Publié: (2024)
par: Luo, Zhuoyan, et autres
Publié: (2024)
TimeSearch: Hierarchical Video Search with Spotlight and Reflection for Human-like Long Video Understanding
par: Pan, Junwen, et autres
Publié: (2025)
par: Pan, Junwen, et autres
Publié: (2025)
Slot-ID: Identity-Preserving Video Generation from Reference Videos via Slot-Based Temporal Identity Encoding
par: Lai, Yixuan, et autres
Publié: (2026)
par: Lai, Yixuan, et autres
Publié: (2026)
Unified and Dynamic Graph for Temporal Character Grouping in Long Videos
par: Shu, Xiujun, et autres
Publié: (2023)
par: Shu, Xiujun, et autres
Publié: (2023)
Documents similaires
-
O-DisCo-Edit: Object Distortion Control for Unified Realistic Video Editing
par: Chen, Yuqing, et autres
Publié: (2025) -
Zoomer: Adaptive Image Focus Optimization for Black-box MLLM
par: Qian, Jiaxu, et autres
Publié: (2025) -
From Narrow to Panoramic Vision: Attention-Guided Cold-Start Reshapes Multimodal Reasoning
par: Luo, Ruilin, et autres
Publié: (2026) -
Generative Universal Verifier as Multimodal Meta-Reasoner
par: Zhang, Xinchen, et autres
Publié: (2025) -
PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning
par: Zhang, Yizhen, et autres
Publié: (2025)