VideoZoomer: Reinforcement-Learned Temporal Focusing for Long Video Reasoning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Ding, Yang, Zhang, Yizhen, Lai, Xin, Chu, Ruihang, Yang, Yujiu |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
O-DisCo-Edit: Object Distortion Control for Unified Realistic Video Editing
von: Chen, Yuqing, et al.
Veröffentlicht: (2025)
von: Chen, Yuqing, et al.
Veröffentlicht: (2025)
Zoomer: Adaptive Image Focus Optimization for Black-box MLLM
von: Qian, Jiaxu, et al.
Veröffentlicht: (2025)
von: Qian, Jiaxu, et al.
Veröffentlicht: (2025)
From Narrow to Panoramic Vision: Attention-Guided Cold-Start Reshapes Multimodal Reasoning
von: Luo, Ruilin, et al.
Veröffentlicht: (2026)
von: Luo, Ruilin, et al.
Veröffentlicht: (2026)
Generative Universal Verifier as Multimodal Meta-Reasoner
von: Zhang, Xinchen, et al.
Veröffentlicht: (2025)
von: Zhang, Xinchen, et al.
Veröffentlicht: (2025)
PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning
von: Zhang, Yizhen, et al.
Veröffentlicht: (2025)
von: Zhang, Yizhen, et al.
Veröffentlicht: (2025)
Think with Grounding: Curriculum Reinforced Reasoning with Video Grounding for Long Video Understanding
von: Chen, Houlun, et al.
Veröffentlicht: (2026)
von: Chen, Houlun, et al.
Veröffentlicht: (2026)
TimeSearch-R: Adaptive Temporal Search for Long-Form Video Understanding via Self-Verification Reinforcement Learning
von: Pan, Junwen, et al.
Veröffentlicht: (2025)
von: Pan, Junwen, et al.
Veröffentlicht: (2025)
The Devil is in Temporal Token: High Quality Video Reasoning Segmentation
von: Gong, Sitong, et al.
Veröffentlicht: (2025)
von: Gong, Sitong, et al.
Veröffentlicht: (2025)
Video-Zero: Self-Evolution Video Understanding
von: Zhang, Ruixu, et al.
Veröffentlicht: (2026)
von: Zhang, Ruixu, et al.
Veröffentlicht: (2026)
Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning
von: Yue, Feng, et al.
Veröffentlicht: (2025)
von: Yue, Feng, et al.
Veröffentlicht: (2025)
Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning
von: Chen, Ruizhe, et al.
Veröffentlicht: (2025)
von: Chen, Ruizhe, et al.
Veröffentlicht: (2025)
Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events
von: Liu, Xiaolin, et al.
Veröffentlicht: (2026)
von: Liu, Xiaolin, et al.
Veröffentlicht: (2026)
TimeScope: Towards Task-Oriented Temporal Grounding In Long Videos
von: Liu, Xiangrui, et al.
Veröffentlicht: (2025)
von: Liu, Xiangrui, et al.
Veröffentlicht: (2025)
UI-Zoomer: Uncertainty-Driven Adaptive Zoom-In for GUI Grounding
von: Tang, Fei, et al.
Veröffentlicht: (2026)
von: Tang, Fei, et al.
Veröffentlicht: (2026)
Video-Infinity: Distributed Long Video Generation
von: Tan, Zhenxiong, et al.
Veröffentlicht: (2024)
von: Tan, Zhenxiong, et al.
Veröffentlicht: (2024)
Mitigating the Reasoning Tax in Vision-Language Fine-Tuning with Input-Adaptive Depth Aggregation
von: Ren, Yiming, et al.
Veröffentlicht: (2026)
von: Ren, Yiming, et al.
Veröffentlicht: (2026)
PaSBench-Video: A Streaming Video Benchmark for Proactive Safety Warning
von: Zhao, Yusong, et al.
Veröffentlicht: (2026)
von: Zhao, Yusong, et al.
Veröffentlicht: (2026)
Space-time Reinforcement Network for Video Object Segmentation
von: Chen, Yadang, et al.
Veröffentlicht: (2024)
von: Chen, Yadang, et al.
Veröffentlicht: (2024)
Reasoning via Video: The First Evaluation of Video Models' Reasoning Abilities through Maze-Solving Tasks
von: Yang, Cheng, et al.
Veröffentlicht: (2025)
von: Yang, Cheng, et al.
Veröffentlicht: (2025)
Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding
von: Li, Chenglin, et al.
Veröffentlicht: (2025)
von: Li, Chenglin, et al.
Veröffentlicht: (2025)
VideoStir: Understanding Long Videos via Spatio-Temporally Structured and Intent-Aware RAG
von: Fu, Honghao, et al.
Veröffentlicht: (2026)
von: Fu, Honghao, et al.
Veröffentlicht: (2026)
DeepSport: A Multimodal Large Language Model for Comprehensive Sports Video Reasoning via Agentic Reinforcement Learning
von: Zou, Junbo, et al.
Veröffentlicht: (2025)
von: Zou, Junbo, et al.
Veröffentlicht: (2025)
ReVSeg: Incentivizing the Reasoning Chain for Video Segmentation with Reinforcement Learning
von: Li, Yifan, et al.
Veröffentlicht: (2025)
von: Li, Yifan, et al.
Veröffentlicht: (2025)
VCA: Video Curious Agent for Long Video Understanding
von: Yang, Zeyuan, et al.
Veröffentlicht: (2024)
von: Yang, Zeyuan, et al.
Veröffentlicht: (2024)
Bridging Modalities, Spanning Time: Structured Memory for Ultra-Long Agentic Video Reasoning
von: Li, Jiazheng, et al.
Veröffentlicht: (2026)
von: Li, Jiazheng, et al.
Veröffentlicht: (2026)
AdaFocus: Adaptive Relevance-Diversity Sampling with Zero-Cache Look-back for Efficient Long Video Understanding
von: Yang, Xiao, et al.
Veröffentlicht: (2026)
von: Yang, Xiao, et al.
Veröffentlicht: (2026)
VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos
von: Yu, Jiashuo, et al.
Veröffentlicht: (2025)
von: Yu, Jiashuo, et al.
Veröffentlicht: (2025)
Learning Local and Global Temporal Contexts for Video Semantic Segmentation
von: Sun, Guolei, et al.
Veröffentlicht: (2022)
von: Sun, Guolei, et al.
Veröffentlicht: (2022)
AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models
von: Yang, Jialiang, et al.
Veröffentlicht: (2026)
von: Yang, Jialiang, et al.
Veröffentlicht: (2026)
VideoMind: A Chain-of-LoRA Agent for Temporal-Grounded Video Reasoning
von: Liu, Ye, et al.
Veröffentlicht: (2025)
von: Liu, Ye, et al.
Veröffentlicht: (2025)
FrameMind: Frame-Interleaved Video Reasoning via Reinforcement Learning
von: Ge, Haonan, et al.
Veröffentlicht: (2025)
von: Ge, Haonan, et al.
Veröffentlicht: (2025)
Mining Multi-Modality Spatio-Temporal Cues for Video Important Person Identification
von: Wang, Xiao, et al.
Veröffentlicht: (2026)
von: Wang, Xiao, et al.
Veröffentlicht: (2026)
SANA-Video: Efficient Video Generation with Block Linear Diffusion Transformer
von: Chen, Junsong, et al.
Veröffentlicht: (2025)
von: Chen, Junsong, et al.
Veröffentlicht: (2025)
Zoom In, Reason Out: Efficient Far-field Anomaly Detection in Expressway Surveillance Videos via Focused VLM Reasoning Guided by Bayesian Inference
von: Mao, Xiaowei, et al.
Veröffentlicht: (2026)
von: Mao, Xiaowei, et al.
Veröffentlicht: (2026)
Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning
von: Tian, Shulin, et al.
Veröffentlicht: (2025)
von: Tian, Shulin, et al.
Veröffentlicht: (2025)
StyleCrafter: Enhancing Stylized Text-to-Video Generation with Style Adapter
von: Liu, Gongye, et al.
Veröffentlicht: (2023)
von: Liu, Gongye, et al.
Veröffentlicht: (2023)
1st Place Solution for 5th LSVOS Challenge: Referring Video Object Segmentation
von: Luo, Zhuoyan, et al.
Veröffentlicht: (2024)
von: Luo, Zhuoyan, et al.
Veröffentlicht: (2024)
TimeSearch: Hierarchical Video Search with Spotlight and Reflection for Human-like Long Video Understanding
von: Pan, Junwen, et al.
Veröffentlicht: (2025)
von: Pan, Junwen, et al.
Veröffentlicht: (2025)
Slot-ID: Identity-Preserving Video Generation from Reference Videos via Slot-Based Temporal Identity Encoding
von: Lai, Yixuan, et al.
Veröffentlicht: (2026)
von: Lai, Yixuan, et al.
Veröffentlicht: (2026)
Unified and Dynamic Graph for Temporal Character Grouping in Long Videos
von: Shu, Xiujun, et al.
Veröffentlicht: (2023)
von: Shu, Xiujun, et al.
Veröffentlicht: (2023)
Ähnliche Einträge
-
O-DisCo-Edit: Object Distortion Control for Unified Realistic Video Editing
von: Chen, Yuqing, et al.
Veröffentlicht: (2025) -
Zoomer: Adaptive Image Focus Optimization for Black-box MLLM
von: Qian, Jiaxu, et al.
Veröffentlicht: (2025) -
From Narrow to Panoramic Vision: Attention-Guided Cold-Start Reshapes Multimodal Reasoning
von: Luo, Ruilin, et al.
Veröffentlicht: (2026) -
Generative Universal Verifier as Multimodal Meta-Reasoner
von: Zhang, Xinchen, et al.
Veröffentlicht: (2025) -
PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning
von: Zhang, Yizhen, et al.
Veröffentlicht: (2025)