IVR-R1: Refining Trajectories through Iterative Visual-Grounded Reasoning in Reinforcement Learning
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Chenghao, Hao, Fusheng, Zhang, Xikai, Xiao, Likang, Ren, Yanwei, Wu, Fuxiang, Chen, Quan, Liu, Liu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Gradient-based Fine-Tuning through Pre-trained Model Regularization
por: Liu, Xuanbo, et al.
Publicado: (2025)
por: Liu, Xuanbo, et al.
Publicado: (2025)
Improving the Reasoning of Multi-Image Grounding in MLLMs via Reinforcement Learning
por: Zhang, Bob, et al.
Publicado: (2025)
por: Zhang, Bob, et al.
Publicado: (2025)
Improving Visual Reasoning with Iterative Evidence Refinement
por: Shi, Zeru, et al.
Publicado: (2026)
por: Shi, Zeru, et al.
Publicado: (2026)
VG-Refiner: Towards Tool-Refined Referring Grounded Reasoning via Agentic Reinforcement Learning
por: Wang, Yuji, et al.
Publicado: (2025)
por: Wang, Yuji, et al.
Publicado: (2025)
Ground-R1: Incentivizing Grounded Visual Reasoning via Reinforcement Learning
por: Cao, Meng, et al.
Publicado: (2025)
por: Cao, Meng, et al.
Publicado: (2025)
UniVG-R1: Reasoning Guided Universal Visual Grounding with Reinforcement Learning
por: Bai, Sule, et al.
Publicado: (2025)
por: Bai, Sule, et al.
Publicado: (2025)
Grounded Reinforcement Learning for Visual Reasoning
por: Sarch, Gabriel, et al.
Publicado: (2025)
por: Sarch, Gabriel, et al.
Publicado: (2025)
Bootstrapping Physics-Grounded Video Generation through VLM-Guided Iterative Self-Refinement
por: Liu, Yang, et al.
Publicado: (2025)
por: Liu, Yang, et al.
Publicado: (2025)
VTPerception-R1: Enhancing Multimodal Reasoning via Explicit Visual and Textual Perceptual Grounding
por: Ding, Yizhuo, et al.
Publicado: (2025)
por: Ding, Yizhuo, et al.
Publicado: (2025)
Exploring Iterative Refinement with Diffusion Models for Video Grounding
por: Liang, Xiao, et al.
Publicado: (2023)
por: Liang, Xiao, et al.
Publicado: (2023)
Visual Reasoning through Tool-supervised Reinforcement Learning
por: Dong, Qihua, et al.
Publicado: (2026)
por: Dong, Qihua, et al.
Publicado: (2026)
ReasonGrounder: LVLM-Guided Hierarchical Feature Splatting for Open-Vocabulary 3D Visual Grounding and Reasoning
por: Liu, Zhenyang, et al.
Publicado: (2025)
por: Liu, Zhenyang, et al.
Publicado: (2025)
High-Resolution Visual Reasoning via Multi-Turn Grounding-Based Reinforcement Learning
por: Huang, Xinyu, et al.
Publicado: (2025)
por: Huang, Xinyu, et al.
Publicado: (2025)
PrecisionCUA: Iterative Visual Refinement for Pixel-Precise Cursor Grounding in Code Editors
por: Mittal, Himangi, et al.
Publicado: (2026)
por: Mittal, Himangi, et al.
Publicado: (2026)
ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning
por: Xu, Ziqiang, et al.
Publicado: (2025)
por: Xu, Ziqiang, et al.
Publicado: (2025)
See It, Say It, Sorted: An Iterative Training-Free Framework for Visually-Grounded Multimodal Reasoning in LVLMs
por: Zhang, Yongchang, et al.
Publicado: (2026)
por: Zhang, Yongchang, et al.
Publicado: (2026)
Chain-of-Ground: Improving GUI Grounding via Iterative Reasoning and Reference Feedback
por: Li, Aiden Yiliu, et al.
Publicado: (2025)
por: Li, Aiden Yiliu, et al.
Publicado: (2025)
Visual Reasoning Tracer: Object-Level Grounded Reasoning Benchmark
por: Yuan, Haobo, et al.
Publicado: (2025)
por: Yuan, Haobo, et al.
Publicado: (2025)
iSeg: An Iterative Refinement-based Framework for Training-free Segmentation
por: Sun, Lin, et al.
Publicado: (2024)
por: Sun, Lin, et al.
Publicado: (2024)
SpaceR: Reinforcing MLLMs in Video Spatial Reasoning
por: Ouyang, Kun, et al.
Publicado: (2025)
por: Ouyang, Kun, et al.
Publicado: (2025)
\textsc{GUI-Spotlight}: Adaptive Iterative Focus Refinement for Enhanced GUI Visual Grounding
por: Lei, Bin, et al.
Publicado: (2025)
por: Lei, Bin, et al.
Publicado: (2025)
PathVLM-R1: A Reinforcement Learning-Driven Reasoning Model for Pathology Visual-Language Tasks
por: Wu, Jianyu, et al.
Publicado: (2025)
por: Wu, Jianyu, et al.
Publicado: (2025)
RSGround-R1: Rethinking Remote Sensing Visual Grounding through Spatial Reasoning
por: Huang, Shiqi, et al.
Publicado: (2026)
por: Huang, Shiqi, et al.
Publicado: (2026)
RGBX-R1: Visual Modality Chain-of-Thought Guided Reinforcement Learning for Multimodal Grounding
por: Wu, Jiahe, et al.
Publicado: (2026)
por: Wu, Jiahe, et al.
Publicado: (2026)
MIRG-RL: Multi-Image Reasoning and Grounding with Reinforcement Learning
por: Zheng, Lihao, et al.
Publicado: (2025)
por: Zheng, Lihao, et al.
Publicado: (2025)
A Neural Representation Framework with LLM-Driven Spatial Reasoning for Open-Vocabulary 3D Visual Grounding
por: Liu, Zhenyang, et al.
Publicado: (2025)
por: Liu, Zhenyang, et al.
Publicado: (2025)
VGent: Visual Grounding via Modular Design for Disentangling Reasoning and Prediction
por: Kang, Weitai, et al.
Publicado: (2025)
por: Kang, Weitai, et al.
Publicado: (2025)
VideoChat-R1.5: Visual Test-Time Scaling to Reinforce Multimodal Reasoning by Iterative Perception
por: Yan, Ziang, et al.
Publicado: (2025)
por: Yan, Ziang, et al.
Publicado: (2025)
Med-R2: An Adversarial Benchmark for Evidence-Grounded Reasoning in Medical VLMs
por: Ma, Wen, et al.
Publicado: (2026)
por: Ma, Wen, et al.
Publicado: (2026)
TerraScope: Pixel-Grounded Visual Reasoning for Earth Observation
por: Shu, Yan, et al.
Publicado: (2026)
por: Shu, Yan, et al.
Publicado: (2026)
Wan-R1: Verifiable-Reinforcement Learning for Video Reasoning
por: Liu, Ming, et al.
Publicado: (2026)
por: Liu, Ming, et al.
Publicado: (2026)
VisionReasoner: Unified Reasoning-Integrated Visual Perception via Reinforcement Learning
por: Liu, Yuqi, et al.
Publicado: (2025)
por: Liu, Yuqi, et al.
Publicado: (2025)
Visionary-R1: Mitigating Shortcuts in Visual Reasoning with Reinforcement Learning
por: Xia, Jiaer, et al.
Publicado: (2025)
por: Xia, Jiaer, et al.
Publicado: (2025)
VGR: Visual Grounded Reasoning
por: Wang, Jiacong, et al.
Publicado: (2025)
por: Wang, Jiacong, et al.
Publicado: (2025)
$R^2$-Mesh: Reinforcement Learning Powered Mesh Reconstruction via Geometry and Appearance Refinement
por: Wang, Haoyang, et al.
Publicado: (2024)
por: Wang, Haoyang, et al.
Publicado: (2024)
Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration
por: Zhong, Hao, et al.
Publicado: (2025)
por: Zhong, Hao, et al.
Publicado: (2025)
RegionReasoner: Region-Grounded Multi-Round Visual Reasoning
por: Sun, Wenfang, et al.
Publicado: (2026)
por: Sun, Wenfang, et al.
Publicado: (2026)
Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning
por: Ni, Minheng, et al.
Publicado: (2025)
por: Ni, Minheng, et al.
Publicado: (2025)
STVG-R1: Incentivizing Instance-Level Reasoning and Grounding in Videos via Reinforcement Learning
por: Zhang, Xiaowen, et al.
Publicado: (2026)
por: Zhang, Xiaowen, et al.
Publicado: (2026)
VisualQuality-R1: Reasoning-Induced Image Quality Assessment via Reinforcement Learning to Rank
por: Wu, Tianhe, et al.
Publicado: (2025)
por: Wu, Tianhe, et al.
Publicado: (2025)
Ejemplares similares
-
Gradient-based Fine-Tuning through Pre-trained Model Regularization
por: Liu, Xuanbo, et al.
Publicado: (2025) -
Improving the Reasoning of Multi-Image Grounding in MLLMs via Reinforcement Learning
por: Zhang, Bob, et al.
Publicado: (2025) -
Improving Visual Reasoning with Iterative Evidence Refinement
por: Shi, Zeru, et al.
Publicado: (2026) -
VG-Refiner: Towards Tool-Refined Referring Grounded Reasoning via Agentic Reinforcement Learning
por: Wang, Yuji, et al.
Publicado: (2025) -
Ground-R1: Incentivizing Grounded Visual Reasoning via Reinforcement Learning
por: Cao, Meng, et al.
Publicado: (2025)