STVG-R1: Incentivizing Instance-Level Reasoning and Grounding in Videos via Reinforcement Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Xiaowen, Gao, Zhi, Jiao, Licheng, Li, Lingling, Li, Qing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Ground-R1: Incentivizing Grounded Visual Reasoning via Reinforcement Learning
di: Cao, Meng, et al.
Pubblicazione: (2025)
di: Cao, Meng, et al.
Pubblicazione: (2025)
OmniSTVG: Toward Spatio-Temporal Omni-Object Video Grounding
di: Yao, Jiali, et al.
Pubblicazione: (2025)
di: Yao, Jiali, et al.
Pubblicazione: (2025)
STSeg-Complex Video Object Segmentation: The 1st Solution for 4th PVUW MOSE Challenge
di: Song, Kehuan, et al.
Pubblicazione: (2025)
di: Song, Kehuan, et al.
Pubblicazione: (2025)
Edit-Your-Interest: Efficient Video Editing via Feature Most-Similar Propagation
di: Zuo, Yi, et al.
Pubblicazione: (2025)
di: Zuo, Yi, et al.
Pubblicazione: (2025)
Saliency-R1: Incentivizing Unified Saliency Reasoning Capability in MLLM with Confidence-Guided Reinforcement Learning
di: Li, Long, et al.
Pubblicazione: (2025)
di: Li, Long, et al.
Pubblicazione: (2025)
VideoSeg-R1:Reasoning Video Object Segmentation via Reinforcement Learning
di: Xu, Zishan, et al.
Pubblicazione: (2025)
di: Xu, Zishan, et al.
Pubblicazione: (2025)
DEVIS-GRPO: Unleashing GRPO on Dynamic Extreme View Synthesis
di: Zuo, Yi, et al.
Pubblicazione: (2026)
di: Zuo, Yi, et al.
Pubblicazione: (2026)
Video-R1: Reinforcing Video Reasoning in MLLMs
di: Feng, Kaituo, et al.
Pubblicazione: (2025)
di: Feng, Kaituo, et al.
Pubblicazione: (2025)
VideoRFT: Incentivizing Video Reasoning Capability in MLLMs via Reinforced Fine-Tuning
di: Wang, Qi, et al.
Pubblicazione: (2025)
di: Wang, Qi, et al.
Pubblicazione: (2025)
UniVG-R1: Reasoning Guided Universal Visual Grounding with Reinforcement Learning
di: Bai, Sule, et al.
Pubblicazione: (2025)
di: Bai, Sule, et al.
Pubblicazione: (2025)
Wan-R1: Verifiable-Reinforcement Learning for Video Reasoning
di: Liu, Ming, et al.
Pubblicazione: (2026)
di: Liu, Ming, et al.
Pubblicazione: (2026)
Edit-Your-Motion: Space-Time Diffusion Decoupling Learning for Video Motion Editing
di: Zuo, Yi, et al.
Pubblicazione: (2024)
di: Zuo, Yi, et al.
Pubblicazione: (2024)
Improving the Reasoning of Multi-Image Grounding in MLLMs via Reinforcement Learning
di: Zhang, Bob, et al.
Pubblicazione: (2025)
di: Zhang, Bob, et al.
Pubblicazione: (2025)
ReVSeg: Incentivizing the Reasoning Chain for Video Segmentation with Reinforcement Learning
di: Li, Yifan, et al.
Pubblicazione: (2025)
di: Li, Yifan, et al.
Pubblicazione: (2025)
InstanceV: Instance-Level Video Generation
di: Chen, Yuheng, et al.
Pubblicazione: (2025)
di: Chen, Yuheng, et al.
Pubblicazione: (2025)
VideoTG-R1: Boosting Video Temporal Grounding via Curriculum Reinforcement Learning on Reflected Boundary Annotations
di: Dong, Lu, et al.
Pubblicazione: (2025)
di: Dong, Lu, et al.
Pubblicazione: (2025)
MedVLM-R1: Incentivizing Medical Reasoning Capability of Vision-Language Models (VLMs) via Reinforcement Learning
di: Pan, Jiazhen, et al.
Pubblicazione: (2025)
di: Pan, Jiazhen, et al.
Pubblicazione: (2025)
Clinically-Grounded Counterfactual Reasoning for Medical Video Diagnosis
di: Gao, Jianzhe, et al.
Pubblicazione: (2026)
di: Gao, Jianzhe, et al.
Pubblicazione: (2026)
Video-R2: Reinforcing Consistent and Grounded Reasoning in Multimodal Language Models
di: Maaz, Muhammad, et al.
Pubblicazione: (2025)
di: Maaz, Muhammad, et al.
Pubblicazione: (2025)
Visionary-R1: Mitigating Shortcuts in Visual Reasoning with Reinforcement Learning
di: Xia, Jiaer, et al.
Pubblicazione: (2025)
di: Xia, Jiaer, et al.
Pubblicazione: (2025)
Multiplane Prior Guided Few-Shot Aerial Scene Rendering
di: Gao, Zihan, et al.
Pubblicazione: (2024)
di: Gao, Zihan, et al.
Pubblicazione: (2024)
Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning
di: Yue, Feng, et al.
Pubblicazione: (2025)
di: Yue, Feng, et al.
Pubblicazione: (2025)
GraphThinker: Reinforcing Temporally Grounded Video Reasoning with Event Graph Thinking
di: Cheng, Zixu, et al.
Pubblicazione: (2026)
di: Cheng, Zixu, et al.
Pubblicazione: (2026)
DI3CL: Contrastive Learning With Dynamic Instances and Contour Consistency for SAR Land-Cover Classification Foundation Model
di: Ren, Zhongle, et al.
Pubblicazione: (2025)
di: Ren, Zhongle, et al.
Pubblicazione: (2025)
Adaptive Chain-of-Focus Reasoning via Dynamic Visual Search and Zooming for Efficient VLMs
di: Zhang, Xintong, et al.
Pubblicazione: (2025)
di: Zhang, Xintong, et al.
Pubblicazione: (2025)
Think with Grounding: Curriculum Reinforced Reasoning with Video Grounding for Long Video Understanding
di: Chen, Houlun, et al.
Pubblicazione: (2026)
di: Chen, Houlun, et al.
Pubblicazione: (2026)
MedReason-R1: Learning to Reason for CT Diagnosis with Reinforcement Learning and Local Zoom
di: Li, Yifan, et al.
Pubblicazione: (2025)
di: Li, Yifan, et al.
Pubblicazione: (2025)
Foresee-to-Ground: From Predictive Temporal Perception to Evidence-Driven Reasoning for Video Temporal Grounding
di: Zheng, Zelin, et al.
Pubblicazione: (2026)
di: Zheng, Zelin, et al.
Pubblicazione: (2026)
VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation
di: Zhao, Yiming, et al.
Pubblicazione: (2026)
di: Zhao, Yiming, et al.
Pubblicazione: (2026)
AdaptMMBench: Benchmarking Adaptive Multimodal Reasoning for Mode Selection and Reasoning Process
di: Zhang, Xintong, et al.
Pubblicazione: (2026)
di: Zhang, Xintong, et al.
Pubblicazione: (2026)
Video Evidence to Reasoning Efficient Video Understanding via Explicit Evidence Grounding
di: Huang, Yanxiang, et al.
Pubblicazione: (2026)
di: Huang, Yanxiang, et al.
Pubblicazione: (2026)
MOSS-ChatV: Reinforcement Learning with Process Reasoning Reward for Video Temporal Reasoning
di: Tao, Sicheng, et al.
Pubblicazione: (2025)
di: Tao, Sicheng, et al.
Pubblicazione: (2025)
Visual Reasoning Tracer: Object-Level Grounded Reasoning Benchmark
di: Yuan, Haobo, et al.
Pubblicazione: (2025)
di: Yuan, Haobo, et al.
Pubblicazione: (2025)
3DWG: 3D Weakly Supervised Visual Grounding via Category and Instance-Level Alignment
di: Li, Xiaoqi, et al.
Pubblicazione: (2025)
di: Li, Xiaoqi, et al.
Pubblicazione: (2025)
Learning Evolution via Optimization Knowledge Adaptation
di: Wang, Chao, et al.
Pubblicazione: (2025)
di: Wang, Chao, et al.
Pubblicazione: (2025)
SDI-Paste: Synthetic Dynamic Instance Copy-Paste for Video Instance Segmentation
di: Shrestha, Sahir, et al.
Pubblicazione: (2024)
di: Shrestha, Sahir, et al.
Pubblicazione: (2024)
Renormalized Connection for Scale-preferred Object Detection in Satellite Imagery
di: Zhang, Fan, et al.
Pubblicazione: (2024)
di: Zhang, Fan, et al.
Pubblicazione: (2024)
High-Resolution Visual Reasoning via Multi-Turn Grounding-Based Reinforcement Learning
di: Huang, Xinyu, et al.
Pubblicazione: (2025)
di: Huang, Xinyu, et al.
Pubblicazione: (2025)
InstanceGaussian: Appearance-Semantic Joint Gaussian Representation for 3D Instance-Level Perception
di: Li, Haijie, et al.
Pubblicazione: (2024)
di: Li, Haijie, et al.
Pubblicazione: (2024)
Grounded Reinforcement Learning for Visual Reasoning
di: Sarch, Gabriel, et al.
Pubblicazione: (2025)
di: Sarch, Gabriel, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Ground-R1: Incentivizing Grounded Visual Reasoning via Reinforcement Learning
di: Cao, Meng, et al.
Pubblicazione: (2025) -
OmniSTVG: Toward Spatio-Temporal Omni-Object Video Grounding
di: Yao, Jiali, et al.
Pubblicazione: (2025) -
STSeg-Complex Video Object Segmentation: The 1st Solution for 4th PVUW MOSE Challenge
di: Song, Kehuan, et al.
Pubblicazione: (2025) -
Edit-Your-Interest: Efficient Video Editing via Feature Most-Similar Propagation
di: Zuo, Yi, et al.
Pubblicazione: (2025) -
Saliency-R1: Incentivizing Unified Saliency Reasoning Capability in MLLM with Confidence-Guided Reinforcement Learning
di: Li, Long, et al.
Pubblicazione: (2025)