RGBX-R1: Visual Modality Chain-of-Thought Guided Reinforcement Learning for Multimodal Grounding
Fuente:
arXiv
Salvato in:
| Autori principali: | Wu, Jiahe, Cao, Bing, Wang, Qilong, Hu, Qinghua, Li, Dongdong, Zhu, Pengfei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Dream-IF: Dynamic Relative EnhAnceMent for Image Fusion
di: Xu, Xingxin, et al.
Pubblicazione: (2025)
di: Xu, Xingxin, et al.
Pubblicazione: (2025)
Efficient Masked AutoEncoder for Video Object Counting and A Large-Scale Benchmark
di: Cao, Bing, et al.
Pubblicazione: (2024)
di: Cao, Bing, et al.
Pubblicazione: (2024)
Asymmetric Reinforcing against Multi-modal Representation Bias
di: Gao, Xiyuan, et al.
Pubblicazione: (2025)
di: Gao, Xiyuan, et al.
Pubblicazione: (2025)
Conditional Controllable Image Fusion
di: Cao, Bing, et al.
Pubblicazione: (2024)
di: Cao, Bing, et al.
Pubblicazione: (2024)
$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models
di: Yin, Xiaojie, et al.
Pubblicazione: (2024)
di: Yin, Xiaojie, et al.
Pubblicazione: (2024)
CoTBox-TTT: Grounding Medical VQA with Visual Chain-of-Thought Boxes During Test-time Training
di: Qian, Jiahe, et al.
Pubblicazione: (2025)
di: Qian, Jiahe, et al.
Pubblicazione: (2025)
Visible and Clear: Finding Tiny Objects in Difference Map
di: Cao, Bing, et al.
Pubblicazione: (2024)
di: Cao, Bing, et al.
Pubblicazione: (2024)
Task-Customized Mixture of Adapters for General Image Fusion
di: Zhu, Pengfei, et al.
Pubblicazione: (2024)
di: Zhu, Pengfei, et al.
Pubblicazione: (2024)
Ground-R1: Incentivizing Grounded Visual Reasoning via Reinforcement Learning
di: Cao, Meng, et al.
Pubblicazione: (2025)
di: Cao, Meng, et al.
Pubblicazione: (2025)
Relation-R1: Progressively Cognitive Chain-of-Thought Guided Reinforcement Learning for Unified Relation Comprehension
di: Li, Lin, et al.
Pubblicazione: (2025)
di: Li, Lin, et al.
Pubblicazione: (2025)
Grounded Chain-of-Thought for Multimodal Large Language Models
di: Wu, Qiong, et al.
Pubblicazione: (2025)
di: Wu, Qiong, et al.
Pubblicazione: (2025)
V-RGBX: Video Editing with Accurate Controls over Intrinsic Properties
di: Fang, Ye, et al.
Pubblicazione: (2025)
di: Fang, Ye, et al.
Pubblicazione: (2025)
Hyperbolic Cycle Alignment for Infrared-Visible Image Fusion
di: Li, Timing, et al.
Pubblicazione: (2025)
di: Li, Timing, et al.
Pubblicazione: (2025)
CoE: Chain-of-Explanation via Automatic Visual Concept Circuit Description and Polysemanticity Quantification
di: Yu, Wenlong, et al.
Pubblicazione: (2025)
di: Yu, Wenlong, et al.
Pubblicazione: (2025)
UniVG-R1: Reasoning Guided Universal Visual Grounding with Reinforcement Learning
di: Bai, Sule, et al.
Pubblicazione: (2025)
di: Bai, Sule, et al.
Pubblicazione: (2025)
Bi-directional Self-Registration for Misaligned Infrared-Visible Image Fusion
di: Li, Timing, et al.
Pubblicazione: (2025)
di: Li, Timing, et al.
Pubblicazione: (2025)
AMU-Tuning: Effective Logit Bias for CLIP-based Few-shot Learning
di: Tang, Yuwei, et al.
Pubblicazione: (2024)
di: Tang, Yuwei, et al.
Pubblicazione: (2024)
Dynamic Brightness Adaptation for Robust Multi-modal Image Fusion
di: Sun, Yiming, et al.
Pubblicazione: (2024)
di: Sun, Yiming, et al.
Pubblicazione: (2024)
RGBX-DiffusionDet: A Framework for Multi-Modal RGB-X Object Detection Using DiffusionDet
di: Orfaig, Eliraz, et al.
Pubblicazione: (2025)
di: Orfaig, Eliraz, et al.
Pubblicazione: (2025)
DIFF-MF: A Difference-Driven Channel-Spatial State Space Model for Multi-Modal Image Fusion
di: Sun, Yiming, et al.
Pubblicazione: (2026)
di: Sun, Yiming, et al.
Pubblicazione: (2026)
Chain-of-Cooking:Cooking Process Visualization via Bidirectional Chain-of-Thought Guidance
di: Xu, Mengling, et al.
Pubblicazione: (2025)
di: Xu, Mengling, et al.
Pubblicazione: (2025)
BackMix: Regularizing Open Set Recognition by Removing Underlying Fore-Background Priors
di: Wang, Yu, et al.
Pubblicazione: (2025)
di: Wang, Yu, et al.
Pubblicazione: (2025)
Decoupled Multi-Predictor Optimization for Inference-Efficient Model Tuning
di: Luo, Liwei, et al.
Pubblicazione: (2025)
di: Luo, Liwei, et al.
Pubblicazione: (2025)
Reversible Efficient Diffusion for Image Fusion
di: Xu, Xingxin, et al.
Pubblicazione: (2026)
di: Xu, Xingxin, et al.
Pubblicazione: (2026)
CtrlFuse: Mask-Prompt Guided Controllable Infrared and Visible Image Fusion
di: Sun, Yiming, et al.
Pubblicazione: (2026)
di: Sun, Yiming, et al.
Pubblicazione: (2026)
Interleaved-Modal Chain-of-Thought
di: Gao, Jun, et al.
Pubblicazione: (2024)
di: Gao, Jun, et al.
Pubblicazione: (2024)
Constrained Prompt Enhancement for Improving Zero-Shot Generalization of Vision-Language Models
di: Yin, Xiaojie, et al.
Pubblicazione: (2025)
di: Yin, Xiaojie, et al.
Pubblicazione: (2025)
RealSR-R1: Reinforcement Learning for Real-World Image Super-Resolution with Vision-Language Chain-of-Thought
di: Qiao, Junbo, et al.
Pubblicazione: (2025)
di: Qiao, Junbo, et al.
Pubblicazione: (2025)
Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation
di: Xia, Jiaer, et al.
Pubblicazione: (2025)
di: Xia, Jiaer, et al.
Pubblicazione: (2025)
Visual Programmability: A Guide for Code-as-Thought in Chart Understanding
di: Tang, Bohao, et al.
Pubblicazione: (2025)
di: Tang, Bohao, et al.
Pubblicazione: (2025)
Visual Thoughts: A Unified Perspective of Understanding Multimodal Chain-of-Thought
di: Cheng, Zihui, et al.
Pubblicazione: (2025)
di: Cheng, Zihui, et al.
Pubblicazione: (2025)
Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models
di: Hu, Yushi, et al.
Pubblicazione: (2024)
di: Hu, Yushi, et al.
Pubblicazione: (2024)
Generative Visual Chain-of-Thought for Image Editing
di: Yin, Zijin, et al.
Pubblicazione: (2026)
di: Yin, Zijin, et al.
Pubblicazione: (2026)
Skywork R1V: Pioneering Multimodal Reasoning with Chain-of-Thought
di: Peng, Yi, et al.
Pubblicazione: (2025)
di: Peng, Yi, et al.
Pubblicazione: (2025)
CoT3DRef: Chain-of-Thoughts Data-Efficient 3D Visual Grounding
di: Abdelrahman, Eslam, et al.
Pubblicazione: (2023)
di: Abdelrahman, Eslam, et al.
Pubblicazione: (2023)
Unified Multimodal Chain-of-Thought Reward Model through Reinforcement Fine-Tuning
di: Wang, Yibin, et al.
Pubblicazione: (2025)
di: Wang, Yibin, et al.
Pubblicazione: (2025)
RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought
di: Lu, Yi, et al.
Pubblicazione: (2025)
di: Lu, Yi, et al.
Pubblicazione: (2025)
MathCanvas: Intrinsic Visual Chain-of-Thought for Multimodal Mathematical Reasoning
di: Shi, Weikang, et al.
Pubblicazione: (2025)
di: Shi, Weikang, et al.
Pubblicazione: (2025)
Thinking with Images as Continuous Actions: Numerical Visual Chain-of-Thought
di: Zhao, Kesen, et al.
Pubblicazione: (2026)
di: Zhao, Kesen, et al.
Pubblicazione: (2026)
Unlocking Multi-Spectral Data for Multi-Modal Models with Guided Inputs and Chain-of-Thought Reasoning
di: Kim, Dahun, et al.
Pubblicazione: (2026)
di: Kim, Dahun, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Dream-IF: Dynamic Relative EnhAnceMent for Image Fusion
di: Xu, Xingxin, et al.
Pubblicazione: (2025) -
Efficient Masked AutoEncoder for Video Object Counting and A Large-Scale Benchmark
di: Cao, Bing, et al.
Pubblicazione: (2024) -
Asymmetric Reinforcing against Multi-modal Representation Bias
di: Gao, Xiyuan, et al.
Pubblicazione: (2025) -
Conditional Controllable Image Fusion
di: Cao, Bing, et al.
Pubblicazione: (2024) -
$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models
di: Yin, Xiaojie, et al.
Pubblicazione: (2024)