Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Tan, Huajie, Ji, Yuheng, Hao, Xiaoshuai, Chen, Xiansheng, Wang, Pengwei, Wang, Zhongyuan, Zhang, Shanghang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
MathSticks: A Benchmark for Visual Symbolic Compositional Reasoning with Matchstick Puzzles
von: Ji, Yuheng, et al.
Veröffentlicht: (2025)
von: Ji, Yuheng, et al.
Veröffentlicht: (2025)
TIGeR: Tool-Integrated Geometric Reasoning in Vision-Language Models for Robotics
von: Han, Yi, et al.
Veröffentlicht: (2025)
von: Han, Yi, et al.
Veröffentlicht: (2025)
Visual-RFT: Visual Reinforcement Fine-Tuning
von: Liu, Ziyu, et al.
Veröffentlicht: (2025)
von: Liu, Ziyu, et al.
Veröffentlicht: (2025)
RoboRefer: Towards Spatial Referring with Reasoning in Vision-Language Models for Robotics
von: Zhou, Enshen, et al.
Veröffentlicht: (2025)
von: Zhou, Enshen, et al.
Veröffentlicht: (2025)
RoboTracer: Mastering Spatial Trace with Reasoning in Vision-Language Models for Robotics
von: Zhou, Enshen, et al.
Veröffentlicht: (2025)
von: Zhou, Enshen, et al.
Veröffentlicht: (2025)
ConsistentRFT: Reducing Visual Hallucinations in Flow-based Reinforcement Fine-Tuning
von: Tan, Xiaofeng, et al.
Veröffentlicht: (2026)
von: Tan, Xiaofeng, et al.
Veröffentlicht: (2026)
VideoRFT: Incentivizing Video Reasoning Capability in MLLMs via Reinforced Fine-Tuning
von: Wang, Qi, et al.
Veröffentlicht: (2025)
von: Wang, Qi, et al.
Veröffentlicht: (2025)
MotionRFT: Unified Reinforcement Fine-Tuning for Text-to-Motion Generation
von: Tan, Xiaofeng, et al.
Veröffentlicht: (2026)
von: Tan, Xiaofeng, et al.
Veröffentlicht: (2026)
Perception Before Reasoning: Two-Stage Reinforcement Learning for Visual Reasoning in Vision-Language Models
von: Chen, Yan, et al.
Veröffentlicht: (2025)
von: Chen, Yan, et al.
Veröffentlicht: (2025)
Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing
von: Wu, Junfei, et al.
Veröffentlicht: (2025)
von: Wu, Junfei, et al.
Veröffentlicht: (2025)
Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning
von: Ni, Minheng, et al.
Veröffentlicht: (2025)
von: Ni, Minheng, et al.
Veröffentlicht: (2025)
3D-RFT: Reinforcement Fine-Tuning for Video-based 3D Scene Understanding
von: Linghu, Xiongkun, et al.
Veröffentlicht: (2026)
von: Linghu, Xiongkun, et al.
Veröffentlicht: (2026)
Mitigating the Reasoning Tax in Vision-Language Fine-Tuning with Input-Adaptive Depth Aggregation
von: Ren, Yiming, et al.
Veröffentlicht: (2026)
von: Ren, Yiming, et al.
Veröffentlicht: (2026)
GRE Suite: Geo-localization Inference via Fine-Tuned Vision-Language Models and Enhanced Reasoning Chains
von: Wang, Chun, et al.
Veröffentlicht: (2025)
von: Wang, Chun, et al.
Veröffentlicht: (2025)
VisualTrans: A Benchmark for Real-World Visual Transformation Reasoning
von: Ji, Yuheng, et al.
Veröffentlicht: (2025)
von: Ji, Yuheng, et al.
Veröffentlicht: (2025)
Improving Medical Visual Reinforcement Fine-Tuning via Perception and Reasoning Augmentation
von: Yang, Guangjing, et al.
Veröffentlicht: (2026)
von: Yang, Guangjing, et al.
Veröffentlicht: (2026)
Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models
von: Sun, Haoyuan, et al.
Veröffentlicht: (2025)
von: Sun, Haoyuan, et al.
Veröffentlicht: (2025)
Fine-Tuning Vision-Language Models for Visual Navigation Assistance
von: Li, Xiao, et al.
Veröffentlicht: (2025)
von: Li, Xiao, et al.
Veröffentlicht: (2025)
Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought
von: Zhang, Shuyi, et al.
Veröffentlicht: (2025)
von: Zhang, Shuyi, et al.
Veröffentlicht: (2025)
METIS: Multi-Source Egocentric Training for Integrated Dexterous Vision-Language-Action Model
von: Fu, Yankai, et al.
Veröffentlicht: (2025)
von: Fu, Yankai, et al.
Veröffentlicht: (2025)
RoboBrain: A Unified Brain Model for Robotic Manipulation from Abstract to Concrete
von: Ji, Yuheng, et al.
Veröffentlicht: (2025)
von: Ji, Yuheng, et al.
Veröffentlicht: (2025)
Mesh-RFT: Enhancing Mesh Generation via Fine-grained Reinforcement Fine-Tuning
von: Liu, Jian, et al.
Veröffentlicht: (2025)
von: Liu, Jian, et al.
Veröffentlicht: (2025)
Enhancing Adversarial Robustness of Vision-Language Models through Low-Rank Adaptation
von: Ji, Yuheng, et al.
Veröffentlicht: (2024)
von: Ji, Yuheng, et al.
Veröffentlicht: (2024)
Evading Visual Aphasia: Contrastive Adaptive Semantic Token Pruning for Vision-Language Models
von: Ma, Jie, et al.
Veröffentlicht: (2026)
von: Ma, Jie, et al.
Veröffentlicht: (2026)
Think or Not? Selective Reasoning via Reinforcement Learning for Vision-Language Models
von: Wang, Jiaqi, et al.
Veröffentlicht: (2025)
von: Wang, Jiaqi, et al.
Veröffentlicht: (2025)
VLA-RFT: Vision-Language-Action Reinforcement Fine-tuning with Verified Rewards in World Simulators
von: Li, Hengtao, et al.
Veröffentlicht: (2025)
von: Li, Hengtao, et al.
Veröffentlicht: (2025)
Visual Agentic Reinforcement Fine-Tuning
von: Liu, Ziyu, et al.
Veröffentlicht: (2025)
von: Liu, Ziyu, et al.
Veröffentlicht: (2025)
Visually Descriptive Language Model for Vector Graphics Reasoning
von: Wang, Zhenhailong, et al.
Veröffentlicht: (2024)
von: Wang, Zhenhailong, et al.
Veröffentlicht: (2024)
From Illusion to Intention: Visual Rationale Learning for Vision-Language Reasoning
von: Wang, Changpeng, et al.
Veröffentlicht: (2025)
von: Wang, Changpeng, et al.
Veröffentlicht: (2025)
SaPaVe: Towards Active Perception and Manipulation in Vision-Language-Action Models for Robotics
von: Liu, Mengzhen, et al.
Veröffentlicht: (2026)
von: Liu, Mengzhen, et al.
Veröffentlicht: (2026)
VisuRiddles: Fine-grained Perception is a Primary Bottleneck for Multimodal Large Language Models in Abstract Visual Reasoning
von: Yan, Hao, et al.
Veröffentlicht: (2025)
von: Yan, Hao, et al.
Veröffentlicht: (2025)
TikArt: Stabilizing Aperture-Guided Fine-Grained Visual Reasoning with Reinforcement Learning
von: Ding, Hao, et al.
Veröffentlicht: (2026)
von: Ding, Hao, et al.
Veröffentlicht: (2026)
WorldRFT: Latent World Model Planning with Reinforcement Fine-Tuning for Autonomous Driving
von: Yang, Pengxuan, et al.
Veröffentlicht: (2025)
von: Yang, Pengxuan, et al.
Veröffentlicht: (2025)
EVLP:Learning Unified Embodied Vision-Language Planner with Reinforced Supervised Fine-Tuning
von: Cai, Xinyan, et al.
Veröffentlicht: (2025)
von: Cai, Xinyan, et al.
Veröffentlicht: (2025)
Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models
von: Zhu, Wenhui, et al.
Veröffentlicht: (2025)
von: Zhu, Wenhui, et al.
Veröffentlicht: (2025)
PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning
von: Zhang, Yizhen, et al.
Veröffentlicht: (2025)
von: Zhang, Yizhen, et al.
Veröffentlicht: (2025)
Fine-Tuning Vision-Language Model for Automated Engineering Drawing Information Extraction
von: Khan, Muhammad Tayyab, et al.
Veröffentlicht: (2024)
von: Khan, Muhammad Tayyab, et al.
Veröffentlicht: (2024)
ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning
von: Huang, Chi-Pin, et al.
Veröffentlicht: (2025)
von: Huang, Chi-Pin, et al.
Veröffentlicht: (2025)
SkySenseGPT: A Fine-Grained Instruction Tuning Dataset and Model for Remote Sensing Vision-Language Understanding
von: Luo, Junwei, et al.
Veröffentlicht: (2024)
von: Luo, Junwei, et al.
Veröffentlicht: (2024)
RewardMap: Tackling Sparse Rewards in Fine-grained Visual Reasoning via Multi-Stage Reinforcement Learning
von: Feng, Sicheng, et al.
Veröffentlicht: (2025)
von: Feng, Sicheng, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
MathSticks: A Benchmark for Visual Symbolic Compositional Reasoning with Matchstick Puzzles
von: Ji, Yuheng, et al.
Veröffentlicht: (2025) -
TIGeR: Tool-Integrated Geometric Reasoning in Vision-Language Models for Robotics
von: Han, Yi, et al.
Veröffentlicht: (2025) -
Visual-RFT: Visual Reinforcement Fine-Tuning
von: Liu, Ziyu, et al.
Veröffentlicht: (2025) -
RoboRefer: Towards Spatial Referring with Reasoning in Vision-Language Models for Robotics
von: Zhou, Enshen, et al.
Veröffentlicht: (2025) -
RoboTracer: Mastering Spatial Trace with Reasoning in Vision-Language Models for Robotics
von: Zhou, Enshen, et al.
Veröffentlicht: (2025)