SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Hardy, Tu, Haoqin, Wang, Fali, Liu, Hui, Tang, Xianfeng, Du, Xinya, Zhou, Yuyin, Xie, Cihang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models
par: Wu, Juncheng, et autres
Publié: (2026)
par: Wu, Juncheng, et autres
Publié: (2026)
ViLBench: A Suite for Vision-Language Process Reward Modeling
par: Tu, Haoqin, et autres
Publié: (2025)
par: Tu, Haoqin, et autres
Publié: (2025)
ClinSeekAgent: Automating Multimodal Evidence Seeking for Agentic Clinical Reasoning
par: Wu, Juncheng, et autres
Publié: (2026)
par: Wu, Juncheng, et autres
Publié: (2026)
Knowledge or Reasoning? A Close Look at How LLMs Think Across Domains
par: Wu, Juncheng, et autres
Publié: (2025)
par: Wu, Juncheng, et autres
Publié: (2025)
m1: Unleash the Potential of Test-Time Scaling for Medical Reasoning with Large Language Models
par: Huang, Xiaoke, et autres
Publié: (2025)
par: Huang, Xiaoke, et autres
Publié: (2025)
SpatialThinker: Reinforcing 3D Reasoning in Multimodal LLMs via Spatial Rewards
par: Batra, Hunar, et autres
Publié: (2025)
par: Batra, Hunar, et autres
Publié: (2025)
Where on Earth? A Vision-Language Benchmark for Probing Model Geolocation Skills Across Scales
par: Qian, Zhaofang, et autres
Publié: (2025)
par: Qian, Zhaofang, et autres
Publié: (2025)
AHELM: A Holistic Evaluation of Audio-Language Models
par: Lee, Tony, et autres
Publié: (2025)
par: Lee, Tony, et autres
Publié: (2025)
A Preliminary Study of o1 in Medicine: Are We Closer to an AI Doctor?
par: Xie, Yunfei, et autres
Publié: (2024)
par: Xie, Yunfei, et autres
Publié: (2024)
The Synergy Dilemma of Long-CoT SFT and RL: Investigating Post-Training Techniques for Reasoning VLMs
par: Chen, Jierun, et autres
Publié: (2025)
par: Chen, Jierun, et autres
Publié: (2025)
Chasing the Public Score: User Pressure and Evaluation Exploitation in Coding Agent Workflows
par: Chen, Hardy, et autres
Publié: (2026)
par: Chen, Hardy, et autres
Publié: (2026)
Beyond Two-Stage Training: Cooperative SFT and RL for LLM Reasoning
par: Chen, Liang, et autres
Publié: (2025)
par: Chen, Liang, et autres
Publié: (2025)
OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles
par: Deng, Yihe, et autres
Publié: (2025)
par: Deng, Yihe, et autres
Publié: (2025)
A Comprehensive Analysis for Visual Object Hallucination in Large Vision-Language Models
par: Jing, Liqiang, et autres
Publié: (2025)
par: Jing, Liqiang, et autres
Publié: (2025)
AttnGCG: Enhancing Jailbreaking Attacks on LLMs with Attention Manipulation
par: Wang, Zijun, et autres
Publié: (2024)
par: Wang, Zijun, et autres
Publié: (2024)
FGAIF: Aligning Large Vision-Language Models with Fine-grained AI Feedback
par: Jing, Liqiang, et autres
Publié: (2024)
par: Jing, Liqiang, et autres
Publié: (2024)
DeReason: A Difficulty-Aware Curriculum Improves Decoupled SFT-then-RL Training for General Reasoning
par: Hu, Hanxu, et autres
Publié: (2026)
par: Hu, Hanxu, et autres
Publié: (2026)
What If We Recaption Billions of Web Images with LLaMA-3?
par: Li, Xianhang, et autres
Publié: (2024)
par: Li, Xianhang, et autres
Publié: (2024)
Light-R1: Curriculum SFT, DPO and RL for Long COT from Scratch and Beyond
par: Wen, Liang, et autres
Publié: (2025)
par: Wen, Liang, et autres
Publié: (2025)
Your Agent, Their Asset: A Real-World Safety Analysis of OpenClaw
par: Wang, Zijun, et autres
Publié: (2026)
par: Wang, Zijun, et autres
Publié: (2026)
Quagmires in SFT-RL Post-Training: When High SFT Scores Mislead and What to Use Instead
par: Kang, Feiyang, et autres
Publié: (2025)
par: Kang, Feiyang, et autres
Publié: (2025)
SFT-then-RL Outperforms Mixed-Policy Methods for LLM Reasoning
par: Limozin, Alexis, et autres
Publié: (2026)
par: Limozin, Alexis, et autres
Publié: (2026)
STAR-1: Safer Alignment of Reasoning LLMs with 1K Data
par: Wang, Zijun, et autres
Publié: (2025)
par: Wang, Zijun, et autres
Publié: (2025)
ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL
par: Zhang, Yu, et autres
Publié: (2025)
par: Zhang, Yu, et autres
Publié: (2025)
FG-PRM: Fine-grained Hallucination Detection and Mitigation in Language Model Mathematical Reasoning
par: Li, Ruosen, et autres
Publié: (2024)
par: Li, Ruosen, et autres
Publié: (2024)
OpenVision: A Fully-Open, Cost-Effective Family of Advanced Vision Encoders for Multimodal Learning
par: Li, Xianhang, et autres
Publié: (2025)
par: Li, Xianhang, et autres
Publié: (2025)
Target-Oriented Pretraining Data Selection via Neuron-Activated Graph
par: Wang, Zijun, et autres
Publié: (2026)
par: Wang, Zijun, et autres
Publié: (2026)
AALC: Large Language Model Efficient Reasoning via Adaptive Accuracy-Length Control
par: Li, Ruosen, et autres
Publié: (2025)
par: Li, Ruosen, et autres
Publié: (2025)
Parallel-SFT: Improving Zero-Shot Cross-Programming-Language Transfer for Code RL
par: Wu, Zhaofeng, et autres
Publié: (2026)
par: Wu, Zhaofeng, et autres
Publié: (2026)
Kestrel: Grounding Self-Refinement for LVLM Hallucination Mitigation
par: Mao, Jiawei, et autres
Publié: (2026)
par: Mao, Jiawei, et autres
Publié: (2026)
PRD: Peer Rank and Discussion Improve Large Language Model based Evaluations
par: Li, Ruosen, et autres
Publié: (2023)
par: Li, Ruosen, et autres
Publié: (2023)
AceReason-Nemotron 1.1: Advancing Math and Code Reasoning through SFT and RL Synergy
par: Liu, Zihan, et autres
Publié: (2025)
par: Liu, Zihan, et autres
Publié: (2025)
VLAA-GUI: Knowing When to Stop, Recover, and Search, A Modular Framework for GUI Automation
par: Han, Qijun, et autres
Publié: (2026)
par: Han, Qijun, et autres
Publié: (2026)
Unlocking the Power of Multi-Agent LLM for Reasoning: From Lazy Agents to Deliberation
par: Zhang, Zhiwei, et autres
Publié: (2025)
par: Zhang, Zhiwei, et autres
Publié: (2025)
Beyond SFT: Reinforcement Learning for Safer Large Reasoning Models with Better Reasoning Ability
par: Jia, Jinghan, et autres
Publié: (2025)
par: Jia, Jinghan, et autres
Publié: (2025)
On the Interplay of Pre-Training, Mid-Training, and RL on Reasoning Language Models
par: Zhang, Charlie, et autres
Publié: (2025)
par: Zhang, Charlie, et autres
Publié: (2025)
$\texttt{Complex-Edit}$: CoT-Like Instruction Generation for Complexity-Controllable Image Editing Benchmark
par: Yang, Siwei, et autres
Publié: (2025)
par: Yang, Siwei, et autres
Publié: (2025)
Efficient Long CoT Reasoning in Small Language Models
par: Wang, Zhaoyang, et autres
Publié: (2025)
par: Wang, Zhaoyang, et autres
Publié: (2025)
First SFT, Second RL, Third UPT: Continual Improving Multi-Modal LLM Reasoning via Unsupervised Post-Training
par: Wei, Lai, et autres
Publié: (2025)
par: Wei, Lai, et autres
Publié: (2025)
AgentTTS: Large Language Model Agent for Test-time Compute-optimal Scaling Strategy in Complex Tasks
par: Wang, Fali, et autres
Publié: (2025)
par: Wang, Fali, et autres
Publié: (2025)
Documents similaires
-
From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models
par: Wu, Juncheng, et autres
Publié: (2026) -
ViLBench: A Suite for Vision-Language Process Reward Modeling
par: Tu, Haoqin, et autres
Publié: (2025) -
ClinSeekAgent: Automating Multimodal Evidence Seeking for Agentic Clinical Reasoning
par: Wu, Juncheng, et autres
Publié: (2026) -
Knowledge or Reasoning? A Close Look at How LLMs Think Across Domains
par: Wu, Juncheng, et autres
Publié: (2025) -
m1: Unleash the Potential of Test-Time Scaling for Medical Reasoning with Large Language Models
par: Huang, Xiaoke, et autres
Publié: (2025)