Why Does RL Generalize Better Than SFT? A Data-Centric Perspective on VLM Post-Training
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lu, Aojun, Feng, Tao, Yuan, Hangjie, Li, Wei, Sun, Yanan |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Rethinking the Stability-Plasticity Trade-off in Continual Learning from an Architectural Perspective
par: Lu, Aojun, et autres
Publié: (2025)
par: Lu, Aojun, et autres
Publié: (2025)
Revisiting Neural Networks for Continual Learning: An Architectural Perspective
par: Lu, Aojun, et autres
Publié: (2024)
par: Lu, Aojun, et autres
Publié: (2024)
Adapt before Continual Learning
par: Lu, Aojun, et autres
Publié: (2025)
par: Lu, Aojun, et autres
Publié: (2025)
C-Flat++: Towards a More Efficient and Powerful Framework for Continual Learning
par: Li, Wei, et autres
Publié: (2025)
par: Li, Wei, et autres
Publié: (2025)
When Does RL Help Medical VLMs? Disentangling Vision, SFT, and RL Gains
par: Jeddi, Ahmadreza, et autres
Publié: (2026)
par: Jeddi, Ahmadreza, et autres
Publié: (2026)
Make Continual Learning Stronger via C-Flat
par: Bian, Ang, et autres
Publié: (2024)
par: Bian, Ang, et autres
Publié: (2024)
CogFlow: Bridging Perception and Reasoning through Knowledge Internalization for Visual Mathematical Problem Solving
par: Chen, Shuhang, et autres
Publié: (2026)
par: Chen, Shuhang, et autres
Publié: (2026)
SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training
par: Chu, Tianzhe, et autres
Publié: (2025)
par: Chu, Tianzhe, et autres
Publié: (2025)
First SFT, Second RL, Third UPT: Continual Improving Multi-Modal LLM Reasoning via Unsupervised Post-Training
par: Wei, Lai, et autres
Publié: (2025)
par: Wei, Lai, et autres
Publié: (2025)
SimpleAR: Pushing the Frontier of Autoregressive Visual Generation through Pretraining, SFT, and RL
par: Wang, Junke, et autres
Publié: (2025)
par: Wang, Junke, et autres
Publié: (2025)
GTR: Guided Thought Reinforcement Prevents Thought Collapse in RL-based VLM Agent Training
par: Wei, Tong, et autres
Publié: (2025)
par: Wei, Tong, et autres
Publié: (2025)
RL makes MLLMs see better than SFT
par: Song, Junha, et autres
Publié: (2025)
par: Song, Junha, et autres
Publié: (2025)
OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles
par: Deng, Yihe, et autres
Publié: (2025)
par: Deng, Yihe, et autres
Publié: (2025)
Can Better Text Semantics in Prompt Tuning Improve VLM Generalization?
par: Kuchibhotla, Hari Chandana, et autres
Publié: (2024)
par: Kuchibhotla, Hari Chandana, et autres
Publié: (2024)
Does VLM Classification Benefit from LLM Description Semantics?
par: Ma, Pingchuan, et autres
Publié: (2024)
par: Ma, Pingchuan, et autres
Publié: (2024)
DreamRelation: Relation-Centric Video Customization
par: Wei, Yujie, et autres
Publié: (2025)
par: Wei, Yujie, et autres
Publié: (2025)
2Xplat: Two Experts Are Better Than One Generalist
par: Jeong, Hwasik, et autres
Publié: (2026)
par: Jeong, Hwasik, et autres
Publié: (2026)
Inlier-Centric Post-Training Quantization for Object Detection Models
par: Kim, Minsu, et autres
Publié: (2026)
par: Kim, Minsu, et autres
Publié: (2026)
Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs
par: Li, Haoyuan, et autres
Publié: (2025)
par: Li, Haoyuan, et autres
Publié: (2025)
A Faster Path to Continual Learning
par: Li, Wei, et autres
Publié: (2026)
par: Li, Wei, et autres
Publié: (2026)
ID-Crafter: VLM-Grounded Online RL for Compositional Multi-Subject Video Generation
par: Pan, Panwang, et autres
Publié: (2025)
par: Pan, Panwang, et autres
Publié: (2025)
Metis-RISE: RL Incentivizes and SFT Enhances Multimodal Reasoning Model Learning
par: Qiu, Haibo, et autres
Publié: (2025)
par: Qiu, Haibo, et autres
Publié: (2025)
Towards Better & Faster Autoregressive Image Generation: From the Perspective of Entropy
par: Ma, Xiaoxiao, et autres
Publié: (2025)
par: Ma, Xiaoxiao, et autres
Publié: (2025)
Are Object-Centric Representations Better At Compositional Generalization?
par: Kapl, Ferdinand, et autres
Publié: (2026)
par: Kapl, Ferdinand, et autres
Publié: (2026)
SAMora: Enhancing SAM through Hierarchical Self-Supervised Pre-Training for Medical Images
par: Chen, Shuhang, et autres
Publié: (2025)
par: Chen, Shuhang, et autres
Publié: (2025)
Ego-InBetween: Generating Object State Transitions in Ego-Centric Videos
par: Ge, Mengmeng, et autres
Publié: (2026)
par: Ge, Mengmeng, et autres
Publié: (2026)
Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL
par: Wang, Sudong, et autres
Publié: (2026)
par: Wang, Sudong, et autres
Publié: (2026)
Q-VLM: Post-training Quantization for Large Vision-Language Models
par: Wang, Changyuan, et autres
Publié: (2024)
par: Wang, Changyuan, et autres
Publié: (2024)
Unprejudiced Training Auxiliary Tasks Makes Primary Better: A Multi-Task Learning Perspective
par: Li, Yuanze, et autres
Publié: (2024)
par: Li, Yuanze, et autres
Publié: (2024)
Small-Large Collaboration: Training-efficient Concept Personalization for Large VLM using a Meta Personalized Small VLM
par: Yang, Sihan, et autres
Publié: (2025)
par: Yang, Sihan, et autres
Publié: (2025)
CharTide: Data-Centric Chart-to-Code Generation via Tri-Perspective Tuning and Inquiry-Driven Evolution
par: Zheng, Xiangxi, et autres
Publié: (2026)
par: Zheng, Xiangxi, et autres
Publié: (2026)
Enhancing Video Transformers for Action Understanding with VLM-aided Training
par: Lu, Hui, et autres
Publié: (2024)
par: Lu, Hui, et autres
Publié: (2024)
Bi-VLM: Pushing Ultra-Low Precision Post-Training Quantization Boundaries in Vision-Language Models
par: Wang, Xijun, et autres
Publié: (2025)
par: Wang, Xijun, et autres
Publié: (2025)
ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL
par: Zhang, Yu, et autres
Publié: (2025)
par: Zhang, Yu, et autres
Publié: (2025)
ThinkRL-Edit: Thinking in Reinforcement Learning for Reasoning-Centric Image Editing
par: Li, Hengjia, et autres
Publié: (2026)
par: Li, Hengjia, et autres
Publié: (2026)
ZeroFlow: Overcoming Catastrophic Forgetting is Easier than You Think
par: Feng, Tao, et autres
Publié: (2025)
par: Feng, Tao, et autres
Publié: (2025)
Continual GUI Agents
par: Liu, Ziwei, et autres
Publié: (2026)
par: Liu, Ziwei, et autres
Publié: (2026)
Frequency Autoregressive Image Generation with Continuous Tokens
par: Yu, Hu, et autres
Publié: (2025)
par: Yu, Hu, et autres
Publié: (2025)
FREE: Faster and Better Data-Free Meta-Learning
par: Wei, Yongxian, et autres
Publié: (2024)
par: Wei, Yongxian, et autres
Publié: (2024)
REO-VLM: Transforming VLM to Meet Regression Challenges in Earth Observation
par: Xue, Xizhe, et autres
Publié: (2024)
par: Xue, Xizhe, et autres
Publié: (2024)
Documents similaires
-
Rethinking the Stability-Plasticity Trade-off in Continual Learning from an Architectural Perspective
par: Lu, Aojun, et autres
Publié: (2025) -
Revisiting Neural Networks for Continual Learning: An Architectural Perspective
par: Lu, Aojun, et autres
Publié: (2024) -
Adapt before Continual Learning
par: Lu, Aojun, et autres
Publié: (2025) -
C-Flat++: Towards a More Efficient and Powerful Framework for Continual Learning
par: Li, Wei, et autres
Publié: (2025) -
When Does RL Help Medical VLMs? Disentangling Vision, SFT, and RL Gains
par: Jeddi, Ahmadreza, et autres
Publié: (2026)