One Framework to Rule Them All: Unifying RL-Based and RL-Free Methods in RLHF
Fuente:
arXiv
Salvato in:
| Autore principale: | Cai, Xin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
One Noise to Rule Them All: Learning a Unified Model of Spatially-Varying Noise Patterns
di: Maesumi, Arman, et al.
Pubblicazione: (2024)
di: Maesumi, Arman, et al.
Pubblicazione: (2024)
One RL to See Them All: Visual Triple Unified Reinforcement Learning
di: Ma, Yan, et al.
Pubblicazione: (2025)
di: Ma, Yan, et al.
Pubblicazione: (2025)
One-Dimensional Adapter to Rule Them All: Concepts, Diffusion Models and Erasing Applications
di: Lyu, Mengyao, et al.
Pubblicazione: (2023)
di: Lyu, Mengyao, et al.
Pubblicazione: (2023)
PromptRL: Prompt Matters in RL for Flow-Based Image Generation
di: Wang, Fu-Yun, et al.
Pubblicazione: (2026)
di: Wang, Fu-Yun, et al.
Pubblicazione: (2026)
Unified Classification and Rejection: A One-versus-All Framework
di: Cheng, Zhen, et al.
Pubblicazione: (2023)
di: Cheng, Zhen, et al.
Pubblicazione: (2023)
One Framework to Rule Them All: Unifying Multimodal Tasks with LLM Neural-Tuning
di: Sun, Hao, et al.
Pubblicazione: (2024)
di: Sun, Hao, et al.
Pubblicazione: (2024)
The Promise of RL for Autoregressive Image Editing
di: Ahmadi, Saba, et al.
Pubblicazione: (2025)
di: Ahmadi, Saba, et al.
Pubblicazione: (2025)
OmniCaptioner: One Captioner to Rule Them All
di: Lu, Yiting, et al.
Pubblicazione: (2025)
di: Lu, Yiting, et al.
Pubblicazione: (2025)
SupeRANSAC: One RANSAC to Rule Them All
di: Barath, Daniel
Pubblicazione: (2025)
di: Barath, Daniel
Pubblicazione: (2025)
RL makes MLLMs see better than SFT
di: Song, Junha, et al.
Pubblicazione: (2025)
di: Song, Junha, et al.
Pubblicazione: (2025)
MARBLE: Multi-Aspect Reward Balance for Diffusion RL
di: Zhao, Canyu, et al.
Pubblicazione: (2026)
di: Zhao, Canyu, et al.
Pubblicazione: (2026)
Diff-Instruct with Diffused Reward: Towards Principled One-step Generator RL
di: Wu, Junyi, et al.
Pubblicazione: (2026)
di: Wu, Junyi, et al.
Pubblicazione: (2026)
All in One: A Unified Synthetic Data Pipeline for Multimodal Video Understanding
di: Rahman, Tanzila, et al.
Pubblicazione: (2026)
di: Rahman, Tanzila, et al.
Pubblicazione: (2026)
EasyVideoR1: Easier RL for Video Understanding
di: Qin, Chuanyu, et al.
Pubblicazione: (2026)
di: Qin, Chuanyu, et al.
Pubblicazione: (2026)
Carve3D: Improving Multi-view Reconstruction Consistency for Diffusion Models with RL Finetuning
di: Xie, Desai, et al.
Pubblicazione: (2023)
di: Xie, Desai, et al.
Pubblicazione: (2023)
One Adapter for All: Towards Unified Representation in Step-Imbalanced Class-Incremental Learning
di: Zhang, Xiaoyan, et al.
Pubblicazione: (2026)
di: Zhang, Xiaoyan, et al.
Pubblicazione: (2026)
SCaRL- A Synthetic Multi-Modal Dataset for Autonomous Driving
di: Ramesh, Avinash Nittur, et al.
Pubblicazione: (2024)
di: Ramesh, Avinash Nittur, et al.
Pubblicazione: (2024)
VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL
di: Dai, Fengyuan, et al.
Pubblicazione: (2025)
di: Dai, Fengyuan, et al.
Pubblicazione: (2025)
RL-Selector: Reinforcement Learning-Guided Data Selection via Redundancy Assessment
di: Yang, Suorong, et al.
Pubblicazione: (2025)
di: Yang, Suorong, et al.
Pubblicazione: (2025)
Pixel-wise RL on Diffusion Models: Reinforcement Learning from Rich Feedback
di: Kordzanganeh, Mo, et al.
Pubblicazione: (2024)
di: Kordzanganeh, Mo, et al.
Pubblicazione: (2024)
COVR:Collaborative Optimization of VLMs and RL Agent for Visual-Based Control
di: Xia, Canming, et al.
Pubblicazione: (2026)
di: Xia, Canming, et al.
Pubblicazione: (2026)
One Patch to Caption Them All: A Unified Zero-Shot Captioning Framework
di: Bianchi, Lorenzo, et al.
Pubblicazione: (2025)
di: Bianchi, Lorenzo, et al.
Pubblicazione: (2025)
RL-RC-DoT: A Block-level RL agent for Task-Aware Video Compression
di: Gadot, Uri, et al.
Pubblicazione: (2025)
di: Gadot, Uri, et al.
Pubblicazione: (2025)
Revoking Amnesia: RL-based Trajectory Optimization to Resurrect Erased Concepts in Diffusion Models
di: Gao, Daiheng, et al.
Pubblicazione: (2025)
di: Gao, Daiheng, et al.
Pubblicazione: (2025)
Reinforce Adjoint Matching: Scaling RL Post-Training of Diffusion and Flow-Matching Models
di: Bergmeister, Andreas, et al.
Pubblicazione: (2026)
di: Bergmeister, Andreas, et al.
Pubblicazione: (2026)
VAR RL Done Right: Tackling Asynchronous Policy Conflicts in Visual Autoregressive Generation
di: Sun, Shikun, et al.
Pubblicazione: (2026)
di: Sun, Shikun, et al.
Pubblicazione: (2026)
SynthRL: Scaling Visual Reasoning with Verifiable Data Synthesis
di: Wu, Zijian, et al.
Pubblicazione: (2025)
di: Wu, Zijian, et al.
Pubblicazione: (2025)
RLS3: RL-Based Synthetic Sample Selection to Enhance Spatial Reasoning in Vision-Language Models for Indoor Autonomous Perception
di: Waite, Joshua R., et al.
Pubblicazione: (2025)
di: Waite, Joshua R., et al.
Pubblicazione: (2025)
When Rubrics Fail: Error Enumeration as Reward in Reference-Free RL Post-Training for Virtual Try-On
di: Ikezogwo, Wisdom, et al.
Pubblicazione: (2026)
di: Ikezogwo, Wisdom, et al.
Pubblicazione: (2026)
Diffusion-Based Offline RL for Improved Decision-Making in Augmented ARC Task
di: Kim, Yunho, et al.
Pubblicazione: (2024)
di: Kim, Yunho, et al.
Pubblicazione: (2024)
Rethinking RL Scaling for Vision Language Models: A Transparent, From-Scratch Framework and Comprehensive Evaluation Scheme
di: Ma, Yan, et al.
Pubblicazione: (2025)
di: Ma, Yan, et al.
Pubblicazione: (2025)
SAM2RL: Towards Reinforcement Learning Memory Control in Segment Anything Model 2
di: Adamyan, Alen, et al.
Pubblicazione: (2025)
di: Adamyan, Alen, et al.
Pubblicazione: (2025)
QeRL: Beyond Efficiency -- Quantization-enhanced Reinforcement Learning for LLMs
di: Huang, Wei, et al.
Pubblicazione: (2025)
di: Huang, Wei, et al.
Pubblicazione: (2025)
VidGuard-R1: AI-Generated Video Detection and Explanation via Reasoning MLLMs and RL
di: Park, Kyoungjun, et al.
Pubblicazione: (2025)
di: Park, Kyoungjun, et al.
Pubblicazione: (2025)
Zero-Shot Generalization of Vision-Based RL Without Data Augmentation
di: Batra, Sumeet, et al.
Pubblicazione: (2024)
di: Batra, Sumeet, et al.
Pubblicazione: (2024)
Focus On What Matters: Separated Models For Visual-Based RL Generalization
di: Zhang, Di, et al.
Pubblicazione: (2024)
di: Zhang, Di, et al.
Pubblicazione: (2024)
ONEBench to Test Them All: Sample-Level Benchmarking Over Open-Ended Capabilities
di: Ghosh, Adhiraj, et al.
Pubblicazione: (2024)
di: Ghosh, Adhiraj, et al.
Pubblicazione: (2024)
One Channel to Rule Them All: Rethinking Input Representation for Visual Place Recognition
di: Ismagilov, Timur, et al.
Pubblicazione: (2026)
di: Ismagilov, Timur, et al.
Pubblicazione: (2026)
Why Does RL Generalize Better Than SFT? A Data-Centric Perspective on VLM Post-Training
di: Lu, Aojun, et al.
Pubblicazione: (2026)
di: Lu, Aojun, et al.
Pubblicazione: (2026)
Learning to Detect Label Errors by Making Them: A Method for Segmentation and Object Detection Datasets
di: Penquitt, Sarina, et al.
Pubblicazione: (2025)
di: Penquitt, Sarina, et al.
Pubblicazione: (2025)
Documenti analoghi
-
One Noise to Rule Them All: Learning a Unified Model of Spatially-Varying Noise Patterns
di: Maesumi, Arman, et al.
Pubblicazione: (2024) -
One RL to See Them All: Visual Triple Unified Reinforcement Learning
di: Ma, Yan, et al.
Pubblicazione: (2025) -
One-Dimensional Adapter to Rule Them All: Concepts, Diffusion Models and Erasing Applications
di: Lyu, Mengyao, et al.
Pubblicazione: (2023) -
PromptRL: Prompt Matters in RL for Flow-Based Image Generation
di: Wang, Fu-Yun, et al.
Pubblicazione: (2026) -
Unified Classification and Rejection: A One-versus-All Framework
di: Cheng, Zhen, et al.
Pubblicazione: (2023)