FuRL: Visual-Language Models as Fuzzy Rewards for Reinforcement Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Fu, Yuwei, Zhang, Haichao, Wu, Di, Xu, Wei, Boulet, Benoit |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Robot Policy Learning with Temporal Optimal Transport Reward
par: Fu, Yuwei, et autres
Publié: (2024)
par: Fu, Yuwei, et autres
Publié: (2024)
SSL4RL: Revisiting Self-supervised Learning as Intrinsic Reward for Visual-Language Reasoning
par: Guo, Xiaojun, et autres
Publié: (2025)
par: Guo, Xiaojun, et autres
Publié: (2025)
RL for Consistency Models: Faster Reward Guided Text-to-Image Generation
par: Oertell, Owen, et autres
Publié: (2024)
par: Oertell, Owen, et autres
Publié: (2024)
MVR: Multi-view Video Reward Shaping for Reinforcement Learning
par: Luo, Lirui, et autres
Publié: (2026)
par: Luo, Lirui, et autres
Publié: (2026)
Diff-Instruct with Diffused Reward: Towards Principled One-step Generator RL
par: Wu, Junyi, et autres
Publié: (2026)
par: Wu, Junyi, et autres
Publié: (2026)
ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning
par: Xu, Ziqiang, et autres
Publié: (2025)
par: Xu, Ziqiang, et autres
Publié: (2025)
OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents
par: Yang, Rui, et autres
Publié: (2026)
par: Yang, Rui, et autres
Publié: (2026)
Diffusion Reinforcement Learning via Centered Reward Distillation
par: Zhu, Yuanzhi, et autres
Publié: (2026)
par: Zhu, Yuanzhi, et autres
Publié: (2026)
GARDO: Reinforcing Diffusion Models without Reward Hacking
par: He, Haoran, et autres
Publié: (2025)
par: He, Haoran, et autres
Publié: (2025)
Focus On What Matters: Separated Models For Visual-Based RL Generalization
par: Zhang, Di, et autres
Publié: (2024)
par: Zhang, Di, et autres
Publié: (2024)
Reinforcement Learning with Robust Rubric Rewards
par: Yu, Ya-Qi, et autres
Publié: (2026)
par: Yu, Ya-Qi, et autres
Publié: (2026)
Camouflaged Image Synthesis Is All You Need to Boost Camouflaged Detection
par: Zhang, Haichao, et autres
Publié: (2023)
par: Zhang, Haichao, et autres
Publié: (2023)
COVR:Collaborative Optimization of VLMs and RL Agent for Visual-Based Control
par: Xia, Canming, et autres
Publié: (2026)
par: Xia, Canming, et autres
Publié: (2026)
ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning
par: Huang, Chi-Pin, et autres
Publié: (2025)
par: Huang, Chi-Pin, et autres
Publié: (2025)
OOSTraj: Out-of-Sight Trajectory Prediction With Vision-Positioning Denoising
par: Zhang, Haichao, et autres
Publié: (2024)
par: Zhang, Haichao, et autres
Publié: (2024)
VisualSphinx: Large-Scale Synthetic Vision Logic Puzzles for RL
par: Feng, Yichen, et autres
Publié: (2025)
par: Feng, Yichen, et autres
Publié: (2025)
PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning
par: Zhang, Yizhen, et autres
Publié: (2025)
par: Zhang, Yizhen, et autres
Publié: (2025)
Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing
par: Wu, Junfei, et autres
Publié: (2025)
par: Wu, Junfei, et autres
Publié: (2025)
RLAnything: Forge Environment, Policy, and Reward Model in Completely Dynamic RL System
par: Wang, Yinjie, et autres
Publié: (2026)
par: Wang, Yinjie, et autres
Publié: (2026)
RewardMap: Tackling Sparse Rewards in Fine-grained Visual Reasoning via Multi-Stage Reinforcement Learning
par: Feng, Sicheng, et autres
Publié: (2025)
par: Feng, Sicheng, et autres
Publié: (2025)
Reinforcement Learning for Unsupervised Video Summarization with Reward Generator Training
par: Abbasi, Mehryar, et autres
Publié: (2024)
par: Abbasi, Mehryar, et autres
Publié: (2024)
UniDoc-RL: Coarse-to-Fine Visual RAG with Hierarchical Actions and Dense Rewards
par: Wang, Jun, et autres
Publié: (2026)
par: Wang, Jun, et autres
Publié: (2026)
An Investigation into Pre-Training Object-Centric Representations for Reinforcement Learning
par: Yoon, Jaesik, et autres
Publié: (2023)
par: Yoon, Jaesik, et autres
Publié: (2023)
The Surprising Ineffectiveness of Pre-Trained Visual Representations for Model-Based Reinforcement Learning
par: Schneider, Moritz, et autres
Publié: (2024)
par: Schneider, Moritz, et autres
Publié: (2024)
When Rubrics Fail: Error Enumeration as Reward in Reference-Free RL Post-Training for Virtual Try-On
par: Ikezogwo, Wisdom, et autres
Publié: (2026)
par: Ikezogwo, Wisdom, et autres
Publié: (2026)
Subtask-Aware Visual Reward Learning from Segmented Demonstrations
par: Kim, Changyeon, et autres
Publié: (2025)
par: Kim, Changyeon, et autres
Publié: (2025)
Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward
par: Zhang, Ruohong, et autres
Publié: (2024)
par: Zhang, Ruohong, et autres
Publié: (2024)
Goal-Conditioned Data Augmentation for Offline Reinforcement Learning
par: Huang, Xingshuai, et autres
Publié: (2024)
par: Huang, Xingshuai, et autres
Publié: (2024)
Vision-Language Models Provide Promptable Representations for Reinforcement Learning
par: Chen, William, et autres
Publié: (2024)
par: Chen, William, et autres
Publié: (2024)
SLIM: Sim-to-Real Legged Instructive Manipulation via Long-Horizon Visuomotor Learning
par: Zhang, Haichao, et autres
Publié: (2025)
par: Zhang, Haichao, et autres
Publié: (2025)
Generalizing Consistency Policy to Visual RL with Prioritized Proximal Experience Regularization
par: Li, Haoran, et autres
Publié: (2024)
par: Li, Haoran, et autres
Publié: (2024)
Efficient Multi-turn RL for GUI Agents via Decoupled Training and Adaptive Data Curation
par: Li, Pengxiang, et autres
Publié: (2025)
par: Li, Pengxiang, et autres
Publié: (2025)
Defeasible Visual Entailment: Benchmark, Evaluator, and Reward-Driven Optimization
par: Zhang, Yue, et autres
Publié: (2024)
par: Zhang, Yue, et autres
Publié: (2024)
Perception-R1: Advancing Multimodal Reasoning Capabilities of MLLMs via Visual Perception Reward
par: Xiao, Tong, et autres
Publié: (2025)
par: Xiao, Tong, et autres
Publié: (2025)
Plan-Seq-Learn: Language Model Guided RL for Solving Long Horizon Robotics Tasks
par: Dalal, Murtaza, et autres
Publié: (2024)
par: Dalal, Murtaza, et autres
Publié: (2024)
Visual-ERM: Reward Modeling for Visual Equivalence
par: Liu, Ziyu, et autres
Publié: (2026)
par: Liu, Ziyu, et autres
Publié: (2026)
Visual Preference Optimization with Rubric Rewards
par: Yu, Ya-Qi, et autres
Publié: (2026)
par: Yu, Ya-Qi, et autres
Publié: (2026)
IVR-R1: Refining Trajectories through Iterative Visual-Grounded Reasoning in Reinforcement Learning
par: Li, Chenghao, et autres
Publié: (2026)
par: Li, Chenghao, et autres
Publié: (2026)
Metis-RISE: RL Incentivizes and SFT Enhances Multimodal Reasoning Model Learning
par: Qiu, Haibo, et autres
Publié: (2025)
par: Qiu, Haibo, et autres
Publié: (2025)
PromptEcho: Annotation-Free Reward from Vision-Language Models for Text-to-Image Reinforcement Learning
par: Liu, Jinlong, et autres
Publié: (2026)
par: Liu, Jinlong, et autres
Publié: (2026)
Documents similaires
-
Robot Policy Learning with Temporal Optimal Transport Reward
par: Fu, Yuwei, et autres
Publié: (2024) -
SSL4RL: Revisiting Self-supervised Learning as Intrinsic Reward for Visual-Language Reasoning
par: Guo, Xiaojun, et autres
Publié: (2025) -
RL for Consistency Models: Faster Reward Guided Text-to-Image Generation
par: Oertell, Owen, et autres
Publié: (2024) -
MVR: Multi-view Video Reward Shaping for Reinforcement Learning
par: Luo, Lirui, et autres
Publié: (2026) -
Diff-Instruct with Diffused Reward: Towards Principled One-step Generator RL
par: Wu, Junyi, et autres
Publié: (2026)