Enhancing Vision-Language Model Training with Reinforcement Learning in Synthetic Worlds for Real-World Success
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Bredis, George, Dereka, Stanislav, Sinii, Viacheslav, Rakhimov, Ruslan, Gavrilov, Daniil |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Next Embedding Prediction Makes World Models Stronger
par: Bredis, George, et autres
Publié: (2026)
par: Bredis, George, et autres
Publié: (2026)
F-GRPO: Don't Let Your Policy Learn the Obvious and Forget the Rare
par: Plyusov, Daniil, et autres
Publié: (2026)
par: Plyusov, Daniil, et autres
Publié: (2026)
Steering LLM Reasoning Through Bias-Only Adaptation
par: Sinii, Viacheslav, et autres
Publié: (2025)
par: Sinii, Viacheslav, et autres
Publié: (2025)
In-Context Reinforcement Learning for Variable Action Spaces
par: Sinii, Viacheslav, et autres
Publié: (2023)
par: Sinii, Viacheslav, et autres
Publié: (2023)
Real-World Offline Reinforcement Learning from Vision Language Model Feedback
par: Venkataraman, Sreyas, et autres
Publié: (2024)
par: Venkataraman, Sreyas, et autres
Publié: (2024)
RLVR-World: Training World Models with Reinforcement Learning
par: Wu, Jialong, et autres
Publié: (2025)
par: Wu, Jialong, et autres
Publié: (2025)
ESSA: Evolutionary Strategies for Scalable Alignment
par: Korotyshova, Daria, et autres
Publié: (2025)
par: Korotyshova, Daria, et autres
Publié: (2025)
The Differences Between Direct Alignment Algorithms are a Blur
par: Gorbatovski, Alexey, et autres
Publié: (2025)
par: Gorbatovski, Alexey, et autres
Publié: (2025)
You Do Not Fully Utilize Transformer's Representation Capacity
par: Gerasimov, Gleb, et autres
Publié: (2025)
par: Gerasimov, Gleb, et autres
Publié: (2025)
Identity Curvature Laplace Approximation for Improved Out-of-Distribution Detection
par: Zhdanov, Maksim, et autres
Publié: (2023)
par: Zhdanov, Maksim, et autres
Publié: (2023)
Diversifying Deep Ensembles: A Saliency Map Approach for Enhanced OOD Detection, Calibration, and Accuracy
par: Dereka, Stanislav, et autres
Publié: (2023)
par: Dereka, Stanislav, et autres
Publié: (2023)
Train One Sparse Autoencoder Across Multiple Sparsity Budgets to Preserve Interpretability and Accuracy
par: Balagansky, Nikita, et autres
Publié: (2025)
par: Balagansky, Nikita, et autres
Publié: (2025)
Towards Autonomous Reinforcement Learning for Real-World Robotic Manipulation with Large Language Models
par: Turcato, Niccolò, et autres
Publié: (2025)
par: Turcato, Niccolò, et autres
Publié: (2025)
Safe Reinforcement Learning for Real-World Engine Control
par: Bedei, Julian, et autres
Publié: (2025)
par: Bedei, Julian, et autres
Publié: (2025)
Agent World Model: Infinity Synthetic Environments for Agentic Reinforcement Learning
par: Wang, Zhaoyang, et autres
Publié: (2026)
par: Wang, Zhaoyang, et autres
Publié: (2026)
Real-World Reinforcement Learning of Active Perception Behaviors
par: Hu, Edward S., et autres
Publié: (2025)
par: Hu, Edward S., et autres
Publié: (2025)
FutureWorld: A Live Reinforcement Learning Environment for Predictive Agents with Real-World Outcome Rewards
par: Han, Zhixin, et autres
Publié: (2026)
par: Han, Zhixin, et autres
Publié: (2026)
Transfer Learning of Surrogate Models via Domain Affine Transformation Across Synthetic and Real-World Benchmarks
par: Pan, Shuaiqun, et autres
Publié: (2025)
par: Pan, Shuaiqun, et autres
Publié: (2025)
One-shot World Models Using a Transformer Trained on a Synthetic Prior
par: Ferreira, Fabio, et autres
Publié: (2024)
par: Ferreira, Fabio, et autres
Publié: (2024)
Policy and World Modeling Co-Training for Language Agents
par: Lu, Ning, et autres
Publié: (2026)
par: Lu, Ning, et autres
Publié: (2026)
Agentic Reinforcement Learning for Real-World Code Repair
par: Zhu, Siyu, et autres
Publié: (2025)
par: Zhu, Siyu, et autres
Publié: (2025)
A Production Scheduling Framework for Reinforcement Learning Under Real-World Constraints
par: Hoss, Jonathan, et autres
Publié: (2025)
par: Hoss, Jonathan, et autres
Publié: (2025)
Towards Large-Scale In-Context Reinforcement Learning by Meta-Training in Randomized Worlds
par: Wang, Fan, et autres
Publié: (2025)
par: Wang, Fan, et autres
Publié: (2025)
In-Context Reinforcement Learning via Communicative World Models
par: Martinez-Lopez, Fernando, et autres
Publié: (2025)
par: Martinez-Lopez, Fernando, et autres
Publié: (2025)
Continual Reinforcement Learning by Planning with Online World Models
par: Liu, Zichen, et autres
Publié: (2025)
par: Liu, Zichen, et autres
Publié: (2025)
Trust-Region Behavior Blending for On-Policy Distillation
par: Plyusov, Daniil, et autres
Publié: (2026)
par: Plyusov, Daniil, et autres
Publié: (2026)
RL-100: Performant Robotic Manipulation with Real-World Reinforcement Learning
par: Lei, Kun, et autres
Publié: (2025)
par: Lei, Kun, et autres
Publié: (2025)
Gym4ReaL: A Suite for Benchmarking Real-World Reinforcement Learning
par: Salaorni, Davide, et autres
Publié: (2025)
par: Salaorni, Davide, et autres
Publié: (2025)
Learning Abstract World Model for Value-preserving Planning with Options
par: Rodriguez-Sanchez, Rafael, et autres
Publié: (2024)
par: Rodriguez-Sanchez, Rafael, et autres
Publié: (2024)
Object-Centric World Models for Causality-Aware Reinforcement Learning
par: Nishimoto, Yosuke, et autres
Publié: (2025)
par: Nishimoto, Yosuke, et autres
Publié: (2025)
Reinforcement Learning from Delayed Observations via World Models
par: Karamzade, Armin, et autres
Publié: (2024)
par: Karamzade, Armin, et autres
Publié: (2024)
Teach Old SAEs New Domain Tricks with Boosting
par: Koriagin, Nikita, et autres
Publié: (2025)
par: Koriagin, Nikita, et autres
Publié: (2025)
Uncertainty-Aware Robotic World Model Makes Offline Model-Based Reinforcement Learning Work on Real Robots
par: Li, Chenhao, et autres
Publié: (2025)
par: Li, Chenhao, et autres
Publié: (2025)
The Pump Scheduling Problem: A Real-World Scenario for Reinforcement Learning
par: Donâncio, Henrique, et autres
Publié: (2022)
par: Donâncio, Henrique, et autres
Publié: (2022)
Learning to Model the World with Language
par: Lin, Jessy, et autres
Publié: (2023)
par: Lin, Jessy, et autres
Publié: (2023)
Novelty Detection in Reinforcement Learning with World Models
par: Zollicoffer, Geigh, et autres
Publié: (2023)
par: Zollicoffer, Geigh, et autres
Publié: (2023)
From Observations to Events: Event-Aware World Model for Reinforcement Learning
par: Peng, Zhao-Han, et autres
Publié: (2026)
par: Peng, Zhao-Han, et autres
Publié: (2026)
World Models Unlock Optimal Foraging Strategies in Reinforcement Learning Agents
par: Fonseca, Yesid, et autres
Publié: (2025)
par: Fonseca, Yesid, et autres
Publié: (2025)
From Learning to Mastery: Achieving Safe and Efficient Real-World Autonomous Driving with Human-In-The-Loop Reinforcement Learning
par: Zeqiao, Li, et autres
Publié: (2025)
par: Zeqiao, Li, et autres
Publié: (2025)
Learning to Play Piano in the Real World
par: Zeulner, Yves-Simon, et autres
Publié: (2025)
par: Zeulner, Yves-Simon, et autres
Publié: (2025)
Documents similaires
-
Next Embedding Prediction Makes World Models Stronger
par: Bredis, George, et autres
Publié: (2026) -
F-GRPO: Don't Let Your Policy Learn the Obvious and Forget the Rare
par: Plyusov, Daniil, et autres
Publié: (2026) -
Steering LLM Reasoning Through Bias-Only Adaptation
par: Sinii, Viacheslav, et autres
Publié: (2025) -
In-Context Reinforcement Learning for Variable Action Spaces
par: Sinii, Viacheslav, et autres
Publié: (2023) -
Real-World Offline Reinforcement Learning from Vision Language Model Feedback
par: Venkataraman, Sreyas, et autres
Publié: (2024)