Enhancing Vision-Language Model Training with Reinforcement Learning in Synthetic Worlds for Real-World Success
Fuente:
arXiv
Salvato in:
| Autori principali: | Bredis, George, Dereka, Stanislav, Sinii, Viacheslav, Rakhimov, Ruslan, Gavrilov, Daniil |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Next Embedding Prediction Makes World Models Stronger
di: Bredis, George, et al.
Pubblicazione: (2026)
di: Bredis, George, et al.
Pubblicazione: (2026)
F-GRPO: Don't Let Your Policy Learn the Obvious and Forget the Rare
di: Plyusov, Daniil, et al.
Pubblicazione: (2026)
di: Plyusov, Daniil, et al.
Pubblicazione: (2026)
Steering LLM Reasoning Through Bias-Only Adaptation
di: Sinii, Viacheslav, et al.
Pubblicazione: (2025)
di: Sinii, Viacheslav, et al.
Pubblicazione: (2025)
In-Context Reinforcement Learning for Variable Action Spaces
di: Sinii, Viacheslav, et al.
Pubblicazione: (2023)
di: Sinii, Viacheslav, et al.
Pubblicazione: (2023)
Real-World Offline Reinforcement Learning from Vision Language Model Feedback
di: Venkataraman, Sreyas, et al.
Pubblicazione: (2024)
di: Venkataraman, Sreyas, et al.
Pubblicazione: (2024)
RLVR-World: Training World Models with Reinforcement Learning
di: Wu, Jialong, et al.
Pubblicazione: (2025)
di: Wu, Jialong, et al.
Pubblicazione: (2025)
ESSA: Evolutionary Strategies for Scalable Alignment
di: Korotyshova, Daria, et al.
Pubblicazione: (2025)
di: Korotyshova, Daria, et al.
Pubblicazione: (2025)
The Differences Between Direct Alignment Algorithms are a Blur
di: Gorbatovski, Alexey, et al.
Pubblicazione: (2025)
di: Gorbatovski, Alexey, et al.
Pubblicazione: (2025)
You Do Not Fully Utilize Transformer's Representation Capacity
di: Gerasimov, Gleb, et al.
Pubblicazione: (2025)
di: Gerasimov, Gleb, et al.
Pubblicazione: (2025)
Identity Curvature Laplace Approximation for Improved Out-of-Distribution Detection
di: Zhdanov, Maksim, et al.
Pubblicazione: (2023)
di: Zhdanov, Maksim, et al.
Pubblicazione: (2023)
Diversifying Deep Ensembles: A Saliency Map Approach for Enhanced OOD Detection, Calibration, and Accuracy
di: Dereka, Stanislav, et al.
Pubblicazione: (2023)
di: Dereka, Stanislav, et al.
Pubblicazione: (2023)
Train One Sparse Autoencoder Across Multiple Sparsity Budgets to Preserve Interpretability and Accuracy
di: Balagansky, Nikita, et al.
Pubblicazione: (2025)
di: Balagansky, Nikita, et al.
Pubblicazione: (2025)
Towards Autonomous Reinforcement Learning for Real-World Robotic Manipulation with Large Language Models
di: Turcato, Niccolò, et al.
Pubblicazione: (2025)
di: Turcato, Niccolò, et al.
Pubblicazione: (2025)
Safe Reinforcement Learning for Real-World Engine Control
di: Bedei, Julian, et al.
Pubblicazione: (2025)
di: Bedei, Julian, et al.
Pubblicazione: (2025)
Agent World Model: Infinity Synthetic Environments for Agentic Reinforcement Learning
di: Wang, Zhaoyang, et al.
Pubblicazione: (2026)
di: Wang, Zhaoyang, et al.
Pubblicazione: (2026)
Real-World Reinforcement Learning of Active Perception Behaviors
di: Hu, Edward S., et al.
Pubblicazione: (2025)
di: Hu, Edward S., et al.
Pubblicazione: (2025)
FutureWorld: A Live Reinforcement Learning Environment for Predictive Agents with Real-World Outcome Rewards
di: Han, Zhixin, et al.
Pubblicazione: (2026)
di: Han, Zhixin, et al.
Pubblicazione: (2026)
Transfer Learning of Surrogate Models via Domain Affine Transformation Across Synthetic and Real-World Benchmarks
di: Pan, Shuaiqun, et al.
Pubblicazione: (2025)
di: Pan, Shuaiqun, et al.
Pubblicazione: (2025)
One-shot World Models Using a Transformer Trained on a Synthetic Prior
di: Ferreira, Fabio, et al.
Pubblicazione: (2024)
di: Ferreira, Fabio, et al.
Pubblicazione: (2024)
Policy and World Modeling Co-Training for Language Agents
di: Lu, Ning, et al.
Pubblicazione: (2026)
di: Lu, Ning, et al.
Pubblicazione: (2026)
Agentic Reinforcement Learning for Real-World Code Repair
di: Zhu, Siyu, et al.
Pubblicazione: (2025)
di: Zhu, Siyu, et al.
Pubblicazione: (2025)
A Production Scheduling Framework for Reinforcement Learning Under Real-World Constraints
di: Hoss, Jonathan, et al.
Pubblicazione: (2025)
di: Hoss, Jonathan, et al.
Pubblicazione: (2025)
Towards Large-Scale In-Context Reinforcement Learning by Meta-Training in Randomized Worlds
di: Wang, Fan, et al.
Pubblicazione: (2025)
di: Wang, Fan, et al.
Pubblicazione: (2025)
In-Context Reinforcement Learning via Communicative World Models
di: Martinez-Lopez, Fernando, et al.
Pubblicazione: (2025)
di: Martinez-Lopez, Fernando, et al.
Pubblicazione: (2025)
Continual Reinforcement Learning by Planning with Online World Models
di: Liu, Zichen, et al.
Pubblicazione: (2025)
di: Liu, Zichen, et al.
Pubblicazione: (2025)
Trust-Region Behavior Blending for On-Policy Distillation
di: Plyusov, Daniil, et al.
Pubblicazione: (2026)
di: Plyusov, Daniil, et al.
Pubblicazione: (2026)
RL-100: Performant Robotic Manipulation with Real-World Reinforcement Learning
di: Lei, Kun, et al.
Pubblicazione: (2025)
di: Lei, Kun, et al.
Pubblicazione: (2025)
Gym4ReaL: A Suite for Benchmarking Real-World Reinforcement Learning
di: Salaorni, Davide, et al.
Pubblicazione: (2025)
di: Salaorni, Davide, et al.
Pubblicazione: (2025)
Learning Abstract World Model for Value-preserving Planning with Options
di: Rodriguez-Sanchez, Rafael, et al.
Pubblicazione: (2024)
di: Rodriguez-Sanchez, Rafael, et al.
Pubblicazione: (2024)
Object-Centric World Models for Causality-Aware Reinforcement Learning
di: Nishimoto, Yosuke, et al.
Pubblicazione: (2025)
di: Nishimoto, Yosuke, et al.
Pubblicazione: (2025)
Reinforcement Learning from Delayed Observations via World Models
di: Karamzade, Armin, et al.
Pubblicazione: (2024)
di: Karamzade, Armin, et al.
Pubblicazione: (2024)
Teach Old SAEs New Domain Tricks with Boosting
di: Koriagin, Nikita, et al.
Pubblicazione: (2025)
di: Koriagin, Nikita, et al.
Pubblicazione: (2025)
Uncertainty-Aware Robotic World Model Makes Offline Model-Based Reinforcement Learning Work on Real Robots
di: Li, Chenhao, et al.
Pubblicazione: (2025)
di: Li, Chenhao, et al.
Pubblicazione: (2025)
The Pump Scheduling Problem: A Real-World Scenario for Reinforcement Learning
di: Donâncio, Henrique, et al.
Pubblicazione: (2022)
di: Donâncio, Henrique, et al.
Pubblicazione: (2022)
Learning to Model the World with Language
di: Lin, Jessy, et al.
Pubblicazione: (2023)
di: Lin, Jessy, et al.
Pubblicazione: (2023)
Novelty Detection in Reinforcement Learning with World Models
di: Zollicoffer, Geigh, et al.
Pubblicazione: (2023)
di: Zollicoffer, Geigh, et al.
Pubblicazione: (2023)
From Observations to Events: Event-Aware World Model for Reinforcement Learning
di: Peng, Zhao-Han, et al.
Pubblicazione: (2026)
di: Peng, Zhao-Han, et al.
Pubblicazione: (2026)
World Models Unlock Optimal Foraging Strategies in Reinforcement Learning Agents
di: Fonseca, Yesid, et al.
Pubblicazione: (2025)
di: Fonseca, Yesid, et al.
Pubblicazione: (2025)
From Learning to Mastery: Achieving Safe and Efficient Real-World Autonomous Driving with Human-In-The-Loop Reinforcement Learning
di: Zeqiao, Li, et al.
Pubblicazione: (2025)
di: Zeqiao, Li, et al.
Pubblicazione: (2025)
Learning to Play Piano in the Real World
di: Zeulner, Yves-Simon, et al.
Pubblicazione: (2025)
di: Zeulner, Yves-Simon, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Next Embedding Prediction Makes World Models Stronger
di: Bredis, George, et al.
Pubblicazione: (2026) -
F-GRPO: Don't Let Your Policy Learn the Obvious and Forget the Rare
di: Plyusov, Daniil, et al.
Pubblicazione: (2026) -
Steering LLM Reasoning Through Bias-Only Adaptation
di: Sinii, Viacheslav, et al.
Pubblicazione: (2025) -
In-Context Reinforcement Learning for Variable Action Spaces
di: Sinii, Viacheslav, et al.
Pubblicazione: (2023) -
Real-World Offline Reinforcement Learning from Vision Language Model Feedback
di: Venkataraman, Sreyas, et al.
Pubblicazione: (2024)