Salvato in:
| Autori principali: | Rybkin, Oleh, Nauman, Michal, Fu, Preston, Snell, Charlie, Abbeel, Pieter, Levine, Sergey, Kumar, Aviral |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2502.04327 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Compute-Optimal Scaling for Value-Based Deep RL
di: Fu, Preston, et al.
Pubblicazione: (2025)
di: Fu, Preston, et al.
Pubblicazione: (2025)
Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners
di: Nauman, Michal, et al.
Pubblicazione: (2025)
di: Nauman, Michal, et al.
Pubblicazione: (2025)
METRA: Scalable Unsupervised RL with Metric-Aware Abstraction
di: Park, Seohong, et al.
Pubblicazione: (2023)
di: Park, Seohong, et al.
Pubblicazione: (2023)
floq: Training Critics via Flow-Matching for Scaling Compute in Value-Based RL
di: Agrawalla, Bhavya, et al.
Pubblicazione: (2025)
di: Agrawalla, Bhavya, et al.
Pubblicazione: (2025)
Is Value Learning Really the Main Bottleneck in Offline RL?
di: Park, Seohong, et al.
Pubblicazione: (2024)
di: Park, Seohong, et al.
Pubblicazione: (2024)
Video2Policy: Scaling up Manipulation Tasks in Simulation through Internet Videos
di: Ye, Weirui, et al.
Pubblicazione: (2025)
di: Ye, Weirui, et al.
Pubblicazione: (2025)
Reward-Conditioned Reinforcement Learning
di: Nauman, Michal, et al.
Pubblicazione: (2026)
di: Nauman, Michal, et al.
Pubblicazione: (2026)
Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters
di: Snell, Charlie, et al.
Pubblicazione: (2024)
di: Snell, Charlie, et al.
Pubblicazione: (2024)
Scaling Test-Time Compute Without Verification or RL is Suboptimal
di: Setlur, Amrith, et al.
Pubblicazione: (2025)
di: Setlur, Amrith, et al.
Pubblicazione: (2025)
Predicting Emergent Capabilities by Finetuning
di: Snell, Charlie, et al.
Pubblicazione: (2024)
di: Snell, Charlie, et al.
Pubblicazione: (2024)
A Stable Whitening Optimizer for Efficient Neural Network Training
di: Frans, Kevin, et al.
Pubblicazione: (2025)
di: Frans, Kevin, et al.
Pubblicazione: (2025)
What Really Matters in Matrix-Whitening Optimizers?
di: Frans, Kevin, et al.
Pubblicazione: (2025)
di: Frans, Kevin, et al.
Pubblicazione: (2025)
Cliqueformer: Model-Based Optimization with Structured Transformers
di: Kuba, Jakub Grudzien, et al.
Pubblicazione: (2024)
di: Kuba, Jakub Grudzien, et al.
Pubblicazione: (2024)
What Does Flow Matching Bring To TD Learning?
di: Agrawalla, Bhavya, et al.
Pubblicazione: (2026)
di: Agrawalla, Bhavya, et al.
Pubblicazione: (2026)
Steering Your Generalists: Improving Robotic Foundation Models via Value Guidance
di: Nakamoto, Mitsuhiko, et al.
Pubblicazione: (2024)
di: Nakamoto, Mitsuhiko, et al.
Pubblicazione: (2024)
When Does Non-Uniform Replay Matter in Reinforcement Learning?
di: Korniak, Michal, et al.
Pubblicazione: (2026)
di: Korniak, Michal, et al.
Pubblicazione: (2026)
Diffusion Guidance Is a Controllable Policy Improvement Operator
di: Frans, Kevin, et al.
Pubblicazione: (2025)
di: Frans, Kevin, et al.
Pubblicazione: (2025)
Unsupervised Zero-Shot Reinforcement Learning via Functional Reward Encodings
di: Frans, Kevin, et al.
Pubblicazione: (2024)
di: Frans, Kevin, et al.
Pubblicazione: (2024)
Horizon Reduction Makes RL Scalable
di: Park, Seohong, et al.
Pubblicazione: (2025)
di: Park, Seohong, et al.
Pubblicazione: (2025)
ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL
di: Zhou, Yifei, et al.
Pubblicazione: (2024)
di: Zhou, Yifei, et al.
Pubblicazione: (2024)
One Step Diffusion via Shortcut Models
di: Frans, Kevin, et al.
Pubblicazione: (2024)
di: Frans, Kevin, et al.
Pubblicazione: (2024)
Functional Graphical Models: Structure Enables Offline Data-Driven Optimization
di: Kuba, Jakub Grudzien, et al.
Pubblicazione: (2024)
di: Kuba, Jakub Grudzien, et al.
Pubblicazione: (2024)
Digi-Q: Learning Q-Value Functions for Training Device-Control Agents
di: Bai, Hao, et al.
Pubblicazione: (2025)
di: Bai, Hao, et al.
Pubblicazione: (2025)
Stop Regressing: Training Value Functions via Classification for Scalable Deep RL
di: Farebrother, Jesse, et al.
Pubblicazione: (2024)
di: Farebrother, Jesse, et al.
Pubblicazione: (2024)
DigiRL: Training In-The-Wild Device-Control Agents with Autonomous Reinforcement Learning
di: Bai, Hao, et al.
Pubblicazione: (2024)
di: Bai, Hao, et al.
Pubblicazione: (2024)
Prioritized Generative Replay
di: Wang, Renhao, et al.
Pubblicazione: (2024)
di: Wang, Renhao, et al.
Pubblicazione: (2024)
FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control
di: Seo, Younggyo, et al.
Pubblicazione: (2025)
di: Seo, Younggyo, et al.
Pubblicazione: (2025)
SOMBRL: Scalable and Optimistic Model-Based RL
di: Sukhija, Bhavya, et al.
Pubblicazione: (2025)
di: Sukhija, Bhavya, et al.
Pubblicazione: (2025)
Transitive RL: Value Learning via Divide and Conquer
di: Park, Seohong, et al.
Pubblicazione: (2025)
di: Park, Seohong, et al.
Pubblicazione: (2025)
Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data
di: Zhou, Zhiyuan, et al.
Pubblicazione: (2024)
di: Zhou, Zhiyuan, et al.
Pubblicazione: (2024)
Vision-Language Models Provide Promptable Representations for Reinforcement Learning
di: Chen, William, et al.
Pubblicazione: (2024)
di: Chen, William, et al.
Pubblicazione: (2024)
Privileged Sensing Scaffolds Reinforcement Learning
di: Hu, Edward S., et al.
Pubblicazione: (2024)
di: Hu, Edward S., et al.
Pubblicazione: (2024)
D5RL: Diverse Datasets for Data-Driven Deep Reinforcement Learning
di: Rafailov, Rafael, et al.
Pubblicazione: (2024)
di: Rafailov, Rafael, et al.
Pubblicazione: (2024)
Cal-QL: Calibrated Offline RL Pre-Training for Efficient Online Fine-Tuning
di: Nakamoto, Mitsuhiko, et al.
Pubblicazione: (2023)
di: Nakamoto, Mitsuhiko, et al.
Pubblicazione: (2023)
ViVa: Video-Trained Value Functions for Guiding Online RL from Diverse Data
di: Dashora, Nitish, et al.
Pubblicazione: (2025)
di: Dashora, Nitish, et al.
Pubblicazione: (2025)
RLAC: Reinforcement Learning with Adversarial Critic for Free-Form Generation Tasks
di: Wu, Mian, et al.
Pubblicazione: (2025)
di: Wu, Mian, et al.
Pubblicazione: (2025)
Unfamiliar Finetuning Examples Control How Language Models Hallucinate
di: Kang, Katie, et al.
Pubblicazione: (2024)
di: Kang, Katie, et al.
Pubblicazione: (2024)
Accelerating Reinforcement Learning with Value-Conditional State Entropy Exploration
di: Kim, Dongyoung, et al.
Pubblicazione: (2023)
di: Kim, Dongyoung, et al.
Pubblicazione: (2023)
Relative Entropy Pathwise Policy Optimization
di: Voelcker, Claas, et al.
Pubblicazione: (2025)
di: Voelcker, Claas, et al.
Pubblicazione: (2025)
e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs
di: Setlur, Amrith, et al.
Pubblicazione: (2025)
di: Setlur, Amrith, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Compute-Optimal Scaling for Value-Based Deep RL
di: Fu, Preston, et al.
Pubblicazione: (2025) -
Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners
di: Nauman, Michal, et al.
Pubblicazione: (2025) -
METRA: Scalable Unsupervised RL with Metric-Aware Abstraction
di: Park, Seohong, et al.
Pubblicazione: (2023) -
floq: Training Critics via Flow-Matching for Scaling Compute in Value-Based RL
di: Agrawalla, Bhavya, et al.
Pubblicazione: (2025) -
Is Value Learning Really the Main Bottleneck in Offline RL?
di: Park, Seohong, et al.
Pubblicazione: (2024)