All Roads Lead to Likelihood: The Value of Reinforcement Learning in Fine-Tuning
Fuente:
arXiv
Guardado en:
| Autores principales: | Swamy, Gokul, Choudhury, Sanjiban, Sun, Wen, Wu, Zhiwei Steven, Bagnell, J. Andrew |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Inverse Reinforcement Learning without Reinforcement Learning
por: Swamy, Gokul, et al.
Publicado: (2023)
por: Swamy, Gokul, et al.
Publicado: (2023)
The Virtues of Pessimism in Inverse Reinforcement Learning
por: Wu, David, et al.
Publicado: (2024)
por: Wu, David, et al.
Publicado: (2024)
Hybrid Inverse Reinforcement Learning
por: Ren, Juntao, et al.
Publicado: (2024)
por: Ren, Juntao, et al.
Publicado: (2024)
Efficient Imitation under Misspecification
por: Espinosa-Dice, Nicolas, et al.
Publicado: (2025)
por: Espinosa-Dice, Nicolas, et al.
Publicado: (2025)
The Importance of Online Data: Understanding Preference Fine-tuning via Coverage
por: Song, Yuda, et al.
Publicado: (2024)
por: Song, Yuda, et al.
Publicado: (2024)
Multi-Agent Imitation Learning: Value is Easy, Regret is Hard
por: Tang, Jingwu, et al.
Publicado: (2024)
por: Tang, Jingwu, et al.
Publicado: (2024)
Accelerating Inverse Reinforcement Learning with Expert Bootstrapping
por: Wu, David, et al.
Publicado: (2024)
por: Wu, David, et al.
Publicado: (2024)
Back to Blackwell: Closing the Loop on Intransitivity in Multi-Objective Preference Fine-Tuning
por: Zhang, Jiahao, et al.
Publicado: (2026)
por: Zhang, Jiahao, et al.
Publicado: (2026)
A Minimaximalist Approach to Reinforcement Learning from Human Feedback
por: Swamy, Gokul, et al.
Publicado: (2024)
por: Swamy, Gokul, et al.
Publicado: (2024)
Process Reward Models for LLM Agents: Practical Framework and Directions
por: Choudhury, Sanjiban
Publicado: (2025)
por: Choudhury, Sanjiban
Publicado: (2025)
A Smooth Sea Never Made a Skilled SAILOR: Robust Imitation via Learning to Search
por: Jain, Arnav Kumar, et al.
Publicado: (2025)
por: Jain, Arnav Kumar, et al.
Publicado: (2025)
Aligning LLMs with Domain Invariant Reward Models
por: Wu, David, et al.
Publicado: (2025)
por: Wu, David, et al.
Publicado: (2025)
REBEL: Reinforcement Learning via Regressing Relative Rewards
por: Gao, Zhaolin, et al.
Publicado: (2024)
por: Gao, Zhaolin, et al.
Publicado: (2024)
Hybrid Reinforcement Learning from Offline Observation Alone
por: Song, Yuda, et al.
Publicado: (2024)
por: Song, Yuda, et al.
Publicado: (2024)
Gained in Translation: Privileged Pairwise Judges Enhance Multilingual Reasoning
por: Sutawika, Lintang, et al.
Publicado: (2026)
por: Sutawika, Lintang, et al.
Publicado: (2026)
Diffusing States and Matching Scores: A New Framework for Imitation Learning
por: Wu, Runzhe, et al.
Publicado: (2024)
por: Wu, Runzhe, et al.
Publicado: (2024)
To Distill or Decide? Understanding the Algorithmic Trade-off in Partially Observable Reinforcement Learning
por: Song, Yuda, et al.
Publicado: (2025)
por: Song, Yuda, et al.
Publicado: (2025)
Better than Your Teacher: LLM Agents that learn from Privileged AI Feedback
por: Choudhury, Sanjiban, et al.
Publicado: (2024)
por: Choudhury, Sanjiban, et al.
Publicado: (2024)
Imitation Learning from a Single Temporally Misaligned Video
por: Huey, William, et al.
Publicado: (2025)
por: Huey, William, et al.
Publicado: (2025)
Non-Adversarial Inverse Reinforcement Learning via Successor Feature Matching
por: Jain, Arnav Kumar, et al.
Publicado: (2024)
por: Jain, Arnav Kumar, et al.
Publicado: (2024)
From Foresight to Forethought: VLM-In-the-Loop Policy Steering via Latent Alignment
por: Wu, Yilin, et al.
Publicado: (2025)
por: Wu, Yilin, et al.
Publicado: (2025)
Expanding the Capabilities of Reinforcement Learning via Text Feedback
por: Song, Yuda, et al.
Publicado: (2026)
por: Song, Yuda, et al.
Publicado: (2026)
ASFT: Aligned Supervised Fine-Tuning through Absolute Likelihood
por: Wang, Ruoyu, et al.
Publicado: (2024)
por: Wang, Ruoyu, et al.
Publicado: (2024)
Distilling Realizable Students from Unrealizable Teachers
por: Kim, Yujin, et al.
Publicado: (2025)
por: Kim, Yujin, et al.
Publicado: (2025)
Supervised Fine-Tuning as Inverse Reinforcement Learning
por: Sun, Hao
Publicado: (2024)
por: Sun, Hao
Publicado: (2024)
Motion Tracks: A Unified Representation for Human-Robot Transfer in Few-Shot Imitation Learning
por: Ren, Juntao, et al.
Publicado: (2025)
por: Ren, Juntao, et al.
Publicado: (2025)
Fine-Tuning Flow Matching via Maximum Likelihood Estimation of Reconstructions
por: Li, Zhaoyi, et al.
Publicado: (2025)
por: Li, Zhaoyi, et al.
Publicado: (2025)
Maximum Likelihood Reinforcement Learning
por: Tajwar, Fahim, et al.
Publicado: (2026)
por: Tajwar, Fahim, et al.
Publicado: (2026)
Your Learned Constraint is Secretly a Backward Reachable Tube
por: Qadri, Mohamad, et al.
Publicado: (2025)
por: Qadri, Mohamad, et al.
Publicado: (2025)
InteRACT: Transformer Models for Human Intent Prediction Conditioned on Robot Actions
por: Kedia, Kushal, et al.
Publicado: (2023)
por: Kedia, Kushal, et al.
Publicado: (2023)
Imitation Learning via Focused Satisficing
por: Shah, Rushit N., et al.
Publicado: (2025)
por: Shah, Rushit N., et al.
Publicado: (2025)
Neural Likelihood Approximation for Integer Valued Time Series Data
por: O'Loughlin, Luke, et al.
Publicado: (2023)
por: O'Loughlin, Luke, et al.
Publicado: (2023)
Learning to Think: Information-Theoretic Reinforcement Fine-Tuning for LLMs
por: Wang, Jingyao, et al.
Publicado: (2025)
por: Wang, Jingyao, et al.
Publicado: (2025)
Reinforcement Fine-Tuning for History-Aware Dense Retriever in RAG
por: Zhang, Yicheng, et al.
Publicado: (2026)
por: Zhang, Yicheng, et al.
Publicado: (2026)
EvIL: Evolution Strategies for Generalisable Imitation Learning
por: Sapora, Silvia, et al.
Publicado: (2024)
por: Sapora, Silvia, et al.
Publicado: (2024)
Enhancing Reinforcement Learning Fine-Tuning with an Online Refiner
por: Ma, Hao, et al.
Publicado: (2026)
por: Ma, Hao, et al.
Publicado: (2026)
MARFT: Multi-Agent Reinforcement Fine-Tuning
por: Liao, Junwei, et al.
Publicado: (2025)
por: Liao, Junwei, et al.
Publicado: (2025)
Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward
por: Jia, Zhiwei, et al.
Publicado: (2024)
por: Jia, Zhiwei, et al.
Publicado: (2024)
One-Shot Imitation under Mismatched Execution
por: Kedia, Kushal, et al.
Publicado: (2024)
por: Kedia, Kushal, et al.
Publicado: (2024)
Expressive Value Learning for Scalable Offline Reinforcement Learning
por: Espinosa-Dice, Nicolas, et al.
Publicado: (2025)
por: Espinosa-Dice, Nicolas, et al.
Publicado: (2025)
Ejemplares similares
-
Inverse Reinforcement Learning without Reinforcement Learning
por: Swamy, Gokul, et al.
Publicado: (2023) -
The Virtues of Pessimism in Inverse Reinforcement Learning
por: Wu, David, et al.
Publicado: (2024) -
Hybrid Inverse Reinforcement Learning
por: Ren, Juntao, et al.
Publicado: (2024) -
Efficient Imitation under Misspecification
por: Espinosa-Dice, Nicolas, et al.
Publicado: (2025) -
The Importance of Online Data: Understanding Preference Fine-tuning via Coverage
por: Song, Yuda, et al.
Publicado: (2024)