Maximum Likelihood Reinforcement Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Tajwar, Fahim, Zeng, Guanning, Zhou, Yueer, Song, Yuda, Arora, Daman, Jiang, Yiding, Schneider, Jeff, Salakhutdinov, Ruslan, Feng, Haiwen, Zanette, Andrea |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Shrinking the Variance: Shrinkage Baselines for Reinforcement Learning with Verifiable Rewards
di: Zeng, Guanning, et al.
Pubblicazione: (2025)
di: Zeng, Guanning, et al.
Pubblicazione: (2025)
Can Large Reasoning Models Self-Train?
di: Shafayat, Sheikh, et al.
Pubblicazione: (2025)
di: Shafayat, Sheikh, et al.
Pubblicazione: (2025)
Training Language Models to Reason Efficiently
di: Arora, Daman, et al.
Pubblicazione: (2025)
di: Arora, Daman, et al.
Pubblicazione: (2025)
Training a Generally Curious Agent
di: Tajwar, Fahim, et al.
Pubblicazione: (2025)
di: Tajwar, Fahim, et al.
Pubblicazione: (2025)
State Combinatorial Generalization In Decision Making With Conditional Diffusion Models
di: Duan, Xintong, et al.
Pubblicazione: (2025)
di: Duan, Xintong, et al.
Pubblicazione: (2025)
Accelerating Diffusion Planners in Offline RL via Reward-Aware Consistency Trajectory Distillation
di: Duan, Xintong, et al.
Pubblicazione: (2025)
di: Duan, Xintong, et al.
Pubblicazione: (2025)
SPEED-RL: Faster Training of Reasoning Models via Online Curriculum Learning
di: Zhang, Ruiqi, et al.
Pubblicazione: (2025)
di: Zhang, Ruiqi, et al.
Pubblicazione: (2025)
Expanding the Capabilities of Reinforcement Learning via Text Feedback
di: Song, Yuda, et al.
Pubblicazione: (2026)
di: Song, Yuda, et al.
Pubblicazione: (2026)
Retrospective In-Context Learning for Temporal Credit Assignment with Large Language Models
di: Chen, Wen-Tse, et al.
Pubblicazione: (2026)
di: Chen, Wen-Tse, et al.
Pubblicazione: (2026)
Accelerating Unbiased LLM Evaluation via Synthetic Feedback
di: Zhou, Zhaoyi, et al.
Pubblicazione: (2025)
di: Zhou, Zhaoyi, et al.
Pubblicazione: (2025)
Self-Regulation and Requesting Interventions
di: Min, So Yeon, et al.
Pubblicazione: (2025)
di: Min, So Yeon, et al.
Pubblicazione: (2025)
Splats under Pressure: Exploring Performance-Energy Trade-offs in Real-Time 3D Gaussian Splatting under Constrained GPU Budgets
di: Tajwar, Muhammad Fahim, et al.
Pubblicazione: (2026)
di: Tajwar, Muhammad Fahim, et al.
Pubblicazione: (2026)
Instance-Dependent Continuous-Time Reinforcement Learning via Maximum Likelihood Estimation
di: Zhao, Runze, et al.
Pubblicazione: (2025)
di: Zhao, Runze, et al.
Pubblicazione: (2025)
Reasoning as an Adaptive Defense for Safety
di: Kim, Taeyoun, et al.
Pubblicazione: (2025)
di: Kim, Taeyoun, et al.
Pubblicazione: (2025)
Contrastive Difference Predictive Coding
di: Zheng, Chongyi, et al.
Pubblicazione: (2023)
di: Zheng, Chongyi, et al.
Pubblicazione: (2023)
Resolving Conflicts in Lifelong Learning via Aligning Updates in Subspaces
di: Zhou, Yueer, et al.
Pubblicazione: (2025)
di: Zhou, Yueer, et al.
Pubblicazione: (2025)
Preference Fine-Tuning of LLMs Should Leverage Suboptimal, On-Policy Data
di: Tajwar, Fahim, et al.
Pubblicazione: (2024)
di: Tajwar, Fahim, et al.
Pubblicazione: (2024)
Joint Distillation for Fast Likelihood Evaluation and Sampling in Flow-based Models
di: Ai, Xinyue, et al.
Pubblicazione: (2025)
di: Ai, Xinyue, et al.
Pubblicazione: (2025)
When Demonstrations Meet Generative World Models: A Maximum Likelihood Framework for Offline Inverse Reinforcement Learning
di: Zeng, Siliang, et al.
Pubblicazione: (2023)
di: Zeng, Siliang, et al.
Pubblicazione: (2023)
Hybrid Reinforcement Learning from Offline Observation Alone
di: Song, Yuda, et al.
Pubblicazione: (2024)
di: Song, Yuda, et al.
Pubblicazione: (2024)
Response to Promises and Pitfalls of Deep Kernel Learning
di: Wilson, Andrew Gordon, et al.
Pubblicazione: (2025)
di: Wilson, Andrew Gordon, et al.
Pubblicazione: (2025)
Plan-Seq-Learn: Language Model Guided RL for Solving Long Horizon Robotics Tasks
di: Dalal, Murtaza, et al.
Pubblicazione: (2024)
di: Dalal, Murtaza, et al.
Pubblicazione: (2024)
Inference via Interpolation: Contrastive Representations Provably Enable Planning and Inference
di: Eysenbach, Benjamin, et al.
Pubblicazione: (2024)
di: Eysenbach, Benjamin, et al.
Pubblicazione: (2024)
Multi-Agent Computer Use
di: Koh, Jing Yu, et al.
Pubblicazione: (2026)
di: Koh, Jing Yu, et al.
Pubblicazione: (2026)
InSTA: Towards Internet-Scale Training For Agents
di: Trabucco, Brandon, et al.
Pubblicazione: (2025)
di: Trabucco, Brandon, et al.
Pubblicazione: (2025)
ME-IGM: Individual-Global-Max in Maximum Entropy Multi-Agent Reinforcement Learning
di: Chen, Wen-Tse, et al.
Pubblicazione: (2024)
di: Chen, Wen-Tse, et al.
Pubblicazione: (2024)
Rich-Observation Reinforcement Learning with Continuous Latent Dynamics
di: Song, Yuda, et al.
Pubblicazione: (2024)
di: Song, Yuda, et al.
Pubblicazione: (2024)
POPE: Learning to Reason on Hard Problems via Privileged On-Policy Exploration
di: Qu, Yuxiao, et al.
Pubblicazione: (2026)
di: Qu, Yuxiao, et al.
Pubblicazione: (2026)
RL2ML: Finite-Rollout Surrogate Objectives from Reinforcement Learning to Maximum Likelihood
di: Zheng, Yifu
Pubblicazione: (2026)
di: Zheng, Yifu
Pubblicazione: (2026)
Hardness of Maximum Likelihood Learning of DPPs
di: Grigorescu, Elena, et al.
Pubblicazione: (2022)
di: Grigorescu, Elena, et al.
Pubblicazione: (2022)
On Learning-Curve Monotonicity for Maximum Likelihood Estimators
di: Sellke, Mark, et al.
Pubblicazione: (2025)
di: Sellke, Mark, et al.
Pubblicazione: (2025)
Momentum Particle Maximum Likelihood
di: Lim, Jen Ning, et al.
Pubblicazione: (2023)
di: Lim, Jen Ning, et al.
Pubblicazione: (2023)
Dependency-aware Maximum Likelihood Estimation for Active Learning
di: Kalkanli, Beyza, et al.
Pubblicazione: (2025)
di: Kalkanli, Beyza, et al.
Pubblicazione: (2025)
Maximum Likelihood Learning of Latent Dynamics Without Reconstruction
di: Hromadka, Samo, et al.
Pubblicazione: (2025)
di: Hromadka, Samo, et al.
Pubblicazione: (2025)
Understanding Visual Concepts Across Models
di: Trabucco, Brandon, et al.
Pubblicazione: (2024)
di: Trabucco, Brandon, et al.
Pubblicazione: (2024)
To Distill or Decide? Understanding the Algorithmic Trade-off in Partially Observable Reinforcement Learning
di: Song, Yuda, et al.
Pubblicazione: (2025)
di: Song, Yuda, et al.
Pubblicazione: (2025)
Conservative Prediction via Data-Driven Confidence Minimization
di: Choi, Caroline, et al.
Pubblicazione: (2023)
di: Choi, Caroline, et al.
Pubblicazione: (2023)
Differential Smoothing Mitigates Sharpening and Improves LLM Reasoning
di: Gai, Jingchu, et al.
Pubblicazione: (2025)
di: Gai, Jingchu, et al.
Pubblicazione: (2025)
BiCQL-ML: A Bi-Level Conservative Q-Learning Framework for Maximum Likelihood Inverse Reinforcement Learning
di: Park, Junsung
Pubblicazione: (2025)
di: Park, Junsung
Pubblicazione: (2025)
Odysseys: Benchmarking Web Agents on Realistic Long Horizon Tasks
di: Jang, Lawrence Keunho, et al.
Pubblicazione: (2026)
di: Jang, Lawrence Keunho, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Shrinking the Variance: Shrinkage Baselines for Reinforcement Learning with Verifiable Rewards
di: Zeng, Guanning, et al.
Pubblicazione: (2025) -
Can Large Reasoning Models Self-Train?
di: Shafayat, Sheikh, et al.
Pubblicazione: (2025) -
Training Language Models to Reason Efficiently
di: Arora, Daman, et al.
Pubblicazione: (2025) -
Training a Generally Curious Agent
di: Tajwar, Fahim, et al.
Pubblicazione: (2025) -
State Combinatorial Generalization In Decision Making With Conditional Diffusion Models
di: Duan, Xintong, et al.
Pubblicazione: (2025)