Multi-Step Likelihood-Ratio Correction for Reinforcement Learning with Verifiable Rewards
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yoon, Deokgyu, Kang, Hyungkyu, Lee, Joongkyu, Kim, Byeongchan, Shin, Gyungin, Park, Sungrae, Oh, Min-hwan |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Latent Representation Alignment for Offline Goal-Conditioned Reinforcement Learning
par: Kang, Hyungkyu, et autres
Publié: (2026)
par: Kang, Hyungkyu, et autres
Publié: (2026)
Adversarial Policy Optimization for Offline Preference-based Reinforcement Learning
par: Kang, Hyungkyu, et autres
Publié: (2025)
par: Kang, Hyungkyu, et autres
Publié: (2025)
Combinatorial Reinforcement Learning with Preference Feedback
par: Lee, Joongkyu, et autres
Publié: (2025)
par: Lee, Joongkyu, et autres
Publié: (2025)
Preference-based Reinforcement Learning beyond Pairwise Comparisons: Benefits of Multiple Options
par: Lee, Joongkyu, et autres
Publié: (2025)
par: Lee, Joongkyu, et autres
Publié: (2025)
Peng's Q($λ$) for Conservative Value Estimation in Offline Reinforcement Learning
par: Kim, Byeongchan, et autres
Publié: (2026)
par: Kim, Byeongchan, et autres
Publié: (2026)
Demystifying Linear MDPs and Novel Dynamics Aggregation Framework
par: Lee, Joongkyu, et autres
Publié: (2024)
par: Lee, Joongkyu, et autres
Publié: (2024)
Improved Online Confidence Bounds for Multinomial Logistic Bandits
par: Lee, Joongkyu, et autres
Publié: (2025)
par: Lee, Joongkyu, et autres
Publié: (2025)
Optimal Design for Multinomial Logit Model with Applications to Best Assortment Identification
par: Lee, Joongkyu, et autres
Publié: (2026)
par: Lee, Joongkyu, et autres
Publié: (2026)
Nonstationary Generalized Linear Bandits with Discounted Online Mirror Descent
par: Lee, Joongkyu, et autres
Publié: (2026)
par: Lee, Joongkyu, et autres
Publié: (2026)
Nearly Minimax Optimal Regret for Multinomial Logistic Bandit
par: Lee, Joongkyu, et autres
Publié: (2024)
par: Lee, Joongkyu, et autres
Publié: (2024)
Randomized Exploration for Reinforcement Learning with Multinomial Logistic Function Approximation
par: Cho, Wooseong, et autres
Publié: (2024)
par: Cho, Wooseong, et autres
Publié: (2024)
Learning Uncertainty-Aware Temporally-Extended Actions
par: Lee, Joongkyu, et autres
Publié: (2024)
par: Lee, Joongkyu, et autres
Publié: (2024)
Unified Framework of Distributional Regret in Multi-Armed Bandits and Reinforcement Learning
par: Lee, Harin, et autres
Publié: (2026)
par: Lee, Harin, et autres
Publié: (2026)
ProMerge: Prompt and Merge for Unsupervised Instance Segmentation
par: Li, Dylan, et autres
Publié: (2024)
par: Li, Dylan, et autres
Publié: (2024)
Minimax Optimal Reinforcement Learning with Quasi-Optimism
par: Lee, Harin, et autres
Publié: (2025)
par: Lee, Harin, et autres
Publié: (2025)
Peri-LN: Revisiting Normalization Layer in the Transformer Architecture
par: Kim, Jeonghoon, et autres
Publié: (2025)
par: Kim, Jeonghoon, et autres
Publié: (2025)
Stage-Wise Reward Shaping for Acrobatic Robots: A Constrained Multi-Objective Reinforcement Learning Approach
par: Kim, Dohyeong, et autres
Publié: (2024)
par: Kim, Dohyeong, et autres
Publié: (2024)
Efficient LLM Collaboration via Planning
par: Lee, Byeongchan, et autres
Publié: (2025)
par: Lee, Byeongchan, et autres
Publié: (2025)
Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs
par: Wen, Xumeng, et autres
Publié: (2025)
par: Wen, Xumeng, et autres
Publié: (2025)
RelFlexformer: Efficient Attention 3D-Transformers for Integrable Relative Positional Encodings
par: Kim, Byeongchan, et autres
Publié: (2026)
par: Kim, Byeongchan, et autres
Publié: (2026)
Implicit Contrastive Representation Learning with Guided Stop-gradient
par: Lee, Byeongchan, et autres
Publié: (2025)
par: Lee, Byeongchan, et autres
Publié: (2025)
Penalizing Infeasible Actions and Reward Scaling in Reinforcement Learning with Offline Data
par: Kim, Jeonghye, et autres
Publié: (2025)
par: Kim, Jeonghye, et autres
Publié: (2025)
FAST-DIPS: Adjoint-Free Analytic Steps and Hard-Constrained Likelihood Correction for Diffusion-Prior Inverse Problems
par: Kim, Minwoo, et autres
Publié: (2026)
par: Kim, Minwoo, et autres
Publié: (2026)
Model-Based Reinforcement Learning with Multinomial Logistic Function Approximation
par: Hwang, Taehyun, et autres
Publié: (2022)
par: Hwang, Taehyun, et autres
Publié: (2022)
Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers
par: Cai, Xin-Qiang, et autres
Publié: (2025)
par: Cai, Xin-Qiang, et autres
Publié: (2025)
Quality-Aware Exploration Budget Allocation for Cooperative Multi-Agent Reinforcement Learning
par: Oh, Dahyun, et autres
Publié: (2026)
par: Oh, Dahyun, et autres
Publié: (2026)
No Verifiable Reward for Prosody: Toward Preference-Guided Prosody Learning in TTS
par: Shin, Seungyoun, et autres
Publié: (2025)
par: Shin, Seungyoun, et autres
Publié: (2025)
EUGens: Efficient, Unified, and General Dense Layers
par: Kim, Sang Min, et autres
Publié: (2026)
par: Kim, Sang Min, et autres
Publié: (2026)
RLVER: Reinforcement Learning with Verifiable Emotion Rewards for Empathetic Agents
par: Wang, Peisong, et autres
Publié: (2025)
par: Wang, Peisong, et autres
Publié: (2025)
Do LLMs Need Inherent Reasoning Before Reinforcement Learning? A Study in Korean Self-Correction
par: Kim, Hongjin, et autres
Publié: (2026)
par: Kim, Hongjin, et autres
Publié: (2026)
Trust, But Verify: A Self-Verification Approach to Reinforcement Learning with Verifiable Rewards
par: Liu, Xiaoyuan, et autres
Publié: (2025)
par: Liu, Xiaoyuan, et autres
Publié: (2025)
Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards
par: Lu, Xiaodong, et autres
Publié: (2026)
par: Lu, Xiaodong, et autres
Publié: (2026)
PerMix-RLVR: Preserving Persona Expressivity under Verifiable-Reward Alignment
par: Oh, Jihwan, et autres
Publié: (2026)
par: Oh, Jihwan, et autres
Publié: (2026)
Unveiling the Significance of Toddler-Inspired Reward Transition in Goal-Oriented Reinforcement Learning
par: Park, Junseok, et autres
Publié: (2024)
par: Park, Junseok, et autres
Publié: (2024)
Auditing Data Membership in Reinforcement Learning With Verifiable Rewards
par: Liu, Yule, et autres
Publié: (2025)
par: Liu, Yule, et autres
Publié: (2025)
Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains
par: Gunjal, Anisha, et autres
Publié: (2025)
par: Gunjal, Anisha, et autres
Publié: (2025)
EUGens: Efficient, Unified, and General Dense Layers
par: Kim, Sang Min, et autres
Publié: (2024)
par: Kim, Sang Min, et autres
Publié: (2024)
Decoupling Reasoning and Confidence: Resurrecting Calibration in Reinforcement Learning from Verifiable Rewards
par: Ma, Zhengzhao, et autres
Publié: (2026)
par: Ma, Zhengzhao, et autres
Publié: (2026)
Rewarding What Matters: Step-by-Step Reinforcement Learning for Task-Oriented Dialogue
par: Du, Huifang, et autres
Publié: (2024)
par: Du, Huifang, et autres
Publié: (2024)
RLNVR: Reinforcement Learning from Non-Verified Real-World Rewards
par: Krishnan, Rohit, et autres
Publié: (2025)
par: Krishnan, Rohit, et autres
Publié: (2025)
Documents similaires
-
Latent Representation Alignment for Offline Goal-Conditioned Reinforcement Learning
par: Kang, Hyungkyu, et autres
Publié: (2026) -
Adversarial Policy Optimization for Offline Preference-based Reinforcement Learning
par: Kang, Hyungkyu, et autres
Publié: (2025) -
Combinatorial Reinforcement Learning with Preference Feedback
par: Lee, Joongkyu, et autres
Publié: (2025) -
Preference-based Reinforcement Learning beyond Pairwise Comparisons: Benefits of Multiple Options
par: Lee, Joongkyu, et autres
Publié: (2025) -
Peng's Q($λ$) for Conservative Value Estimation in Offline Reinforcement Learning
par: Kim, Byeongchan, et autres
Publié: (2026)