Reducing Reward Dependence in RL Through Adaptive Confidence Discounting
Fuente:
arXiv
Salvato in:
| Autori principali: | Satici, Muhammed Yusuf, Roberts, David L. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Autonomous Curriculum Design via Relative Entropy Based Task Modifications
di: Satici, Muhammed Yusuf, et al.
Pubblicazione: (2025)
di: Satici, Muhammed Yusuf, et al.
Pubblicazione: (2025)
Reducing Blackwell and Average Optimality to Discounted MDPs via the Blackwell Discount Factor
di: Grand-Clément, Julien, et al.
Pubblicazione: (2023)
di: Grand-Clément, Julien, et al.
Pubblicazione: (2023)
Discounted Adaptive Online Learning: Towards Better Regularization
di: Zhang, Zhiyu, et al.
Pubblicazione: (2024)
di: Zhang, Zhiyu, et al.
Pubblicazione: (2024)
Action-Dependent Optimality-Preserving Reward Shaping
di: Forbes, Grant C., et al.
Pubblicazione: (2025)
di: Forbes, Grant C., et al.
Pubblicazione: (2025)
Analyzing and Bridging the Gap between Maximizing Total Reward and Discounted Reward in Deep Reinforcement Learning
di: Yin, Shuyu, et al.
Pubblicazione: (2024)
di: Yin, Shuyu, et al.
Pubblicazione: (2024)
Revisiting Value Iteration: Unified Analysis of Discounted and Average-Reward Cases
di: Mustafin, Arsenii, et al.
Pubblicazione: (2025)
di: Mustafin, Arsenii, et al.
Pubblicazione: (2025)
Reinforcement Learning for Infinite-Horizon Average-Reward Linear MDPs via Approximation by Discounted-Reward MDPs
di: Hong, Kihyuk, et al.
Pubblicazione: (2024)
di: Hong, Kihyuk, et al.
Pubblicazione: (2024)
Uncertainty-Aware Reward Discounting for Mitigating Reward Hacking
di: Singha, Disha
Pubblicazione: (2026)
di: Singha, Disha
Pubblicazione: (2026)
The Impact of Post-training on Data Contamination
di: Kocyigit, Muhammed Yusuf, et al.
Pubblicazione: (2026)
di: Kocyigit, Muhammed Yusuf, et al.
Pubblicazione: (2026)
Adaptive Discounting of Training Time Attacks
di: Bector, Ridhima, et al.
Pubblicazione: (2024)
di: Bector, Ridhima, et al.
Pubblicazione: (2024)
Towards Improving Reward Design in RL: A Reward Alignment Metric for RL Practitioners
di: Muslimani, Calarina, et al.
Pubblicazione: (2025)
di: Muslimani, Calarina, et al.
Pubblicazione: (2025)
AdaGamma: State-Dependent Discounting for Temporal Adaptation in Reinforcement Learning
di: Wang, Yaomin, et al.
Pubblicazione: (2026)
di: Wang, Yaomin, et al.
Pubblicazione: (2026)
Reward Compatibility: A Framework for Inverse RL
di: Lazzati, Filippo, et al.
Pubblicazione: (2025)
di: Lazzati, Filippo, et al.
Pubblicazione: (2025)
The Plug-in Approach for Average-Reward and Discounted MDPs: Optimal Sample Complexity Analysis
di: Zurek, Matthew, et al.
Pubblicazione: (2024)
di: Zurek, Matthew, et al.
Pubblicazione: (2024)
On-Policy RL with Optimal Reward Baseline
di: Hao, Yaru, et al.
Pubblicazione: (2025)
di: Hao, Yaru, et al.
Pubblicazione: (2025)
Online Recommendations for Agents with Discounted Adaptive Preferences
di: Agarwal, Arpit, et al.
Pubblicazione: (2023)
di: Agarwal, Arpit, et al.
Pubblicazione: (2023)
Natural Policy Gradient for Average Reward Non-Stationary RL
di: Jali, Neharika, et al.
Pubblicazione: (2025)
di: Jali, Neharika, et al.
Pubblicazione: (2025)
Don't Waste Mistakes: Leveraging Negative RL-Groups via Confidence Reweighting
di: Feng, Yunzhen, et al.
Pubblicazione: (2025)
di: Feng, Yunzhen, et al.
Pubblicazione: (2025)
VI-CuRL: Stabilizing Verifier-Independent RL Reasoning via Confidence-Guided Variance Reduction
di: Cai, Xin-Qiang, et al.
Pubblicazione: (2026)
di: Cai, Xin-Qiang, et al.
Pubblicazione: (2026)
Reinforcement Learning for Exponential Utility: Algorithms and Convergence in Discounted MDPs
di: Thoppe, Gugan, et al.
Pubblicazione: (2026)
di: Thoppe, Gugan, et al.
Pubblicazione: (2026)
Power Distribution Bridges Sampling, Self-Reward RL, and Self-Distillation
di: Tomihari, Akiyoshi, et al.
Pubblicazione: (2026)
di: Tomihari, Akiyoshi, et al.
Pubblicazione: (2026)
RL + Transformer = A General-Purpose Problem Solver
di: Rentschler, Micah, et al.
Pubblicazione: (2025)
di: Rentschler, Micah, et al.
Pubblicazione: (2025)
Diagnosing and Mitigating System Bias in Self-Rewarding RL
di: Tan, Chuyi, et al.
Pubblicazione: (2025)
di: Tan, Chuyi, et al.
Pubblicazione: (2025)
Gatekeeper: Improving Model Cascades Through Confidence Tuning
di: Rabanser, Stephan, et al.
Pubblicazione: (2025)
di: Rabanser, Stephan, et al.
Pubblicazione: (2025)
The Cancellation Hypothesis in Critic-Free RL: From Outcome Rewards to Token Credits
di: Cheng, Tianhao, et al.
Pubblicazione: (2026)
di: Cheng, Tianhao, et al.
Pubblicazione: (2026)
Less is more? Rewards in RL for Cyber Defence
di: Bates, Elizabeth, et al.
Pubblicazione: (2025)
di: Bates, Elizabeth, et al.
Pubblicazione: (2025)
Learning to Reason Efficiently with Discounted Reinforcement Learning
di: Ayoub, Alex, et al.
Pubblicazione: (2025)
di: Ayoub, Alex, et al.
Pubblicazione: (2025)
Your Reward Function for RL is Your Best PRM for Search: Unifying RL and Search-Based TTS
di: Jin, Can, et al.
Pubblicazione: (2025)
di: Jin, Can, et al.
Pubblicazione: (2025)
Offline RL by Reward-Weighted Fine-Tuning for Conversation Optimization
di: Mukherjee, Subhojyoti, et al.
Pubblicazione: (2025)
di: Mukherjee, Subhojyoti, et al.
Pubblicazione: (2025)
General Flexible $f$-divergence for Challenging Offline RL Datasets with Low Stochasticity and Diverse Behavior Policies
di: Wang, Jianxun, et al.
Pubblicazione: (2026)
di: Wang, Jianxun, et al.
Pubblicazione: (2026)
ConfClip: Confidence-Weighted and Clipped Reward for Reinforcement Learning in LLMs
di: Zhang, Bonan, et al.
Pubblicazione: (2025)
di: Zhang, Bonan, et al.
Pubblicazione: (2025)
Confidence-aware Reward Optimization for Fine-tuning Text-to-Image Models
di: Kim, Kyuyoung, et al.
Pubblicazione: (2024)
di: Kim, Kyuyoung, et al.
Pubblicazione: (2024)
Debate as Reward: A Multi-Agent Reward System for Scientific Ideation via RL Post-Training
di: Salimi, Moein, et al.
Pubblicazione: (2026)
di: Salimi, Moein, et al.
Pubblicazione: (2026)
Reducing Oracle Feedback with Vision-Language Embeddings for Preference-Based RL
di: Ghosh, Udita, et al.
Pubblicazione: (2026)
di: Ghosh, Udita, et al.
Pubblicazione: (2026)
Divide-and-Conquer CoT: RL for Reducing Latency via Parallel Reasoning
di: Mahankali, Arvind, et al.
Pubblicazione: (2026)
di: Mahankali, Arvind, et al.
Pubblicazione: (2026)
Efficiently Solving Discounted MDPs with Predictions on Transition Matrices
di: Lyu, Lixing, et al.
Pubblicazione: (2025)
di: Lyu, Lixing, et al.
Pubblicazione: (2025)
Bridging the Gap Between Average and Discounted TD Learning
di: Tian, Haoxing, et al.
Pubblicazione: (2026)
di: Tian, Haoxing, et al.
Pubblicazione: (2026)
Online Linear Regression in Dynamic Environments via Discounting
di: Jacobsen, Andrew, et al.
Pubblicazione: (2024)
di: Jacobsen, Andrew, et al.
Pubblicazione: (2024)
When Your LLM Reaches End-of-Life: A Framework for Confident Model Migration in Production Systems
di: Casey, Emma, et al.
Pubblicazione: (2026)
di: Casey, Emma, et al.
Pubblicazione: (2026)
Improved Sample Complexity Analysis of Natural Policy Gradient Algorithm with General Parameterization for Infinite Horizon Discounted Reward Markov Decision Processes
di: Mondal, Washim Uddin, et al.
Pubblicazione: (2023)
di: Mondal, Washim Uddin, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Autonomous Curriculum Design via Relative Entropy Based Task Modifications
di: Satici, Muhammed Yusuf, et al.
Pubblicazione: (2025) -
Reducing Blackwell and Average Optimality to Discounted MDPs via the Blackwell Discount Factor
di: Grand-Clément, Julien, et al.
Pubblicazione: (2023) -
Discounted Adaptive Online Learning: Towards Better Regularization
di: Zhang, Zhiyu, et al.
Pubblicazione: (2024) -
Action-Dependent Optimality-Preserving Reward Shaping
di: Forbes, Grant C., et al.
Pubblicazione: (2025) -
Analyzing and Bridging the Gap between Maximizing Total Reward and Discounted Reward in Deep Reinforcement Learning
di: Yin, Shuyu, et al.
Pubblicazione: (2024)