Unified theory of upper confidence bound policies for bandit problems targeting total reward, maximal reward, and more
Fuente:
arXiv
Guardado en:
| Autores principales: | Kikkawa, Nobuaki, Ohno, Hiroshi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Leveraging heterogeneous spillover in maximizing contextual bandit rewards
por: Faruk, Ahmed Sayeed, et al.
Publicado: (2023)
por: Faruk, Ahmed Sayeed, et al.
Publicado: (2023)
Materials Discovery using Max K-Armed Bandit
por: Kikkawa, Nobuaki, et al.
Publicado: (2022)
por: Kikkawa, Nobuaki, et al.
Publicado: (2022)
Trading off rewards and errors in multi-armed bandits
por: Erraqabi, Akram, et al.
Publicado: (2026)
por: Erraqabi, Akram, et al.
Publicado: (2026)
Covariance-adapting algorithm for semi-bandits with application to sparse rewards
por: Perrault, Pierre, et al.
Publicado: (2026)
por: Perrault, Pierre, et al.
Publicado: (2026)
Agent-centric learning: from external reward maximization to internal knowledge curation
por: Zhou, Hanqi, et al.
Publicado: (2025)
por: Zhou, Hanqi, et al.
Publicado: (2025)
GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
por: Liu, Shih-Yang, et al.
Publicado: (2026)
por: Liu, Shih-Yang, et al.
Publicado: (2026)
Finding good policies in average-reward Markov Decision Processes without prior knowledge
por: Tuynman, Adrienne, et al.
Publicado: (2024)
por: Tuynman, Adrienne, et al.
Publicado: (2024)
Logarithmic regret bounds for continuous-time average-reward Markov decision processes
por: Gao, Xuefeng, et al.
Publicado: (2022)
por: Gao, Xuefeng, et al.
Publicado: (2022)
Active teacher selection for reward learning
por: Freedman, Rachel, et al.
Publicado: (2023)
por: Freedman, Rachel, et al.
Publicado: (2023)
Self-rewarding correction for mathematical reasoning
por: Xiong, Wei, et al.
Publicado: (2025)
por: Xiong, Wei, et al.
Publicado: (2025)
Noise-based reward-modulated learning
por: Fernández, Jesús García, et al.
Publicado: (2025)
por: Fernández, Jesús García, et al.
Publicado: (2025)
Approximate information maximization for bandit games
por: Barbier-Chebbah, Alex, et al.
Publicado: (2023)
por: Barbier-Chebbah, Alex, et al.
Publicado: (2023)
Meta Flow Maps enable scalable reward alignment
por: Potaptchik, Peter, et al.
Publicado: (2026)
por: Potaptchik, Peter, et al.
Publicado: (2026)
LIRE: listwise reward enhancement for preference alignment
por: Zhu, Mingye, et al.
Publicado: (2024)
por: Zhu, Mingye, et al.
Publicado: (2024)
Revealing graph bandits for maximizing local influence
por: Carpentier, Alexandra, et al.
Publicado: (2026)
por: Carpentier, Alexandra, et al.
Publicado: (2026)
The impact of intrinsic rewards on exploration in Reinforcement Learning
por: Kayal, Aya, et al.
Publicado: (2025)
por: Kayal, Aya, et al.
Publicado: (2025)
Continuously evolving rewards in an open-ended environment
por: Bailey, Richard M.
Publicado: (2024)
por: Bailey, Richard M.
Publicado: (2024)
Optimistic Q-learning for average reward and episodic reinforcement learning
por: Agrawal, Priyank, et al.
Publicado: (2024)
por: Agrawal, Priyank, et al.
Publicado: (2024)
Scale-free adaptive planning for deterministic dynamics & discounted rewards
por: Bartlett, Peter L., et al.
Publicado: (2026)
por: Bartlett, Peter L., et al.
Publicado: (2026)
Physics-based reward driven image analysis in microscopy
por: Barakati, Kamyar, et al.
Publicado: (2024)
por: Barakati, Kamyar, et al.
Publicado: (2024)
Episodic Reinforcement Learning with Expanded State-reward Space
por: Liang, Dayang, et al.
Publicado: (2024)
por: Liang, Dayang, et al.
Publicado: (2024)
EVAL: EigenVector-based Average-reward Learning
por: Adamczyk, Jacob, et al.
Publicado: (2025)
por: Adamczyk, Jacob, et al.
Publicado: (2025)
Streaming Looking Ahead with Token-level Self-reward
por: Zhang, Hongming, et al.
Publicado: (2025)
por: Zhang, Hongming, et al.
Publicado: (2025)
Approximate optimality and the risk/reward tradeoff in a class of bandit problems
por: Chen, Zengjing, et al.
Publicado: (2022)
por: Chen, Zengjing, et al.
Publicado: (2022)
Integration of Scanning Probe Microscope with High-Performance Computing: fixed-policy and reward-driven workflows implementation
por: Liu, Yu, et al.
Publicado: (2024)
por: Liu, Yu, et al.
Publicado: (2024)
Risk-averse Total-reward MDPs with ERM and EVaR
por: Su, Xihong, et al.
Publicado: (2024)
por: Su, Xihong, et al.
Publicado: (2024)
reward-lens: A Mechanistic Interpretability Library for Reward Models
por: Nadaf, Mohammed Suhail B
Publicado: (2026)
por: Nadaf, Mohammed Suhail B
Publicado: (2026)
Risk and optimal policies in bandit experiments
por: Adusumilli, Karun
Publicado: (2021)
por: Adusumilli, Karun
Publicado: (2021)
TractOracle: towards an anatomically-informed reward function for RL-based tractography
por: Théberge, Antoine, et al.
Publicado: (2024)
por: Théberge, Antoine, et al.
Publicado: (2024)
Conformal Bandits: Bringing statistical validity and reward efficiency to the small-gap regime
por: Cuonzo, Simone, et al.
Publicado: (2025)
por: Cuonzo, Simone, et al.
Publicado: (2025)
Reinforcement learning with non-ergodic reward increments: robustness via ergodicity transformations
por: Baumann, Dominik, et al.
Publicado: (2023)
por: Baumann, Dominik, et al.
Publicado: (2023)
The tractability landscape of diffusion alignment: regularization, rewards, and computational primitives
por: Moitra, Ankur, et al.
Publicado: (2026)
por: Moitra, Ankur, et al.
Publicado: (2026)
Stochastic first-order methods for average-reward Markov decision processes
por: Li, Tianjiao, et al.
Publicado: (2022)
por: Li, Tianjiao, et al.
Publicado: (2022)
BLEUBERI: BLEU is a surprisingly effective reward for instruction following
por: Chang, Yapei, et al.
Publicado: (2025)
por: Chang, Yapei, et al.
Publicado: (2025)
Sample-efficient Learning of Infinite-horizon Average-reward MDPs with General Function Approximation
por: He, Jianliang, et al.
Publicado: (2024)
por: He, Jianliang, et al.
Publicado: (2024)
Co-rewarding: Stable Self-supervised RL for Eliciting Reasoning in Large Language Models
por: Zhang, Zizhuo, et al.
Publicado: (2025)
por: Zhang, Zizhuo, et al.
Publicado: (2025)
Leveraging LLMs for reward function design in reinforcement learning control tasks
por: Cardenoso, Franklin, et al.
Publicado: (2025)
por: Cardenoso, Franklin, et al.
Publicado: (2025)
Steering diffusion models with quadratic rewards: a fine-grained analysis
por: Moitra, Ankur, et al.
Publicado: (2026)
por: Moitra, Ankur, et al.
Publicado: (2026)
Lookahead identification in adversarial bandits: accuracy and memory bounds
por: Brukhim, Nataly, et al.
Publicado: (2026)
por: Brukhim, Nataly, et al.
Publicado: (2026)
Asymmetric REINFORCE for off-Policy Reinforcement Learning: Balancing positive and negative rewards
por: Arnal, Charles, et al.
Publicado: (2025)
por: Arnal, Charles, et al.
Publicado: (2025)
Ejemplares similares
-
Leveraging heterogeneous spillover in maximizing contextual bandit rewards
por: Faruk, Ahmed Sayeed, et al.
Publicado: (2023) -
Materials Discovery using Max K-Armed Bandit
por: Kikkawa, Nobuaki, et al.
Publicado: (2022) -
Trading off rewards and errors in multi-armed bandits
por: Erraqabi, Akram, et al.
Publicado: (2026) -
Covariance-adapting algorithm for semi-bandits with application to sparse rewards
por: Perrault, Pierre, et al.
Publicado: (2026) -
Agent-centric learning: from external reward maximization to internal knowledge curation
por: Zhou, Hanqi, et al.
Publicado: (2025)