Learning Personalized Ad Impact via Contextual Reinforcement Learning under Delayed Rewards
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Cheng, Yuwei, Zhao, Zifeng, Xu, Haifeng |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Beyond Simple Sum of Delayed Rewards: Non-Markovian Reward Modeling for Reinforcement Learning
von: Tang, Yuting, et al.
Veröffentlicht: (2024)
von: Tang, Yuting, et al.
Veröffentlicht: (2024)
Learning from Imperfect Human Feedback: a Tale from Corruption-Robust Dueling
von: Cheng, Yuwei, et al.
Veröffentlicht: (2024)
von: Cheng, Yuwei, et al.
Veröffentlicht: (2024)
Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards
von: Lu, Xiaodong, et al.
Veröffentlicht: (2026)
von: Lu, Xiaodong, et al.
Veröffentlicht: (2026)
Transfer Learning for Nonparametric Contextual Dynamic Pricing
von: Wang, Fan, et al.
Veröffentlicht: (2025)
von: Wang, Fan, et al.
Veröffentlicht: (2025)
Percentile-Based Deep Reinforcement Learning and Reward Based Personalization For Delay Aware RAN Slicing in O-RAN
von: Tehrani, Peyman, et al.
Veröffentlicht: (2025)
von: Tehrani, Peyman, et al.
Veröffentlicht: (2025)
2048: Reinforcement Learning in a Delayed Reward Environment
von: Saligram, Prady, et al.
Veröffentlicht: (2025)
von: Saligram, Prady, et al.
Veröffentlicht: (2025)
Focal Reward: Balanced Reinforcement Learning under Rubric-Based Rewards
von: Huang, Yu, et al.
Veröffentlicht: (2026)
von: Huang, Yu, et al.
Veröffentlicht: (2026)
Alternating Reinforcement Learning with Contextual Rubric Rewards: Beyond the Scalarization Strategy
von: Lan, Guangchen, et al.
Veröffentlicht: (2026)
von: Lan, Guangchen, et al.
Veröffentlicht: (2026)
Escaping Model Collapse via Synthetic Data Verification: Near-term Improvements and Long-term Convergence
von: Yi, Bingji, et al.
Veröffentlicht: (2025)
von: Yi, Bingji, et al.
Veröffentlicht: (2025)
FuRL: Visual-Language Models as Fuzzy Rewards for Reinforcement Learning
von: Fu, Yuwei, et al.
Veröffentlicht: (2024)
von: Fu, Yuwei, et al.
Veröffentlicht: (2024)
PersRM-R1: Enhance Personalized Reward Modeling with Reinforcement Learning
von: Li, Mengdi, et al.
Veröffentlicht: (2025)
von: Li, Mengdi, et al.
Veröffentlicht: (2025)
Contextual Pre-planning on Reward Machine Abstractions for Enhanced Transfer in Deep Reinforcement Learning
von: Azran, Guy, et al.
Veröffentlicht: (2023)
von: Azran, Guy, et al.
Veröffentlicht: (2023)
Which Rewards Matter? Reward Selection for Reinforcement Learning under Limited Feedback
von: Chaudhari, Shreyas, et al.
Veröffentlicht: (2025)
von: Chaudhari, Shreyas, et al.
Veröffentlicht: (2025)
Fine-Tuning Improves Information Conveyance in Language Models
von: Cheng, Yuwei, et al.
Veröffentlicht: (2026)
von: Cheng, Yuwei, et al.
Veröffentlicht: (2026)
Delay-Empowered Causal Hierarchical Reinforcement Learning
von: Zhao, Chenran, et al.
Veröffentlicht: (2026)
von: Zhao, Chenran, et al.
Veröffentlicht: (2026)
Reward-Conditioned Reinforcement Learning
von: Nauman, Michal, et al.
Veröffentlicht: (2026)
von: Nauman, Michal, et al.
Veröffentlicht: (2026)
Binary Reward Labeling: Bridging Offline Preference and Reward-Based Reinforcement Learning
von: Xu, Yinglun, et al.
Veröffentlicht: (2024)
von: Xu, Yinglun, et al.
Veröffentlicht: (2024)
Structure Detection for Contextual Reinforcement Learning
von: Zhou, Tianyue, et al.
Veröffentlicht: (2026)
von: Zhou, Tianyue, et al.
Veröffentlicht: (2026)
Model-Based Reinforcement Learning under Random Observation Delays
von: Karamzade, Armin, et al.
Veröffentlicht: (2025)
von: Karamzade, Armin, et al.
Veröffentlicht: (2025)
Model-Based Transfer Learning for Contextual Reinforcement Learning
von: Cho, Jung-Hoon, et al.
Veröffentlicht: (2024)
von: Cho, Jung-Hoon, et al.
Veröffentlicht: (2024)
Robot Policy Learning with Temporal Optimal Transport Reward
von: Fu, Yuwei, et al.
Veröffentlicht: (2024)
von: Fu, Yuwei, et al.
Veröffentlicht: (2024)
Personalizing Exposure Therapy via Reinforcement Learning
von: Mahmoudi-Nejad, Athar, et al.
Veröffentlicht: (2025)
von: Mahmoudi-Nejad, Athar, et al.
Veröffentlicht: (2025)
Active Measuring in Reinforcement Learning With Delayed Negative Effects
von: Gao, Daiqi, et al.
Veröffentlicht: (2025)
von: Gao, Daiqi, et al.
Veröffentlicht: (2025)
Seldonian Reinforcement Learning for Ad Hoc Teamwork
von: Zorzi, Edoardo, et al.
Veröffentlicht: (2025)
von: Zorzi, Edoardo, et al.
Veröffentlicht: (2025)
Contextual Dynamic Pricing: Algorithms, Optimality, and Local Differential Privacy Constraints
von: Zhao, Zifeng, et al.
Veröffentlicht: (2024)
von: Zhao, Zifeng, et al.
Veröffentlicht: (2024)
Reward Design for Reinforcement Learning Agents
von: Devidze, Rati
Veröffentlicht: (2025)
von: Devidze, Rati
Veröffentlicht: (2025)
Reinforcement Learning from Bagged Reward
von: Tang, Yuting, et al.
Veröffentlicht: (2024)
von: Tang, Yuting, et al.
Veröffentlicht: (2024)
The Value of Reward Lookahead in Reinforcement Learning
von: Merlis, Nadav, et al.
Veröffentlicht: (2024)
von: Merlis, Nadav, et al.
Veröffentlicht: (2024)
Informativeness of Reward Functions in Reinforcement Learning
von: Devidze, Rati, et al.
Veröffentlicht: (2024)
von: Devidze, Rati, et al.
Veröffentlicht: (2024)
To the Max: Reinventing Reward in Reinforcement Learning
von: Veviurko, Grigorii, et al.
Veröffentlicht: (2024)
von: Veviurko, Grigorii, et al.
Veröffentlicht: (2024)
DUET: Optimize Token-Budget Allocation for Reinforcement Learning with Verifiable Rewards
von: Hu, Haoyu, et al.
Veröffentlicht: (2026)
von: Hu, Haoyu, et al.
Veröffentlicht: (2026)
Reinforcement Learning with Conditional Expectation Reward
von: Xiao, Changyi, et al.
Veröffentlicht: (2026)
von: Xiao, Changyi, et al.
Veröffentlicht: (2026)
Deep Reinforcement Learning for Ranking Utility Tuning in the Ad Recommender System at Pinterest
von: Yang, Xiao, et al.
Veröffentlicht: (2025)
von: Yang, Xiao, et al.
Veröffentlicht: (2025)
Contextual Intelligence The Next Leap for Reinforcement Learning
von: Biedenkapp, André
Veröffentlicht: (2026)
von: Biedenkapp, André
Veröffentlicht: (2026)
Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers
von: Cai, Xin-Qiang, et al.
Veröffentlicht: (2025)
von: Cai, Xin-Qiang, et al.
Veröffentlicht: (2025)
Transferable Delay-Aware Reinforcement Learning via Implicit Causal Graph Modeling
von: Zhao, Chenran, et al.
Veröffentlicht: (2026)
von: Zhao, Chenran, et al.
Veröffentlicht: (2026)
LinguaFluid: Language Guided Fluid Control via Semantic Rewards in Reinforcement Learning
von: Liang, Aoming, et al.
Veröffentlicht: (2025)
von: Liang, Aoming, et al.
Veröffentlicht: (2025)
Reinforcement Learning for Infinite-Horizon Average-Reward Linear MDPs via Approximation by Discounted-Reward MDPs
von: Hong, Kihyuk, et al.
Veröffentlicht: (2024)
von: Hong, Kihyuk, et al.
Veröffentlicht: (2024)
Provably Efficient Interactive-Grounded Learning with Personalized Reward
von: Zhang, Mengxiao, et al.
Veröffentlicht: (2024)
von: Zhang, Mengxiao, et al.
Veröffentlicht: (2024)
Locally Private Nonparametric Contextual Multi-armed Bandits
von: Ma, Yuheng, et al.
Veröffentlicht: (2025)
von: Ma, Yuheng, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Beyond Simple Sum of Delayed Rewards: Non-Markovian Reward Modeling for Reinforcement Learning
von: Tang, Yuting, et al.
Veröffentlicht: (2024) -
Learning from Imperfect Human Feedback: a Tale from Corruption-Robust Dueling
von: Cheng, Yuwei, et al.
Veröffentlicht: (2024) -
Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards
von: Lu, Xiaodong, et al.
Veröffentlicht: (2026) -
Transfer Learning for Nonparametric Contextual Dynamic Pricing
von: Wang, Fan, et al.
Veröffentlicht: (2025) -
Percentile-Based Deep Reinforcement Learning and Reward Based Personalization For Delay Aware RAN Slicing in O-RAN
von: Tehrani, Peyman, et al.
Veröffentlicht: (2025)