Algorithms for Adaptive Experiments that Trade-off Statistical Analysis with Reward: Combining Uniform Random Assignment and Reward Maximization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Tong, Nogas, Jacob, Song, Haochen, Rafferty, Anna, Schwartz, Eric M., Durand, Audrey, Kumar, Harsh, Deliu, Nina, Villar, Sofia S., Kong, Dehan, Williams, Joseph J. |
|---|---|
| Format: | Preprint |
| Publié: |
2021
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A Statistically Reliable Optimization Framework for Bandit Experiments in Scientific Discovery
par: Li, Tong, et autres
Publié: (2026)
par: Li, Tong, et autres
Publié: (2026)
Incorporating Participants' Welfare into Sequential Multiple Assignment Randomized Trials
par: Wang, Xinru, et autres
Publié: (2022)
par: Wang, Xinru, et autres
Publié: (2022)
Implementing Response-Adaptive Randomisation in Stratified Rare-disease Trials: Design Challenges and Practical Solutions
par: Das, Rajenki, et autres
Publié: (2024)
par: Das, Rajenki, et autres
Publié: (2024)
Adaptive Experiments Under Data Sparse Settings: Applications for Educational Platforms
par: Song, Haochen, et autres
Publié: (2025)
par: Song, Haochen, et autres
Publié: (2025)
Using Adaptive Bandit Experiments to Increase and Investigate Engagement in Mental Health
par: Kumar, Harsh, et autres
Publié: (2023)
par: Kumar, Harsh, et autres
Publié: (2023)
Decision-Making under Stress: The Hiding behind a Small Cake Effect
par: Erika Mirian Nogas
Publié: (2023)
par: Erika Mirian Nogas
Publié: (2023)
Reinforcement Learning in Modern Biostatistics: Constructing Optimal Adaptive Interventions
par: Deliu, Nina, et autres
Publié: (2022)
par: Deliu, Nina, et autres
Publié: (2022)
Conformal Bandits: Bringing statistical validity and reward efficiency to the small-gap regime
par: Cuonzo, Simone, et autres
Publié: (2025)
par: Cuonzo, Simone, et autres
Publié: (2025)
Alternative Approaches for Estimating Highest-Density Regions
par: Deliu, Nina, et autres
Publié: (2023)
par: Deliu, Nina, et autres
Publié: (2023)
A Multivariate Copula-based Bayesian Framework for Doping Detection
par: Deliu, Nina, et autres
Publié: (2024)
par: Deliu, Nina, et autres
Publié: (2024)
The Interplay between Bayesian Inference and Conformal Prediction
par: Deliu, Nina, et autres
Publié: (2025)
par: Deliu, Nina, et autres
Publié: (2025)
Artificial Intelligence-based Decision Support Systems for Precision and Digital Health
par: Deliu, Nina, et autres
Publié: (2024)
par: Deliu, Nina, et autres
Publié: (2024)
Maximally Permissive Reward Machines
par: Varricchione, Giovanni, et autres
Publié: (2024)
par: Varricchione, Giovanni, et autres
Publié: (2024)
MAESTRO: Meta-learning Adaptive Estimation of Scalarization Trade-offs for Reward Optimization
par: Zhao, Yang, et autres
Publié: (2026)
par: Zhao, Yang, et autres
Publié: (2026)
Transforming and Combining Rewards for Aligning Large Language Models
par: Wang, Zihao, et autres
Publié: (2024)
par: Wang, Zihao, et autres
Publié: (2024)
RIE-Greedy: Regularization-Induced Exploration for Contextual Bandits
par: Li, Tong, et autres
Publié: (2026)
par: Li, Tong, et autres
Publié: (2026)
The Effectiveness of Prosocial Rewards and Cash Rewards in Internal Whistleblower Programs
par: Khim Kelly, et autres
Publié: (2026)
par: Khim Kelly, et autres
Publié: (2026)
Explicit Preference Optimization: No Need for an Implicit Reward Model
par: Hu, Xiangkun, et autres
Publié: (2025)
par: Hu, Xiangkun, et autres
Publié: (2025)
Assessing the Accuracy of Multisource Register-based Official Statistics for Multinomial Outcomes
par: Deliu, Nina, et autres
Publié: (2025)
par: Deliu, Nina, et autres
Publié: (2025)
On Truthful Item-Acquiring Mechanisms for Reward Maximization
par: Shan, Liang, et autres
Publié: (2024)
par: Shan, Liang, et autres
Publié: (2024)
Analyzing and Bridging the Gap between Maximizing Total Reward and Discounted Reward in Deep Reinforcement Learning
par: Yin, Shuyu, et autres
Publié: (2024)
par: Yin, Shuyu, et autres
Publié: (2024)
Cognitive Dissonance Artificial Intelligence (CD-AI): The Mind at War with Itself. Harnessing Discomfort to Sharpen Critical Thinking
par: Deliu, Delia
Publié: (2025)
par: Deliu, Delia
Publié: (2025)
Randomized Confidence Bounds for Stochastic Partial Monitoring
par: Heuillet, Maxime, et autres
Publié: (2024)
par: Heuillet, Maxime, et autres
Publié: (2024)
Tackling Length Inflation Without Trade-offs: Group Relative Reward Rescaling for Reinforcement Learning
par: Li, Zichao, et autres
Publié: (2026)
par: Li, Zichao, et autres
Publié: (2026)
Actions Speak Louder Than Words: Rate-Reward Trade-off in Markov Decision Processes
par: Wu, Haotian, et autres
Publié: (2025)
par: Wu, Haotian, et autres
Publié: (2025)
Exploration by Random Reward Perturbation
par: Ma, Haozhe, et autres
Publié: (2025)
par: Ma, Haozhe, et autres
Publié: (2025)
RewardBench 2: Advancing Reward Model Evaluation
par: Malik, Saumya, et autres
Publié: (2025)
par: Malik, Saumya, et autres
Publié: (2025)
Latent Reward: LLM-Empowered Credit Assignment in Episodic Reinforcement Learning
par: Qu, Yun, et autres
Publié: (2024)
par: Qu, Yun, et autres
Publié: (2024)
BaseReward: A Strong Baseline for Multimodal Reward Model
par: Zhang, Yi-Fan, et autres
Publié: (2025)
par: Zhang, Yi-Fan, et autres
Publié: (2025)
Reward Training Wheels: Adaptive Auxiliary Rewards for Robotics Reinforcement Learning
par: Wang, Linji, et autres
Publié: (2025)
par: Wang, Linji, et autres
Publié: (2025)
Bootstrapped Reward Shaping
par: Adamczyk, Jacob, et autres
Publié: (2025)
par: Adamczyk, Jacob, et autres
Publié: (2025)
Maximize Your Diffusion: A Study into Reward Maximization and Alignment for Diffusion-based Control
par: Huh, Dom, et autres
Publié: (2025)
par: Huh, Dom, et autres
Publié: (2025)
Combining Automated Optimisation of Hyperparameters and Reward Shape
par: Dierkes, Julian, et autres
Publié: (2024)
par: Dierkes, Julian, et autres
Publié: (2024)
Efficiency-Reward Trade-Off in Queues with Dynamic Arrivals
par: Qu, Tianze, et autres
Publié: (2026)
par: Qu, Tianze, et autres
Publié: (2026)
Cycle Consistency as Reward: Learning Image-Text Alignment without Human Preferences
par: Bahng, Hyojin, et autres
Publié: (2025)
par: Bahng, Hyojin, et autres
Publié: (2025)
Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents
par: Tang, Wenjie, et autres
Publié: (2026)
par: Tang, Wenjie, et autres
Publié: (2026)
Rank2Reward: Learning Shaped Reward Functions from Passive Video
par: Yang, Daniel, et autres
Publié: (2024)
par: Yang, Daniel, et autres
Publié: (2024)
RewardBench: Evaluating Reward Models for Language Modeling
par: Lambert, Nathan, et autres
Publié: (2024)
par: Lambert, Nathan, et autres
Publié: (2024)
Reuse Your Rewards: Reward Model Transfer for Zero-Shot Cross-Lingual Alignment
par: Wu, Zhaofeng, et autres
Publié: (2024)
par: Wu, Zhaofeng, et autres
Publié: (2024)
Optimal Transport for LLM Reward Modeling from Noisy Preference
par: Pan, Licheng, et autres
Publié: (2026)
par: Pan, Licheng, et autres
Publié: (2026)
Documents similaires
-
A Statistically Reliable Optimization Framework for Bandit Experiments in Scientific Discovery
par: Li, Tong, et autres
Publié: (2026) -
Incorporating Participants' Welfare into Sequential Multiple Assignment Randomized Trials
par: Wang, Xinru, et autres
Publié: (2022) -
Implementing Response-Adaptive Randomisation in Stratified Rare-disease Trials: Design Challenges and Practical Solutions
par: Das, Rajenki, et autres
Publié: (2024) -
Adaptive Experiments Under Data Sparse Settings: Applications for Educational Platforms
par: Song, Haochen, et autres
Publié: (2025) -
Using Adaptive Bandit Experiments to Increase and Investigate Engagement in Mental Health
par: Kumar, Harsh, et autres
Publié: (2023)