Enregistré dans:
| Auteurs principaux: | Schwarzer, Will, Niekum, Scott |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2605.15134 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Evaluation-Aware Reinforcement Learning
par: Deshmukh, Shripad Vilasrao, et autres
Publié: (2025)
par: Deshmukh, Shripad Vilasrao, et autres
Publié: (2025)
Supervised Reward Inference
par: Schwarzer, Will, et autres
Publié: (2025)
par: Schwarzer, Will, et autres
Publié: (2025)
Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints
par: Chittepu, Yaswanth, et autres
Publié: (2025)
par: Chittepu, Yaswanth, et autres
Publié: (2025)
Bayesian Robust Optimization for Imitation Learning
par: Brown, Daniel S., et autres
Publié: (2020)
par: Brown, Daniel S., et autres
Publié: (2020)
Regularized Latent Dynamics Prediction is a Strong Baseline For Behavioral Foundation Models
par: Jajoo, Pranaya, et autres
Publié: (2026)
par: Jajoo, Pranaya, et autres
Publié: (2026)
On the Benefits of Inducing Local Lipschitzness for Robust Generative Adversarial Imitation Learning
par: Memarian, Farzan, et autres
Publié: (2021)
par: Memarian, Farzan, et autres
Publié: (2021)
Pairwise or Pointwise? Evaluating Feedback Protocols for Bias in LLM-Based Evaluation
par: Tripathi, Tuhina, et autres
Publié: (2025)
par: Tripathi, Tuhina, et autres
Publié: (2025)
Safe RLHF Beyond Expectation: Stochastic Dominance for Universal Spectral Risk Control
par: Chittepu, Yaswanth, et autres
Publié: (2026)
par: Chittepu, Yaswanth, et autres
Publié: (2026)
Dual RL: Unification and New Methods for Reinforcement and Imitation Learning
par: Sikchi, Harshit, et autres
Publié: (2023)
par: Sikchi, Harshit, et autres
Publié: (2023)
A Dual Approach to Imitation Learning from Observations with Offline Datasets
par: Sikchi, Harshit, et autres
Publié: (2024)
par: Sikchi, Harshit, et autres
Publié: (2024)
Adaptive Margin RLHF via Preference over Preferences
par: Chittepu, Yaswanth, et autres
Publié: (2025)
par: Chittepu, Yaswanth, et autres
Publié: (2025)
Pareto-Optimal Learning from Preferences with Hidden Context
par: Bahlous-Boldi, Ryan, et autres
Publié: (2024)
par: Bahlous-Boldi, Ryan, et autres
Publié: (2024)
An Optimal Discriminator Weighted Imitation Perspective for Reinforcement Learning
par: Xu, Haoran, et autres
Publié: (2025)
par: Xu, Haoran, et autres
Publié: (2025)
SMORE: Score Models for Offline Goal-Conditioned Reinforcement Learning
par: Sikchi, Harshit, et autres
Publié: (2023)
par: Sikchi, Harshit, et autres
Publié: (2023)
A Descriptive and Normative Theory of Human Beliefs in RLHF
par: Dandekar, Sylee, et autres
Publié: (2025)
par: Dandekar, Sylee, et autres
Publié: (2025)
Quantile Activation: Correcting a Failure Mode of ML Models
par: Challa, Aditya, et autres
Publié: (2024)
par: Challa, Aditya, et autres
Publié: (2024)
Learning Action-based Representations Using Invariance
par: Rudolph, Max, et autres
Publié: (2024)
par: Rudolph, Max, et autres
Publié: (2024)
Automated Discovery of Functional Actual Causes in Complex Environments
par: Chuck, Caleb, et autres
Publié: (2024)
par: Chuck, Caleb, et autres
Publié: (2024)
Impact of ML Optimization Tactics on Greener Pre-Trained ML Models
par: Álvarez, Alexandra González, et autres
Publié: (2024)
par: Álvarez, Alexandra González, et autres
Publié: (2024)
Null Counterfactual Factor Interactions for Goal-Conditioned Reinforcement Learning
par: Chuck, Caleb, et autres
Publié: (2025)
par: Chuck, Caleb, et autres
Publié: (2025)
Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms
par: Rafailov, Rafael, et autres
Publié: (2024)
par: Rafailov, Rafael, et autres
Publié: (2024)
Fast Adaptation with Behavioral Foundation Models
par: Sikchi, Harshit, et autres
Publié: (2025)
par: Sikchi, Harshit, et autres
Publié: (2025)
Contrastive Preference Learning: Learning from Human Feedback without RL
par: Hejna, Joey, et autres
Publié: (2023)
par: Hejna, Joey, et autres
Publié: (2023)
SpinML: Customized Synthetic Data Generation for Private Training of Specialized ML Models
par: Zhang, Jiang, et autres
Publié: (2025)
par: Zhang, Jiang, et autres
Publié: (2025)
SkiLD: Unsupervised Skill Discovery Guided by Factor Interactions
par: Wang, Zizhao, et autres
Publié: (2024)
par: Wang, Zizhao, et autres
Publié: (2024)
Are Deep Speech Denoising Models Robust to Adversarial Noise?
par: Schwarzer, Will, et autres
Publié: (2025)
par: Schwarzer, Will, et autres
Publié: (2025)
Chronic Diseases Prediction Using ML
par: Mulakala, Sri Varsha, et autres
Publié: (2025)
par: Mulakala, Sri Varsha, et autres
Publié: (2025)
ML Inference Scheduling with Predictable Latency
par: Zhao, Haidong, et autres
Publié: (2025)
par: Zhao, Haidong, et autres
Publié: (2025)
Optimizing ML Training with Metagradient Descent
par: Engstrom, Logan, et autres
Publié: (2025)
par: Engstrom, Logan, et autres
Publié: (2025)
Bayesian Joint Model of Multi-Sensor and Failure Event Data for Multi-Mode Failure Prediction
par: Fard, Sina Aghaee Dabaghan, et autres
Publié: (2025)
par: Fard, Sina Aghaee Dabaghan, et autres
Publié: (2025)
Fault Tolerant ML: Efficient Meta-Aggregation and Synchronous Training
par: Dahan, Tehila, et autres
Publié: (2024)
par: Dahan, Tehila, et autres
Publié: (2024)
Defining error accumulation in ML atmospheric simulators
par: Parthipan, Raghul, et autres
Publié: (2024)
par: Parthipan, Raghul, et autres
Publié: (2024)
Chunky Post-Training: Data Driven Failures of Generalization
par: Murray, Seoirse, et autres
Publié: (2026)
par: Murray, Seoirse, et autres
Publié: (2026)
SnatchML: Hijacking ML models without Training Access
par: Ghorbel, Mahmoud, et autres
Publié: (2024)
par: Ghorbel, Mahmoud, et autres
Publié: (2024)
RLZero: Direct Policy Inference from Language Without In-Domain Supervision
par: Sikchi, Harshit, et autres
Publié: (2024)
par: Sikchi, Harshit, et autres
Publié: (2024)
Development and Deployment of Hybrid ML Models for Critical Heat Flux Prediction in Annulus Geometries
par: Furlong, Aidan, et autres
Publié: (2025)
par: Furlong, Aidan, et autres
Publié: (2025)
CubicML: Automated ML for Large ML Systems Co-design with ML Prediction of Performance
par: Wen, Wei, et autres
Publié: (2024)
par: Wen, Wei, et autres
Publié: (2024)
Predicting Cascading Failures with a Hyperparametric Diffusion Model
par: Xiang, Bin, et autres
Publié: (2024)
par: Xiang, Bin, et autres
Publié: (2024)
Reducing Hyperparameter Tuning Costs in ML, Vision and Language Model Training Pipelines via Memoization-Awareness
par: Essofi, Abdelmajid, et autres
Publié: (2024)
par: Essofi, Abdelmajid, et autres
Publié: (2024)
A Frugal Model for Accurate Early Student Failure Prediction
par: Gagaoua, Ikram, et autres
Publié: (2025)
par: Gagaoua, Ikram, et autres
Publié: (2025)
Documents similaires
-
Evaluation-Aware Reinforcement Learning
par: Deshmukh, Shripad Vilasrao, et autres
Publié: (2025) -
Supervised Reward Inference
par: Schwarzer, Will, et autres
Publié: (2025) -
Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints
par: Chittepu, Yaswanth, et autres
Publié: (2025) -
Bayesian Robust Optimization for Imitation Learning
par: Brown, Daniel S., et autres
Publié: (2020) -
Regularized Latent Dynamics Prediction is a Strong Baseline For Behavioral Foundation Models
par: Jajoo, Pranaya, et autres
Publié: (2026)