When (and How) to Trust the Expert: Diagnosing Query-Time Expert-Guided Reinforcement Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Berthelot, Yann, Preux, Philippe, Akrour, Riad |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Limits of Actor-Critic Algorithms for Decision Tree Policies Learning in IBMDPs
par: Kohler, Hector, et autres
Publié: (2023)
par: Kohler, Hector, et autres
Publié: (2023)
Interpretable and Editable Programmatic Tree Policies for Reinforcement Learning
par: Kohler, Hector, et autres
Publié: (2024)
par: Kohler, Hector, et autres
Publié: (2024)
Evaluating Interpretable Reinforcement Learning by Distilling Policies into Programs
par: Kohler, Hector, et autres
Publié: (2025)
par: Kohler, Hector, et autres
Publié: (2025)
PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning
par: Driss, Brahim, et autres
Publié: (2025)
par: Driss, Brahim, et autres
Publié: (2025)
Breiman meets Bellman: Non-Greedy Decision Trees with MDPs
par: Kohler, Hector, et autres
Publié: (2023)
par: Kohler, Hector, et autres
Publié: (2023)
StaQ it! Growing neural networks for Policy Mirror Descent
par: Shilova, Alena, et autres
Publié: (2025)
par: Shilova, Alena, et autres
Publié: (2025)
Trust, Don't Trust, or Flip: Robust Preference-Based Reinforcement Learning with Multi-Expert Feedback
par: Hosseini, Seyed Amir, et autres
Publié: (2026)
par: Hosseini, Seyed Amir, et autres
Publié: (2026)
IDEQ: an improved diffusion model for the TSP
par: Basson, Mickael, et autres
Publié: (2024)
par: Basson, Mickael, et autres
Publié: (2024)
Towards a Research Community in Interpretable Reinforcement Learning: the InterpPol Workshop
par: Kohler, Hector, et autres
Publié: (2024)
par: Kohler, Hector, et autres
Publié: (2024)
Mixture-of-Experts Meets In-Context Reinforcement Learning
par: Wu, Wenhao, et autres
Publié: (2025)
par: Wu, Wenhao, et autres
Publié: (2025)
Inverse Reinforcement Learning with Sub-optimal Experts
par: Poiani, Riccardo, et autres
Publié: (2024)
par: Poiani, Riccardo, et autres
Publié: (2024)
Learning Reasoning Rewards from Expert Demonstrations with Inverse Reinforcement Learning
par: Fanconi, Claudio, et autres
Publié: (2025)
par: Fanconi, Claudio, et autres
Publié: (2025)
Expert Q-learning: Deep Reinforcement Learning with Coarse State Values from Offline Expert Examples
par: Meng, Li, et autres
Publié: (2021)
par: Meng, Li, et autres
Publié: (2021)
Learning When to Optimize: Verified Optimization Skills from Expert GPU-Kernel Lineages
par: Zhang, Shuoming, et autres
Publié: (2026)
par: Zhang, Shuoming, et autres
Publié: (2026)
How Many Experts Are Enough? Towards Optimal Semantic Specialization for Mixture-of-Experts
par: Park, Sumin, et autres
Publié: (2025)
par: Park, Sumin, et autres
Publié: (2025)
Keeping Experts in the Loop: Expert-Guided Optimization for Clinical Data Classification using Large Language Models
par: Karayanni, Nader, et autres
Publié: (2024)
par: Karayanni, Nader, et autres
Publié: (2024)
Can LLMs Score Medical Diagnoses and Clinical Reasoning as well as Expert Panels?
par: Rouillard, Amy, et autres
Publié: (2026)
par: Rouillard, Amy, et autres
Publié: (2026)
Expert-Guided POMDP Learning for Data-Efficient Modeling in Healthcare
par: Locatelli, Marco, et autres
Publié: (2025)
par: Locatelli, Marco, et autres
Publié: (2025)
A Time Series is Worth Five Experts: Heterogeneous Mixture of Experts for Traffic Flow Prediction
par: Wang, Guangyu, et autres
Publié: (2024)
par: Wang, Guangyu, et autres
Publié: (2024)
FLEx: Personalized Federated Learning for Mixture-of-Experts LLMs via Expert Grafting
par: Liu, Fan, et autres
Publié: (2025)
par: Liu, Fan, et autres
Publié: (2025)
Uncertainty-Aware and Temporally Regulated Expert Advice in Reinforcement Learning for Autonomous Driving
par: Abouelazm, Ahmed, et autres
Publié: (2026)
par: Abouelazm, Ahmed, et autres
Publié: (2026)
Toward Better EHR Reasoning in LLMs: Reinforcement Learning with Expert Attention Guidance
par: Fang, Yue, et autres
Publié: (2025)
par: Fang, Yue, et autres
Publié: (2025)
Knowledge-Guided Adaptive Mixture of Experts for Precipitation Prediction
par: Jiang, Chen, et autres
Publié: (2025)
par: Jiang, Chen, et autres
Publié: (2025)
The Expert Interchange Standard: Enabling Dynamic Expert Management in Mixture-of-Experts Language Models
par: Kashinath, Kadaba Shrish
Publié: (2026)
par: Kashinath, Kadaba Shrish
Publié: (2026)
Who Do LLMs Trust? Human Experts Matter More Than Other LLMs
par: Bajaj, Anooshka, et autres
Publié: (2026)
par: Bajaj, Anooshka, et autres
Publié: (2026)
Sample-Efficient Expert Query Control in Active Imitation Learning via Conformal Prediction
par: Firouzkouhi, Arad, et autres
Publié: (2025)
par: Firouzkouhi, Arad, et autres
Publié: (2025)
Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning
par: Yin, Ming, et autres
Publié: (2025)
par: Yin, Ming, et autres
Publié: (2025)
Selective Expert Guidance for Effective and Diverse Exploration in Reinforcement Learning of LLMs
par: Jiang, Zishang, et autres
Publié: (2025)
par: Jiang, Zishang, et autres
Publié: (2025)
Causal Imitation Learning under Expert-Observable and Expert-Unobservable Confounding
par: Shao, Daqian, et autres
Publié: (2025)
par: Shao, Daqian, et autres
Publié: (2025)
The Arrival of AGI? When Expert Personas Exceed Expert Benchmarks
par: Mullens, Drake, et autres
Publié: (2026)
par: Mullens, Drake, et autres
Publié: (2026)
Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning
par: Castagna, Alberto
Publié: (2025)
par: Castagna, Alberto
Publié: (2025)
Geometric Routing Enables Causal Expert Control in Mixture of Experts
par: Ternovtsii, Ivan, et autres
Publié: (2026)
par: Ternovtsii, Ivan, et autres
Publié: (2026)
Geometric Mixture-of-Experts with Curvature-Guided Adaptive Routing for Graph Representation Learning
par: Cao, Haifang, et autres
Publié: (2026)
par: Cao, Haifang, et autres
Publié: (2026)
AnyExperts: On-Demand Expert Allocation for Multimodal Language Models with Mixture of Expert
par: Gao, Yuting, et autres
Publié: (2025)
par: Gao, Yuting, et autres
Publié: (2025)
Dynamic Expert-Guided Model Averaging for Causal Discovery
par: Tench, Adrick, et autres
Publié: (2026)
par: Tench, Adrick, et autres
Publié: (2026)
Feature-Guided Neighbor Selection for Non-Expert Evaluation of Model Predictions
par: Ford, Courtney, et autres
Publié: (2025)
par: Ford, Courtney, et autres
Publié: (2025)
Dynamic Experts Search: Enhancing Reasoning in Mixture-of-Experts LLMs at Test Time
par: Han, Yixuan, et autres
Publié: (2025)
par: Han, Yixuan, et autres
Publié: (2025)
From Guess2Graph: When and How Can Unreliable Experts Safely Boost Causal Discovery in Finite Samples?
par: Hiremath, Sujai, et autres
Publié: (2025)
par: Hiremath, Sujai, et autres
Publié: (2025)
ExpertGen: Scalable Sim-to-Real Expert Policy Learning from Imperfect Behavior Priors
par: Xu, Zifan, et autres
Publié: (2026)
par: Xu, Zifan, et autres
Publié: (2026)
The power of fine-grained experts: Granularity boosts expressivity in Mixture of Experts
par: Boix-Adsera, Enric, et autres
Publié: (2025)
par: Boix-Adsera, Enric, et autres
Publié: (2025)
Documents similaires
-
Limits of Actor-Critic Algorithms for Decision Tree Policies Learning in IBMDPs
par: Kohler, Hector, et autres
Publié: (2023) -
Interpretable and Editable Programmatic Tree Policies for Reinforcement Learning
par: Kohler, Hector, et autres
Publié: (2024) -
Evaluating Interpretable Reinforcement Learning by Distilling Policies into Programs
par: Kohler, Hector, et autres
Publié: (2025) -
PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning
par: Driss, Brahim, et autres
Publié: (2025) -
Breiman meets Bellman: Non-Greedy Decision Trees with MDPs
par: Kohler, Hector, et autres
Publié: (2023)