Mitigating Value Hallucination in Dyna Planning via Multistep Predecessor Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Aminmansour, Farzane, Jafferjee, Taher, Imani, Ehsan, Talvitie, Erin, Bowling, Micheal, White, Martha |
|---|---|
| Format: | Preprint |
| Publié: |
2020
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Goal-Space Planning with Subgoal Models
par: Lo, Chunlok, et autres
Publié: (2022)
par: Lo, Chunlok, et autres
Publié: (2022)
Meta-Gradient Search Control: A Method for Improving the Efficiency of Dyna-style Planning
par: Burega, Bradley, et autres
Publié: (2024)
par: Burega, Bradley, et autres
Publié: (2024)
Real-Time Recurrent Learning using Trace Units in Reinforcement Learning
par: Elelimy, Esraa, et autres
Publié: (2024)
par: Elelimy, Esraa, et autres
Publié: (2024)
Investigating the Histogram Loss in Regression
par: Imani, Ehsan, et autres
Publié: (2024)
par: Imani, Ehsan, et autres
Publié: (2024)
Rethinking the Foundations for Continual Reinforcement Learning
par: Elelimy, Esraa, et autres
Publié: (2025)
par: Elelimy, Esraa, et autres
Publié: (2025)
Understanding the Staged Dynamics of Transformers in Learning Latent Structure
par: Saha, Rohan, et autres
Publié: (2025)
par: Saha, Rohan, et autres
Publié: (2025)
A Method for Evaluating Hyperparameter Sensitivity in Reinforcement Learning
par: Adkins, Jacob, et autres
Publié: (2024)
par: Adkins, Jacob, et autres
Publié: (2024)
A Generalized Projected Bellman Error for Off-policy Value Estimation in Reinforcement Learning
par: Patterson, Andrew, et autres
Publié: (2021)
par: Patterson, Andrew, et autres
Publié: (2021)
Hallucination Detection and Mitigation in Large Language Models
par: Pesaranghader, Ahmad, et autres
Publié: (2026)
par: Pesaranghader, Ahmad, et autres
Publié: (2026)
Bounding-Box Inference for Error-Aware Model-Based Reinforcement Learning
par: Talvitie, Erin J., et autres
Publié: (2024)
par: Talvitie, Erin J., et autres
Publié: (2024)
Physics-Informed Model and Hybrid Planning for Efficient Dyna-Style Reinforcement Learning
par: Asri, Zakariae El, et autres
Publié: (2024)
par: Asri, Zakariae El, et autres
Publié: (2024)
Value Bonuses using Ensemble Errors for Exploration in Reinforcement Learning
par: Wahab, Abdul, et autres
Publié: (2026)
par: Wahab, Abdul, et autres
Publié: (2026)
An Analysis of Action-Value Temporal-Difference Methods That Learn State Values
par: Daley, Brett, et autres
Publié: (2025)
par: Daley, Brett, et autres
Publié: (2025)
Mitigating Hallucinations in Large Language Models via Causal Reasoning
par: Li, Yuangang, et autres
Publié: (2025)
par: Li, Yuangang, et autres
Publié: (2025)
Mitigating LLM Hallucination via Behaviorally Calibrated Reinforcement Learning
par: Wu, Jiayun, et autres
Publié: (2025)
par: Wu, Jiayun, et autres
Publié: (2025)
Mitigating LLM Hallucinations via Conformal Abstention
par: Yadkori, Yasin Abbasi, et autres
Publié: (2024)
par: Yadkori, Yasin Abbasi, et autres
Publié: (2024)
A New View on Planning in Online Reinforcement Learning
par: Roice, Kevin, et autres
Publié: (2024)
par: Roice, Kevin, et autres
Publié: (2024)
Mitigating Hallucinated Translations in Large Language Models with Hallucination-focused Preference Optimization
par: Tang, Zilu, et autres
Publié: (2025)
par: Tang, Zilu, et autres
Publié: (2025)
DirectMultiStep: Direct Route Generation for Multistep Retrosynthesis
par: Shee, Yu, et autres
Publié: (2024)
par: Shee, Yu, et autres
Publié: (2024)
Multistep Distillation of Diffusion Models via Moment Matching
par: Salimans, Tim, et autres
Publié: (2024)
par: Salimans, Tim, et autres
Publié: (2024)
Revis: Sparse Latent Steering to Mitigate Object Hallucination in Large Vision-Language Models
par: Wu, Jialin, et autres
Publié: (2026)
par: Wu, Jialin, et autres
Publié: (2026)
Fine-Tuning without Performance Degradation
par: Wang, Han, et autres
Publié: (2025)
par: Wang, Han, et autres
Publié: (2025)
CPR: Mitigating Large Language Model Hallucinations with Curative Prompt Refinement
par: Shim, Jung-Woo, et autres
Publié: (2025)
par: Shim, Jung-Woo, et autres
Publié: (2025)
Self-contradictory Hallucinations of Large Language Models: Evaluation, Detection and Mitigation
par: Mündler, Niels, et autres
Publié: (2023)
par: Mündler, Niels, et autres
Publié: (2023)
Multi-stage Prompt Refinement for Mitigating Hallucinations in Large Language Models
par: Shim, Jung-Woo, et autres
Publié: (2025)
par: Shim, Jung-Woo, et autres
Publié: (2025)
KARL: Mitigating Hallucinations in LLMs via Knowledge-Boundary-Aware Reinforcement Learning
par: Gao, Cheng, et autres
Publié: (2026)
par: Gao, Cheng, et autres
Publié: (2026)
On the Interplay Between Sparsity and Training in Deep Reinforcement Learning
par: Davelouis, Fatima, et autres
Publié: (2025)
par: Davelouis, Fatima, et autres
Publié: (2025)
Proper Laplacian Representation Learning
par: Gomez, Diego, et autres
Publié: (2023)
par: Gomez, Diego, et autres
Publié: (2023)
IRIS: Implicit Reward-Guided Internal Sifting for Mitigating Multimodal Hallucination
par: Li, Yuanshuai, et autres
Publié: (2026)
par: Li, Yuanshuai, et autres
Publié: (2026)
Awakening Dormant Experts:Counterfactual Routing to Mitigate MoE Hallucinations
par: Hu, Wentao, et autres
Publié: (2026)
par: Hu, Wentao, et autres
Publié: (2026)
On Mitigating Code LLM Hallucinations with API Documentation
par: Jain, Nihal, et autres
Publié: (2024)
par: Jain, Nihal, et autres
Publié: (2024)
Generation Constraint Scaling Can Mitigate Hallucination
par: Kollias, Georgios, et autres
Publié: (2024)
par: Kollias, Georgios, et autres
Publié: (2024)
Laplacian Score Sharpening for Mitigating Hallucination in Diffusion Models
par: C, Barath Chandran., et autres
Publié: (2025)
par: C, Barath Chandran., et autres
Publié: (2025)
Mitigating Hallucinations via Inter-Layer Consistency Aggregation in Large Vision-Language Models
par: Tang, Kai, et autres
Publié: (2025)
par: Tang, Kai, et autres
Publié: (2025)
Faster Lifting for Ordered Domains with Predecessor Relations
par: Zou, Kuncheng, et autres
Publié: (2025)
par: Zou, Kuncheng, et autres
Publié: (2025)
ConVis: Contrastive Decoding with Hallucination Visualization for Mitigating Hallucinations in Multimodal Large Language Models
par: Park, Yeji, et autres
Publié: (2024)
par: Park, Yeji, et autres
Publié: (2024)
Uncertainty-Aware Fusion: An Ensemble Framework for Mitigating Hallucinations in Large Language Models
par: Dey, Prasenjit, et autres
Publié: (2025)
par: Dey, Prasenjit, et autres
Publié: (2025)
Empirical Design in Reinforcement Learning
par: Patterson, Andrew, et autres
Publié: (2023)
par: Patterson, Andrew, et autres
Publié: (2023)
Divide And Conquer: Learning Chaotic Dynamical Systems With Multistep Penalty Neural Ordinary Differential Equations
par: Chakraborty, Dibyajyoti, et autres
Publié: (2024)
par: Chakraborty, Dibyajyoti, et autres
Publié: (2024)
Learning Abstract World Model for Value-preserving Planning with Options
par: Rodriguez-Sanchez, Rafael, et autres
Publié: (2024)
par: Rodriguez-Sanchez, Rafael, et autres
Publié: (2024)
Documents similaires
-
Goal-Space Planning with Subgoal Models
par: Lo, Chunlok, et autres
Publié: (2022) -
Meta-Gradient Search Control: A Method for Improving the Efficiency of Dyna-style Planning
par: Burega, Bradley, et autres
Publié: (2024) -
Real-Time Recurrent Learning using Trace Units in Reinforcement Learning
par: Elelimy, Esraa, et autres
Publié: (2024) -
Investigating the Histogram Loss in Regression
par: Imani, Ehsan, et autres
Publié: (2024) -
Rethinking the Foundations for Continual Reinforcement Learning
par: Elelimy, Esraa, et autres
Publié: (2025)