First-Explore, then Exploit: Meta-Learning to Solve Hard Exploration-Exploitation Trade-Offs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Norman, Ben, Clune, Jeff |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Thought Cloning: Learning to Think while Acting by Imitating Human Thinking
par: Hu, Shengran, et autres
Publié: (2023)
par: Hu, Shengran, et autres
Publié: (2023)
Automated Capability Discovery via Foundation Model Self-Exploration
par: Lu, Cong, et autres
Publié: (2025)
par: Lu, Cong, et autres
Publié: (2025)
Intelligent Go-Explore: Standing on the Shoulders of Giant Foundation Models
par: Lu, Cong, et autres
Publié: (2024)
par: Lu, Cong, et autres
Publié: (2024)
Foundation Model Self-Play: Open-Ended Strategy Innovation via Foundation Models
par: Dharna, Aaron, et autres
Publié: (2025)
par: Dharna, Aaron, et autres
Publié: (2025)
In-context Exploration-Exploitation for Reinforcement Learning
par: Dai, Zhenwen, et autres
Publié: (2024)
par: Dai, Zhenwen, et autres
Publié: (2024)
First-See-Then-Design: A Multi-Stakeholder View for Optimal Performance-Fairness Trade-Offs
par: Gupta, Kavya, et autres
Publié: (2026)
par: Gupta, Kavya, et autres
Publié: (2026)
OMNI: Open-endedness via Models of human Notions of Interestingness
par: Zhang, Jenny, et autres
Publié: (2023)
par: Zhang, Jenny, et autres
Publié: (2023)
Exploitation Is All You Need... for Exploration
par: Rentschler, Micah, et autres
Publié: (2025)
par: Rentschler, Micah, et autres
Publié: (2025)
Fairness-Accuracy Trade-Offs: A Causal Perspective
par: Plecko, Drago, et autres
Publié: (2024)
par: Plecko, Drago, et autres
Publié: (2024)
Pruning Extensions and Efficiency Trade-Offs for Sustainable Time Series Classification
par: Fischer, Raphael, et autres
Publié: (2026)
par: Fischer, Raphael, et autres
Publié: (2026)
Decoupling Exploration and Exploitation for Unsupervised Pre-training with Successor Features
par: Kim, JaeYoon, et autres
Publié: (2024)
par: Kim, JaeYoon, et autres
Publié: (2024)
ORBIT: On-policy Exploration-Exploitation for Controllable Multi-Budget Reasoning
par: Liang, Kun, et autres
Publié: (2026)
par: Liang, Kun, et autres
Publié: (2026)
Structured Exploration and Exploitation of Label Functions for Automated Data Annotation
par: Lam, Phong, et autres
Publié: (2026)
par: Lam, Phong, et autres
Publié: (2026)
Continual learning under domain transfer with sparse synaptic bursting
par: Beaulieu, Shawn L., et autres
Publié: (2021)
par: Beaulieu, Shawn L., et autres
Publié: (2021)
Envious Explore and Exploit
par: Ben-Porat, Omer, et autres
Publié: (2025)
par: Ben-Porat, Omer, et autres
Publié: (2025)
ETTRL: Balancing Exploration and Exploitation in LLM Test-Time Reinforcement Learning Via Entropy Mechanism
par: Liu, Jia, et autres
Publié: (2025)
par: Liu, Jia, et autres
Publié: (2025)
Controlling Exploration-Exploitation in GFlowNets via Markov Chain Perspectives
par: Chen, Lin, et autres
Publié: (2026)
par: Chen, Lin, et autres
Publié: (2026)
MESA: Cooperative Meta-Exploration in Multi-Agent Learning through Exploiting State-Action Space Structure
par: Zhang, Zhicheng, et autres
Publié: (2024)
par: Zhang, Zhicheng, et autres
Publié: (2024)
Co-Exploration and Co-Exploitation via Shared Structure in Multi-Task Bandits
par: Mukherjee, Sumantrak, et autres
Publié: (2025)
par: Mukherjee, Sumantrak, et autres
Publié: (2025)
Learning to Continually Learn via Meta-learning Agentic Memory Designs
par: Xiong, Yiming, et autres
Publié: (2026)
par: Xiong, Yiming, et autres
Publié: (2026)
Exploiting Meta-Learning-based Poisoning Attacks for Graph Link Prediction
par: Li, Mingchen, et autres
Publié: (2025)
par: Li, Mingchen, et autres
Publié: (2025)
Disentangling Exploration of Large Language Models by Optimal Exploitation
par: Grams, Tim, et autres
Publié: (2025)
par: Grams, Tim, et autres
Publié: (2025)
"Give Me BF16 or Give Me Death"? Accuracy-Performance Trade-Offs in LLM Quantization
par: Kurtic, Eldar, et autres
Publié: (2024)
par: Kurtic, Eldar, et autres
Publié: (2024)
DGRO: Enhancing LLM Reasoning via Exploration-Exploitation Control and Reward Variance Management
par: Su, Xuerui, et autres
Publié: (2025)
par: Su, Xuerui, et autres
Publié: (2025)
Beyond Behavioural Trade-Offs: Mechanistic Tracing of Pain-Pleasure Decisions in an LLM
par: Bianco, Francesca, et autres
Publié: (2026)
par: Bianco, Francesca, et autres
Publié: (2026)
Accuracy-Efficiency Trade-Offs in Spiking Neural Networks: A Lempel-Ziv Complexity Perspective on Learning Rules
par: Rudnicka, Zofia, et autres
Publié: (2025)
par: Rudnicka, Zofia, et autres
Publié: (2025)
Adaptive Data Exploitation in Deep Reinforcement Learning
par: Yuan, Mingqi, et autres
Publié: (2025)
par: Yuan, Mingqi, et autres
Publié: (2025)
Navigating the Exploration-Exploitation Tradeoff in Inference-Time Scaling of Diffusion Models
par: Su, Xun, et autres
Publié: (2025)
par: Su, Xun, et autres
Publié: (2025)
Metacognitive Capabilities of LLMs: An Exploration in Mathematical Problem Solving
par: Didolkar, Aniket, et autres
Publié: (2024)
par: Didolkar, Aniket, et autres
Publié: (2024)
Hypothesis Network Planned Exploration for Rapid Meta-Reinforcement Learning Adaptation
par: Jacobson, Maxwell Joseph, et autres
Publié: (2023)
par: Jacobson, Maxwell Joseph, et autres
Publié: (2023)
Exploring and Exploiting the Asymmetric Valley of Deep Neural Networks
par: Li, Xin-Chun, et autres
Publié: (2024)
par: Li, Xin-Chun, et autres
Publié: (2024)
The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery
par: Lu, Chris, et autres
Publié: (2024)
par: Lu, Chris, et autres
Publié: (2024)
SPAARS: Safer RL Policy Alignment through Abstract Exploration and Refined Exploitation of Action Space
par: K, Swaminathan S, et autres
Publié: (2026)
par: K, Swaminathan S, et autres
Publié: (2026)
Unearthing Skill-Level Insights for Understanding Trade-Offs of Foundation Models
par: Moayeri, Mazda, et autres
Publié: (2024)
par: Moayeri, Mazda, et autres
Publié: (2024)
Exploration vs Exploitation: Rethinking RLVR through Clipping, Entropy, and Spurious Reward
par: Chen, Peter, et autres
Publié: (2025)
par: Chen, Peter, et autres
Publié: (2025)
Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models
par: Chen, Zhipeng, et autres
Publié: (2025)
par: Chen, Zhipeng, et autres
Publié: (2025)
B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners
par: Zeng, Weihao, et autres
Publié: (2024)
par: Zeng, Weihao, et autres
Publié: (2024)
$ϕ$-Decoding: Adaptive Foresight Sampling for Balanced Inference-Time Exploration and Exploitation
par: Xu, Fangzhi, et autres
Publié: (2025)
par: Xu, Fangzhi, et autres
Publié: (2025)
Diffusion Augmented Agents: A Framework for Efficient Exploration and Transfer Learning
par: Di Palo, Norman, et autres
Publié: (2024)
par: Di Palo, Norman, et autres
Publié: (2024)
POPE: Learning to Reason on Hard Problems via Privileged On-Policy Exploration
par: Qu, Yuxiao, et autres
Publié: (2026)
par: Qu, Yuxiao, et autres
Publié: (2026)
Documents similaires
-
Thought Cloning: Learning to Think while Acting by Imitating Human Thinking
par: Hu, Shengran, et autres
Publié: (2023) -
Automated Capability Discovery via Foundation Model Self-Exploration
par: Lu, Cong, et autres
Publié: (2025) -
Intelligent Go-Explore: Standing on the Shoulders of Giant Foundation Models
par: Lu, Cong, et autres
Publié: (2024) -
Foundation Model Self-Play: Open-Ended Strategy Innovation via Foundation Models
par: Dharna, Aaron, et autres
Publié: (2025) -
In-context Exploration-Exploitation for Reinforcement Learning
par: Dai, Zhenwen, et autres
Publié: (2024)