When Can Model-Free Reinforcement Learning be Enough for Thinking?
Fuente:
arXiv
Salvato in:
| Autori principali: | Hanna, Josiah P., Corrado, Nicholas E. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Understanding when Dynamics-Invariant Data Augmentations Benefit Model-Free Reinforcement Learning Updates
di: Corrado, Nicholas E., et al.
Pubblicazione: (2023)
di: Corrado, Nicholas E., et al.
Pubblicazione: (2023)
Multi-Robot Collaboration through Reinforcement Learning and Abstract Simulation
di: Labiosa, Adam, et al.
Pubblicazione: (2025)
di: Labiosa, Adam, et al.
Pubblicazione: (2025)
On-Policy Policy Gradient Reinforcement Learning Without On-Policy Sampling
di: Corrado, Nicholas E., et al.
Pubblicazione: (2023)
di: Corrado, Nicholas E., et al.
Pubblicazione: (2023)
AdaptThink: Reasoning Models Can Learn When to Think
di: Zhang, Jiajie, et al.
Pubblicazione: (2025)
di: Zhang, Jiajie, et al.
Pubblicazione: (2025)
Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning
di: Xiang, Violet, et al.
Pubblicazione: (2025)
di: Xiang, Violet, et al.
Pubblicazione: (2025)
Distributionally Robust Multi-Task Reinforcement Learning via Adaptive Task Sampling
di: Corrado, Nicholas E., et al.
Pubblicazione: (2026)
di: Corrado, Nicholas E., et al.
Pubblicazione: (2026)
Reinforcement Learning via Auxiliary Task Distillation
di: Harish, Abhinav Narayan, et al.
Pubblicazione: (2024)
di: Harish, Abhinav Narayan, et al.
Pubblicazione: (2024)
When Is Enough Not Enough? Illusory Completion in Search Agents
di: Ko, Dayoon, et al.
Pubblicazione: (2026)
di: Ko, Dayoon, et al.
Pubblicazione: (2026)
Stable Offline Value Function Learning with Bisimulation-based Representations
di: Pavse, Brahma S., et al.
Pubblicazione: (2024)
di: Pavse, Brahma S., et al.
Pubblicazione: (2024)
Centralized Adaptive Sampling for Reliable Co-Training of Independent Multi-Agent Policies
di: Corrado, Nicholas E., et al.
Pubblicazione: (2025)
di: Corrado, Nicholas E., et al.
Pubblicazione: (2025)
Adaptive Exploration for Data-Efficient General Value Function Evaluations
di: Jain, Arushi, et al.
Pubblicazione: (2024)
di: Jain, Arushi, et al.
Pubblicazione: (2024)
Adversarial Agents: Black-Box Evasion Attacks with Reinforcement Learning
di: Domico, Kyle, et al.
Pubblicazione: (2025)
di: Domico, Kyle, et al.
Pubblicazione: (2025)
When Few Steps Are Enough: Training-Free Acceleration of Identity-Preserved Generation
di: Zheng, Dongqi
Pubblicazione: (2026)
di: Zheng, Dongqi
Pubblicazione: (2026)
When Can Large Reasoning Models Save Thinking? Mechanistic Analysis of Behavioral Divergence in Reasoning
di: Zhu, Rongzhi, et al.
Pubblicazione: (2025)
di: Zhu, Rongzhi, et al.
Pubblicazione: (2025)
Thinkless: LLM Learns When to Think
di: Fang, Gongfan, et al.
Pubblicazione: (2025)
di: Fang, Gongfan, et al.
Pubblicazione: (2025)
Base Models Know How to Reason, Thinking Models Learn When
di: Venhoff, Constantin, et al.
Pubblicazione: (2025)
di: Venhoff, Constantin, et al.
Pubblicazione: (2025)
Cognitive Decision Routing in Large Language Models: When to Think Fast, When to Think Slow
di: Du, Y., et al.
Pubblicazione: (2025)
di: Du, Y., et al.
Pubblicazione: (2025)
Memory Retention Is Not Enough to Master Memory Tasks in Reinforcement Learning
di: Shchendrigin, Oleg, et al.
Pubblicazione: (2026)
di: Shchendrigin, Oleg, et al.
Pubblicazione: (2026)
How Much Thinking is Enough? Quantifying and Understanding Redundancy in LLM Reasoning
di: Zhai, Zhiyuan, et al.
Pubblicazione: (2026)
di: Zhai, Zhiyuan, et al.
Pubblicazione: (2026)
An Empirical Study on the Power of Future Prediction in Partially Observable Environments
di: Kwon, Jeongyeol, et al.
Pubblicazione: (2024)
di: Kwon, Jeongyeol, et al.
Pubblicazione: (2024)
Think in Games: Learning to Reason in Games via Reinforcement Learning with Large Language Models
di: Liao, Yi, et al.
Pubblicazione: (2025)
di: Liao, Yi, et al.
Pubblicazione: (2025)
How Clinicians Think and What AI Can Learn From It
di: Sengupta, Dipayan, et al.
Pubblicazione: (2026)
di: Sengupta, Dipayan, et al.
Pubblicazione: (2026)
Guided Data Augmentation for Offline Reinforcement Learning and Imitation Learning
di: Corrado, Nicholas E., et al.
Pubblicazione: (2023)
di: Corrado, Nicholas E., et al.
Pubblicazione: (2023)
Thinking-Based Non-Thinking: Solving the Reward Hacking Problem in Training Hybrid Reasoning Models via Reinforcement Learning
di: Gan, Siyuan, et al.
Pubblicazione: (2026)
di: Gan, Siyuan, et al.
Pubblicazione: (2026)
Does Your Reasoning Model Implicitly Know When to Stop Thinking?
di: Huang, Zixuan, et al.
Pubblicazione: (2026)
di: Huang, Zixuan, et al.
Pubblicazione: (2026)
Reasoning Models Can Be Effective Without Thinking
di: Ma, Wenjie, et al.
Pubblicazione: (2025)
di: Ma, Wenjie, et al.
Pubblicazione: (2025)
Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation
di: Zhou, Hongyi, et al.
Pubblicazione: (2025)
di: Zhou, Hongyi, et al.
Pubblicazione: (2025)
When Alignment Isn't Enough: Response-Path Attacks on LLM Agents
di: Luo, Mingyu, et al.
Pubblicazione: (2026)
di: Luo, Mingyu, et al.
Pubblicazione: (2026)
Think Just Enough: Sequence-Level Entropy as a Confidence Signal for LLM Reasoning
di: Sharma, Aman, et al.
Pubblicazione: (2025)
di: Sharma, Aman, et al.
Pubblicazione: (2025)
When to Think Fast and Slow? AMOR: Adaptive Entropy Gate for Hybrid Models
di: Zheng, Haoran, et al.
Pubblicazione: (2026)
di: Zheng, Haoran, et al.
Pubblicazione: (2026)
A Unified Deep Reinforcement Learning Approach for Close Enough Traveling Salesman Problem
di: Fan, Mingfeng, et al.
Pubblicazione: (2025)
di: Fan, Mingfeng, et al.
Pubblicazione: (2025)
Language Models for Text Classification: Is In-Context Learning Enough?
di: Edwards, Aleksandra, et al.
Pubblicazione: (2024)
di: Edwards, Aleksandra, et al.
Pubblicazione: (2024)
Training Emergent Joint Associations: A Reinforcement Learning Approach to Creative Thinking in Language Models
di: Singh, Mukul, et al.
Pubblicazione: (2025)
di: Singh, Mukul, et al.
Pubblicazione: (2025)
When Less is Enough: Efficient Inference via Collaborative Reasoning
di: Chen, Yilei, et al.
Pubblicazione: (2026)
di: Chen, Yilei, et al.
Pubblicazione: (2026)
Learning When to Think While Listening in Large Audio-Language Models
di: Song, Zhiyuan, et al.
Pubblicazione: (2026)
di: Song, Zhiyuan, et al.
Pubblicazione: (2026)
When Should a Robot Think? Resource-Aware Reasoning via Reinforcement Learning for Embodied Robotic Decision-Making
di: Liu, Jun, et al.
Pubblicazione: (2026)
di: Liu, Jun, et al.
Pubblicazione: (2026)
Reward Is Enough: LLMs Are In-Context Reinforcement Learners
di: Song, Kefan, et al.
Pubblicazione: (2025)
di: Song, Kefan, et al.
Pubblicazione: (2025)
When to Continue Thinking: Adaptive Thinking Mode Switching for Efficient Reasoning
di: Zhang, Xiaoyun, et al.
Pubblicazione: (2025)
di: Zhang, Xiaoyun, et al.
Pubblicazione: (2025)
Sparsely Multimodal Data Fusion
di: Bjorgaard, Josiah
Pubblicazione: (2024)
di: Bjorgaard, Josiah
Pubblicazione: (2024)
When Cloud Agents Meet Device Agents: Lessons from Hybrid Multi-Agent Systems
di: Rainone, Corrado, et al.
Pubblicazione: (2026)
di: Rainone, Corrado, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Understanding when Dynamics-Invariant Data Augmentations Benefit Model-Free Reinforcement Learning Updates
di: Corrado, Nicholas E., et al.
Pubblicazione: (2023) -
Multi-Robot Collaboration through Reinforcement Learning and Abstract Simulation
di: Labiosa, Adam, et al.
Pubblicazione: (2025) -
On-Policy Policy Gradient Reinforcement Learning Without On-Policy Sampling
di: Corrado, Nicholas E., et al.
Pubblicazione: (2023) -
AdaptThink: Reasoning Models Can Learn When to Think
di: Zhang, Jiajie, et al.
Pubblicazione: (2025) -
Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning
di: Xiang, Violet, et al.
Pubblicazione: (2025)