Reasoning Cache: Continual Improvement Over Long Horizons via Short-Horizon RL
Fuente:
arXiv
Guardado en:
| Autores principales: | Wu, Ian, Qu, Yuxiao, Setlur, Amrith, Kumar, Aviral |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
POPE: Learning to Reason on Hard Problems via Privileged On-Policy Exploration
por: Qu, Yuxiao, et al.
Publicado: (2026)
por: Qu, Yuxiao, et al.
Publicado: (2026)
Scaling Test-Time Compute Without Verification or RL is Suboptimal
por: Setlur, Amrith, et al.
Publicado: (2025)
por: Setlur, Amrith, et al.
Publicado: (2025)
RL on Incorrect Synthetic Data Scales the Efficiency of LLM Math Reasoning by Eight-Fold
por: Setlur, Amrith, et al.
Publicado: (2024)
por: Setlur, Amrith, et al.
Publicado: (2024)
RLAD: Training LLMs to Discover Abstractions for Solving Reasoning Problems
por: Qu, Yuxiao, et al.
Publicado: (2025)
por: Qu, Yuxiao, et al.
Publicado: (2025)
InT: Self-Proposed Interventions Enable Credit Assignment in LLM Reasoning
por: Yang, Matthew Y. R., et al.
Publicado: (2026)
por: Yang, Matthew Y. R., et al.
Publicado: (2026)
QED-Nano: Teaching a Tiny Model to Prove Hard Theorems
por: LM-Provers, et al.
Publicado: (2026)
por: LM-Provers, et al.
Publicado: (2026)
Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning
por: Qu, Yuxiao, et al.
Publicado: (2025)
por: Qu, Yuxiao, et al.
Publicado: (2025)
Horizon Reduction Makes RL Scalable
por: Park, Seohong, et al.
Publicado: (2025)
por: Park, Seohong, et al.
Publicado: (2025)
What Do Learning Dynamics Reveal About Generalization in LLM Reasoning?
por: Kang, Katie, et al.
Publicado: (2024)
por: Kang, Katie, et al.
Publicado: (2024)
IsoCompute Playbook: Optimally Scaling Sampling Compute for LLM RL
por: Cheng, Zhoujun, et al.
Publicado: (2026)
por: Cheng, Zhoujun, et al.
Publicado: (2026)
RaC: Robot Learning for Long-Horizon Tasks by Scaling Recovery and Correction
por: Hu, Zheyuan, et al.
Publicado: (2025)
por: Hu, Zheyuan, et al.
Publicado: (2025)
Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning
por: Setlur, Amrith, et al.
Publicado: (2024)
por: Setlur, Amrith, et al.
Publicado: (2024)
e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs
por: Setlur, Amrith, et al.
Publicado: (2025)
por: Setlur, Amrith, et al.
Publicado: (2025)
GR-RL: Going Dexterous and Precise for Long-Horizon Robotic Manipulation
por: Li, Yunfei, et al.
Publicado: (2025)
por: Li, Yunfei, et al.
Publicado: (2025)
Lower Bounds for Public-Private Learning under Distribution Shift
por: Setlur, Amrith, et al.
Publicado: (2025)
por: Setlur, Amrith, et al.
Publicado: (2025)
SideQuest: Model-Driven KV Cache Management for Long-Horizon Agentic Reasoning
por: Kariyappa, Sanjay, et al.
Publicado: (2026)
por: Kariyappa, Sanjay, et al.
Publicado: (2026)
Reuse your FLOPs: Scaling RL on Hard Problems by Conditioning on Very Off-Policy Prefixes
por: Setlur, Amrith, et al.
Publicado: (2026)
por: Setlur, Amrith, et al.
Publicado: (2026)
Deep Neural Networks Tend To Extrapolate Predictably
por: Kang, Katie, et al.
Publicado: (2023)
por: Kang, Katie, et al.
Publicado: (2023)
Exact Unlearning of Finetuning Data via Model Merging at Scale
por: Kuo, Kevin, et al.
Publicado: (2025)
por: Kuo, Kevin, et al.
Publicado: (2025)
Recursive Models for Long-Horizon Reasoning
por: Yang, Chenxiao, et al.
Publicado: (2026)
por: Yang, Chenxiao, et al.
Publicado: (2026)
Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction
por: Shen, Junhong, et al.
Publicado: (2025)
por: Shen, Junhong, et al.
Publicado: (2025)
On the Benefits of Public Representations for Private Transfer Learning under Distribution Shift
por: Thaker, Pratiksha, et al.
Publicado: (2023)
por: Thaker, Pratiksha, et al.
Publicado: (2023)
Memex(RL): Scaling Long-Horizon LLM Agents via Indexed Experience Memory
por: Wang, Zhenting, et al.
Publicado: (2026)
por: Wang, Zhenting, et al.
Publicado: (2026)
Feasibility-Aware Pessimistic Estimation: Toward Long-Horizon Safety in Offline RL
por: Tao, Zhikun
Publicado: (2025)
por: Tao, Zhikun
Publicado: (2025)
The Optimal Token Baseline: Variance Reduction for Long-Horizon LLM-RL
por: Li, Yingru, et al.
Publicado: (2026)
por: Li, Yingru, et al.
Publicado: (2026)
Recursive Introspection: Teaching Language Model Agents How to Self-Improve
por: Qu, Yuxiao, et al.
Publicado: (2024)
por: Qu, Yuxiao, et al.
Publicado: (2024)
Bridging RL Theory and Practice with the Effective Horizon
por: Laidlaw, Cassidy, et al.
Publicado: (2023)
por: Laidlaw, Cassidy, et al.
Publicado: (2023)
LongCoT: Benchmarking Long-Horizon Chain-of-Thought Reasoning
por: Motwani, Sumeet Ramesh, et al.
Publicado: (2026)
por: Motwani, Sumeet Ramesh, et al.
Publicado: (2026)
Chain-of-Goals Hierarchical Policy for Long-Horizon Offline Goal-Conditioned RL
por: Choi, Jinwoo, et al.
Publicado: (2026)
por: Choi, Jinwoo, et al.
Publicado: (2026)
Efficient Long-Horizon GUI Agents via Training-Free KV Cache Compression
por: Zhou, Bowen, et al.
Publicado: (2026)
por: Zhou, Bowen, et al.
Publicado: (2026)
MARPLE: A Benchmark for Long-Horizon Inference
por: Jin, Emily, et al.
Publicado: (2024)
por: Jin, Emily, et al.
Publicado: (2024)
ELMUR: External Layer Memory with Update/Rewrite for Long-Horizon RL Problems
por: Cherepanov, Egor, et al.
Publicado: (2025)
por: Cherepanov, Egor, et al.
Publicado: (2025)
Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models
por: Hong, Ilgee, et al.
Publicado: (2025)
por: Hong, Ilgee, et al.
Publicado: (2025)
TiRex: Zero-Shot Forecasting Across Long and Short Horizons with Enhanced In-Context Learning
por: Auer, Andreas, et al.
Publicado: (2025)
por: Auer, Andreas, et al.
Publicado: (2025)
Learning-Guided Rolling Horizon Optimization for Long-Horizon Flexible Job-Shop Scheduling
por: Li, Sirui, et al.
Publicado: (2025)
por: Li, Sirui, et al.
Publicado: (2025)
CaRT: Teaching LLM Agents to Know When They Know Enough
por: Liu, Grace, et al.
Publicado: (2025)
por: Liu, Grace, et al.
Publicado: (2025)
Prune-OPD: Efficient and Reliable On-Policy Distillation for Long-Horizon Reasoning
por: Yang, Zhicheng, et al.
Publicado: (2026)
por: Yang, Zhicheng, et al.
Publicado: (2026)
CONF-KV: Confidence-Aware KV Cache Eviction with Mixed-Precision Storage for Long-Horizon LLM
por: Li, Yubo, et al.
Publicado: (2026)
por: Li, Yubo, et al.
Publicado: (2026)
Multitask Learning Can Improve Worst-Group Outcomes
por: Kulkarni, Atharva, et al.
Publicado: (2023)
por: Kulkarni, Atharva, et al.
Publicado: (2023)
floq: Training Critics via Flow-Matching for Scaling Compute in Value-Based RL
por: Agrawalla, Bhavya, et al.
Publicado: (2025)
por: Agrawalla, Bhavya, et al.
Publicado: (2025)
Ejemplares similares
-
POPE: Learning to Reason on Hard Problems via Privileged On-Policy Exploration
por: Qu, Yuxiao, et al.
Publicado: (2026) -
Scaling Test-Time Compute Without Verification or RL is Suboptimal
por: Setlur, Amrith, et al.
Publicado: (2025) -
RL on Incorrect Synthetic Data Scales the Efficiency of LLM Math Reasoning by Eight-Fold
por: Setlur, Amrith, et al.
Publicado: (2024) -
RLAD: Training LLMs to Discover Abstractions for Solving Reasoning Problems
por: Qu, Yuxiao, et al.
Publicado: (2025) -
InT: Self-Proposed Interventions Enable Credit Assignment in LLM Reasoning
por: Yang, Matthew Y. R., et al.
Publicado: (2026)