Memex(RL): Scaling Long-Horizon LLM Agents via Indexed Experience Memory
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Zhenting, Chen, Huancheng, Wang, Jiayun, Wei, Wei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Scaling Long-Horizon LLM Agent via Context-Folding
di: Sun, Weiwei, et al.
Pubblicazione: (2025)
di: Sun, Weiwei, et al.
Pubblicazione: (2025)
MemAgent: Reshaping Long-Context LLM with Multi-Conv RL-based Memory Agent
di: Yu, Hongli, et al.
Pubblicazione: (2025)
di: Yu, Hongli, et al.
Pubblicazione: (2025)
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
di: Xi, Zhiheng, et al.
Pubblicazione: (2025)
di: Xi, Zhiheng, et al.
Pubblicazione: (2025)
DUMP: Automated Distribution-Level Curriculum Learning for RL-based LLM Post-training
di: Wang, Zhenting, et al.
Pubblicazione: (2025)
di: Wang, Zhenting, et al.
Pubblicazione: (2025)
Mem-T: Densifying Rewards for Long-Horizon Memory Agents
di: Yue, Yanwei, et al.
Pubblicazione: (2026)
di: Yue, Yanwei, et al.
Pubblicazione: (2026)
Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents
di: Wang, Jiawei, et al.
Pubblicazione: (2025)
di: Wang, Jiawei, et al.
Pubblicazione: (2025)
SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution
di: Wang, Hanlin, et al.
Pubblicazione: (2025)
di: Wang, Hanlin, et al.
Pubblicazione: (2025)
ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning
di: Lin, Zihan, et al.
Pubblicazione: (2026)
di: Lin, Zihan, et al.
Pubblicazione: (2026)
EnvFactory: Scaling Tool-Use Agents via Executable Environments Synthesis and Robust RL
di: Xu, Minrui, et al.
Pubblicazione: (2026)
di: Xu, Minrui, et al.
Pubblicazione: (2026)
LLM-AutoDP: Automatic Data Processing via LLM Agents for Model Fine-tuning
di: Huang, Wei, et al.
Pubblicazione: (2026)
di: Huang, Wei, et al.
Pubblicazione: (2026)
Why Reasoning Fails to Plan: A Planning-Centric Analysis of Long-Horizon Decision Making in LLM Agents
di: Wang, Zehong, et al.
Pubblicazione: (2026)
di: Wang, Zehong, et al.
Pubblicazione: (2026)
UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation
di: Wang, Jiayun, et al.
Pubblicazione: (2026)
di: Wang, Jiayun, et al.
Pubblicazione: (2026)
DuoGuard: A Two-Player RL-Driven Framework for Multilingual LLM Guardrails
di: Deng, Yihe, et al.
Pubblicazione: (2025)
di: Deng, Yihe, et al.
Pubblicazione: (2025)
EPO: Entropy-regularized Policy Optimization for LLM Agents Reinforcement Learning
di: Xu, Wujiang, et al.
Pubblicazione: (2025)
di: Xu, Wujiang, et al.
Pubblicazione: (2025)
AgentFold: Long-Horizon Web Agents with Proactive Context Management
di: Ye, Rui, et al.
Pubblicazione: (2025)
di: Ye, Rui, et al.
Pubblicazione: (2025)
WEBSERV: A Full-Stack and RL-Ready Web Environment for Training Web Agents at Scale
di: Lu, Yuxuan, et al.
Pubblicazione: (2025)
di: Lu, Yuxuan, et al.
Pubblicazione: (2025)
Endless Terminals: Scaling RL Environments for Terminal Agents
di: Gandhi, Kanishk, et al.
Pubblicazione: (2026)
di: Gandhi, Kanishk, et al.
Pubblicazione: (2026)
Stabilizing Off-Policy Training for Long-Horizon LLM Agent via Turn-Level Importance Sampling and Clipping-Triggered Normalization
di: Li, Chenliang, et al.
Pubblicazione: (2025)
di: Li, Chenliang, et al.
Pubblicazione: (2025)
Odysseys: Benchmarking Web Agents on Realistic Long Horizon Tasks
di: Jang, Lawrence Keunho, et al.
Pubblicazione: (2026)
di: Jang, Lawrence Keunho, et al.
Pubblicazione: (2026)
Sparse-RL: Breaking the Memory Wall in LLM Reinforcement Learning via Stable Sparse Rollouts
di: Luo, Sijia, et al.
Pubblicazione: (2026)
di: Luo, Sijia, et al.
Pubblicazione: (2026)
SELAUR: Self Evolving LLM Agent via Uncertainty-aware Rewards
di: Zhang, Dengjia, et al.
Pubblicazione: (2026)
di: Zhang, Dengjia, et al.
Pubblicazione: (2026)
Evaluating Very Long-Term Conversational Memory of LLM Agents
di: Maharana, Adyasha, et al.
Pubblicazione: (2024)
di: Maharana, Adyasha, et al.
Pubblicazione: (2024)
Save the Good Prefix: Precise Error Penalization via Process-Supervised RL to Enhance LLM Reasoning
di: Liu, Haolin, et al.
Pubblicazione: (2026)
di: Liu, Haolin, et al.
Pubblicazione: (2026)
Token-Budget-Aware LLM Reasoning
di: Han, Tingxu, et al.
Pubblicazione: (2024)
di: Han, Tingxu, et al.
Pubblicazione: (2024)
XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference
di: Li, Weizhuo, et al.
Pubblicazione: (2024)
di: Li, Weizhuo, et al.
Pubblicazione: (2024)
Evaluating Memory Structure in LLM Agents
di: Shutova, Alina, et al.
Pubblicazione: (2026)
di: Shutova, Alina, et al.
Pubblicazione: (2026)
Addressing Performance Saturation for LLM RL via Precise Entropy Curve Control
di: Li, Bolian, et al.
Pubblicazione: (2026)
di: Li, Bolian, et al.
Pubblicazione: (2026)
Collaborative Memory: Multi-User Memory Sharing in LLM Agents with Dynamic Access Control
di: Rezazadeh, Alireza, et al.
Pubblicazione: (2025)
di: Rezazadeh, Alireza, et al.
Pubblicazione: (2025)
Synthetic Computers at Scale for Long-Horizon Productivity Simulation
di: Ge, Tao, et al.
Pubblicazione: (2026)
di: Ge, Tao, et al.
Pubblicazione: (2026)
Scaling Optimal LR Across Token Horizons
di: Bjorck, Johan, et al.
Pubblicazione: (2024)
di: Bjorck, Johan, et al.
Pubblicazione: (2024)
Breaking Quadratic Barriers: A Non-Attention LLM for Ultra-Long Context Horizons
di: Kiruluta, Andrew, et al.
Pubblicazione: (2025)
di: Kiruluta, Andrew, et al.
Pubblicazione: (2025)
Demystifying Reinforcement Learning for Long-Horizon Tool-Using Agents: A Comprehensive Recipe
di: Wu, Xixi, et al.
Pubblicazione: (2026)
di: Wu, Xixi, et al.
Pubblicazione: (2026)
BroRL: Scaling Reinforcement Learning via Broadened Exploration
di: Hu, Jian, et al.
Pubblicazione: (2025)
di: Hu, Jian, et al.
Pubblicazione: (2025)
Patch the Distribution Mismatch: RL Rewriting Agent for Stable Off-Policy SFT
di: Wang, Jiacheng, et al.
Pubblicazione: (2026)
di: Wang, Jiacheng, et al.
Pubblicazione: (2026)
RL on Incorrect Synthetic Data Scales the Efficiency of LLM Math Reasoning by Eight-Fold
di: Setlur, Amrith, et al.
Pubblicazione: (2024)
di: Setlur, Amrith, et al.
Pubblicazione: (2024)
On Designing Effective RL Reward at Training Time for LLM Reasoning
di: Gao, Jiaxuan, et al.
Pubblicazione: (2024)
di: Gao, Jiaxuan, et al.
Pubblicazione: (2024)
DISA: Offline Importance Sampling for Distribution-Matching LLM-RL
di: Wang, Shaobo, et al.
Pubblicazione: (2026)
di: Wang, Shaobo, et al.
Pubblicazione: (2026)
Recursive Models for Long-Horizon Reasoning
di: Yang, Chenxiao, et al.
Pubblicazione: (2026)
di: Yang, Chenxiao, et al.
Pubblicazione: (2026)
ComoRAG: A Cognitive-Inspired Memory-Organized RAG for Stateful Long Narrative Reasoning
di: Wang, Juyuan, et al.
Pubblicazione: (2025)
di: Wang, Juyuan, et al.
Pubblicazione: (2025)
Scaling In-Context Online Learning Capability of LLMs via Cross-Episode Meta-RL
di: Lin, Xiaofeng, et al.
Pubblicazione: (2026)
di: Lin, Xiaofeng, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Scaling Long-Horizon LLM Agent via Context-Folding
di: Sun, Weiwei, et al.
Pubblicazione: (2025) -
MemAgent: Reshaping Long-Context LLM with Multi-Conv RL-based Memory Agent
di: Yu, Hongli, et al.
Pubblicazione: (2025) -
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
di: Xi, Zhiheng, et al.
Pubblicazione: (2025) -
DUMP: Automated Distribution-Level Curriculum Learning for RL-based LLM Post-training
di: Wang, Zhenting, et al.
Pubblicazione: (2025) -
Mem-T: Densifying Rewards for Long-Horizon Memory Agents
di: Yue, Yanwei, et al.
Pubblicazione: (2026)