Learning to Remember: End-to-End Training of Memory Agents for Long-Context Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Kehao, Gui, Shangtong, Yang, Sheng, Chen, Wei, Feng, Yang |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration
par: Wen, Zhuofan, et autres
Publié: (2024)
par: Wen, Zhuofan, et autres
Publié: (2024)
PSO-Merging: Merging Models Based on Particle Swarm Optimization
par: Zhang, Kehao, et autres
Publié: (2025)
par: Zhang, Kehao, et autres
Publié: (2025)
Choosing How to Remember: Adaptive Memory Structures for LLM Agents
par: Lu, Mingfei, et autres
Publié: (2026)
par: Lu, Mingfei, et autres
Publié: (2026)
End-to-End Learning for Partially-Observed Time Series with PyPOTS
par: Du, Wenjie, et autres
Publié: (2026)
par: Du, Wenjie, et autres
Publié: (2026)
An End-to-End Learning Approach for Solving Capacitated Location-Routing Problems
par: Miao, Changhao, et autres
Publié: (2025)
par: Miao, Changhao, et autres
Publié: (2025)
End-to-End On-Device Quantization-Aware Training for LLMs at Inference Cost
par: Tan, Qitao, et autres
Publié: (2025)
par: Tan, Qitao, et autres
Publié: (2025)
End-to-End Optimization of LLM-Driven Multi-Agent Search Systems via Heterogeneous-Group-Based Reinforcement Learning
par: Chen, Guanzhong, et autres
Publié: (2025)
par: Chen, Guanzhong, et autres
Publié: (2025)
Counterfactual Explanations for Continuous Action Reinforcement Learning
par: Dong, Shuyang, et autres
Publié: (2025)
par: Dong, Shuyang, et autres
Publié: (2025)
SlimPipe: Memory-Thrifty and Efficient Pipeline Parallelism for Long-Context LLM Training
par: Li, Zhouyang, et autres
Publié: (2025)
par: Li, Zhouyang, et autres
Publié: (2025)
Self-Evolving Recommendation System: End-To-End Autonomous Model Optimization With LLM Agents
par: Wang, Haochen, et autres
Publié: (2026)
par: Wang, Haochen, et autres
Publié: (2026)
HabitatAgent: An End-to-End Multi-Agent System for Housing Consultation
par: Yang, Hongyang, et autres
Publié: (2026)
par: Yang, Hongyang, et autres
Publié: (2026)
Muon Outperforms Adam in Tail-End Associative Memory Learning
par: Wang, Shuche, et autres
Publié: (2025)
par: Wang, Shuche, et autres
Publié: (2025)
Bridging the Divide: End-to-End Sequence-Graph Learning
par: Chen, Yuen, et autres
Publié: (2025)
par: Chen, Yuen, et autres
Publié: (2025)
Dynamic Long Context Reasoning over Compressed Memory via End-to-End Reinforcement Learning
par: Chen, Zhuoen, et autres
Publié: (2026)
par: Chen, Zhuoen, et autres
Publié: (2026)
Almost Sure Convergence of Linear Temporal Difference Learning with Arbitrary Features
par: Wang, Jiuqi, et autres
Publié: (2024)
par: Wang, Jiuqi, et autres
Publié: (2024)
MASteer: Multi-Agent Adaptive Steer Strategy for End-to-End LLM Trustworthiness Repair
par: Li, Changqing, et autres
Publié: (2025)
par: Li, Changqing, et autres
Publié: (2025)
MemAgent: Reshaping Long-Context LLM with Multi-Conv RL-based Memory Agent
par: Yu, Hongli, et autres
Publié: (2025)
par: Yu, Hongli, et autres
Publié: (2025)
BPQP: A Differentiable Convex Optimization Framework for Efficient End-to-End Learning
par: Pan, Jianming, et autres
Publié: (2024)
par: Pan, Jianming, et autres
Publié: (2024)
An End-to-End Deep Reinforcement Learning Approach for Solving the Traveling Salesman Problem with Drones
par: Zeng, Taihelong, et autres
Publié: (2025)
par: Zeng, Taihelong, et autres
Publié: (2025)
ImplicitRDP: An End-to-End Visual-Force Diffusion Policy with Structural Slow-Fast Learning
par: Chen, Wendi, et autres
Publié: (2025)
par: Chen, Wendi, et autres
Publié: (2025)
End-To-End Learning of Gaussian Mixture Priors for Diffusion Sampler
par: Blessing, Denis, et autres
Publié: (2025)
par: Blessing, Denis, et autres
Publié: (2025)
MKA: Memory-Keyed Attention for Efficient Long-Context Reasoning
par: Liu, Dong, et autres
Publié: (2026)
par: Liu, Dong, et autres
Publié: (2026)
The ODE Method for Stochastic Approximation and Reinforcement Learning with Markovian Noise
par: Liu, Shuze Daniel, et autres
Publié: (2024)
par: Liu, Shuze Daniel, et autres
Publié: (2024)
Evaluating Long-Context Reasoning in LLM-Based WebAgents
par: Chung, Andy, et autres
Publié: (2025)
par: Chung, Andy, et autres
Publié: (2025)
Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models
par: Hsiao, Chi-Yuan, et autres
Publié: (2025)
par: Hsiao, Chi-Yuan, et autres
Publié: (2025)
SacFL: Self-Adaptive Federated Continual Learning for Resource-Constrained End Devices
par: Zhong, Zhengyi, et autres
Publié: (2025)
par: Zhong, Zhengyi, et autres
Publié: (2025)
GinAR: An End-To-End Multivariate Time Series Forecasting Model Suitable for Variable Missing
par: Yu, Chengqing, et autres
Publié: (2024)
par: Yu, Chengqing, et autres
Publié: (2024)
Training and Simulation of Quadrupedal Robot in Adaptive Stair Climbing for Indoor Firefighting: An End-to-End Reinforcement Learning Approach
par: Huang, Baixiao, et autres
Publié: (2026)
par: Huang, Baixiao, et autres
Publié: (2026)
EvaDrive: Evolutionary Adversarial Policy Optimization for End-to-End Autonomous Driving
par: Jiao, Siwen, et autres
Publié: (2025)
par: Jiao, Siwen, et autres
Publié: (2025)
Identifying Functionally Important Features with End-to-End Sparse Dictionary Learning
par: Braun, Dan, et autres
Publié: (2024)
par: Braun, Dan, et autres
Publié: (2024)
Learning to be Smooth: An End-to-End Differentiable Particle Smoother
par: Younis, Ali, et autres
Publié: (2025)
par: Younis, Ali, et autres
Publié: (2025)
L-MoE: End-to-End Training of a Lightweight Mixture of Low-Rank Adaptation Experts
par: Ji, Shihao, et autres
Publié: (2025)
par: Ji, Shihao, et autres
Publié: (2025)
Relax: Composable Abstractions for End-to-End Dynamic Machine Learning
par: Lai, Ruihang, et autres
Publié: (2023)
par: Lai, Ruihang, et autres
Publié: (2023)
An End-to-End Reinforcement Learning Based Approach for Micro-View Order-Dispatching in Ride-Hailing
par: Yue, Xinlang, et autres
Publié: (2024)
par: Yue, Xinlang, et autres
Publié: (2024)
Predictive Concept Decoders: Training Scalable End-to-End Interpretability Assistants
par: Huang, Vincent, et autres
Publié: (2025)
par: Huang, Vincent, et autres
Publié: (2025)
Conditional Rectified Flow-based End-to-End Rapid Seismic Inversion Method
par: Xu, Haofei, et autres
Publié: (2026)
par: Xu, Haofei, et autres
Publié: (2026)
DISCO: An End-to-End Bandit Framework for Personalised Discount Allocation
par: Zhang, Jason Shuo, et autres
Publié: (2024)
par: Zhang, Jason Shuo, et autres
Publié: (2024)
Almost Sure Convergence of Differential Temporal Difference Learning for Average Reward Markov Decision Processes
par: Blaser, Ethan, et autres
Publié: (2026)
par: Blaser, Ethan, et autres
Publié: (2026)
Linear $Q$-Learning Does Not Diverge in $L^2$: Convergence Rates to a Bounded Set
par: Liu, Xinyu, et autres
Publié: (2025)
par: Liu, Xinyu, et autres
Publié: (2025)
Unleashing the Potential of Diffusion Models for End-to-End Autonomous Driving
par: Zheng, Yinan, et autres
Publié: (2026)
par: Zheng, Yinan, et autres
Publié: (2026)
Documents similaires
-
Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration
par: Wen, Zhuofan, et autres
Publié: (2024) -
PSO-Merging: Merging Models Based on Particle Swarm Optimization
par: Zhang, Kehao, et autres
Publié: (2025) -
Choosing How to Remember: Adaptive Memory Structures for LLM Agents
par: Lu, Mingfei, et autres
Publié: (2026) -
End-to-End Learning for Partially-Observed Time Series with PyPOTS
par: Du, Wenjie, et autres
Publié: (2026) -
An End-to-End Learning Approach for Solving Capacitated Location-Routing Problems
par: Miao, Changhao, et autres
Publié: (2025)