Evaluating Memory in LLM Agents via Incremental Multi-Turn Interactions
Fuente:
arXiv
Saved in:
| Main Authors: | Hu, Yuanzhe, Wang, Yu, McAuley, Julian |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
BiasEdit: Debiasing Stereotyped Language Models via Model Editing
by: Xu, Xin, et al.
Published: (2025)
by: Xu, Xin, et al.
Published: (2025)
Evaluating Large Language Models as Generative User Simulators for Conversational Recommendation
by: Yoon, Se-eun, et al.
Published: (2024)
by: Yoon, Se-eun, et al.
Published: (2024)
ThinkRouter: Efficient Reasoning via Routing Thinking between Latent and Discrete Spaces
by: Xu, Xin, et al.
Published: (2026)
by: Xu, Xin, et al.
Published: (2026)
Pluralistic Off-policy Evaluation and Alignment
by: Huang, Chengkai, et al.
Published: (2025)
by: Huang, Chengkai, et al.
Published: (2025)
Cognitive Bias in Decision-Making with LLMs
by: Echterhoff, Jessica, et al.
Published: (2024)
by: Echterhoff, Jessica, et al.
Published: (2024)
Mem-α: Learning Memory Construction via Reinforcement Learning
by: Wang, Yu, et al.
Published: (2025)
by: Wang, Yu, et al.
Published: (2025)
Embedding-Informed Adaptive Retrieval-Augmented Generation of Large Language Models
by: Huang, Chengkai, et al.
Published: (2024)
by: Huang, Chengkai, et al.
Published: (2024)
Learning to Hint for Reinforcement Learning
by: Xia, Yu, et al.
Published: (2026)
by: Xia, Yu, et al.
Published: (2026)
A Comprehensive Evaluation of LLM Unlearning Robustness under Multi-Turn Interaction
by: Pan, Ruihao, et al.
Published: (2026)
by: Pan, Ruihao, et al.
Published: (2026)
Evaluating LLM-based Agents for Multi-Turn Conversations: A Survey
by: Guan, Shengyue, et al.
Published: (2025)
by: Guan, Shengyue, et al.
Published: (2025)
Masking Stale Observations Helps Search Agents -- Until It Doesn't: A Regime Map and Its Mechanism
by: Zhang, Haoxiang, et al.
Published: (2026)
by: Zhang, Haoxiang, et al.
Published: (2026)
M+: Extending MemoryLLM with Scalable Long-Term Memory
by: Wang, Yu, et al.
Published: (2025)
by: Wang, Yu, et al.
Published: (2025)
MIRIX: Multi-Agent Memory System for LLM-Based Agents
by: Wang, Yu, et al.
Published: (2025)
by: Wang, Yu, et al.
Published: (2025)
SKG-Eval: Stateful Evaluation of Multi-Turn Dialogue via Incremental Semantic Knowledge Graphs
by: Shil, Avijit, et al.
Published: (2026)
by: Shil, Avijit, et al.
Published: (2026)
Beyond Chain-of-Thought: A Survey of Chain-of-X Paradigms for LLMs
by: Xia, Yu, et al.
Published: (2024)
by: Xia, Yu, et al.
Published: (2024)
Pctx: Tokenizing Personalized Context for Generative Recommendation
by: Zhong, Qiyong, et al.
Published: (2025)
by: Zhong, Qiyong, et al.
Published: (2025)
Quantifying Cognitive Bias Induction in LLM-Generated Content
by: Alessa, Abeer, et al.
Published: (2025)
by: Alessa, Abeer, et al.
Published: (2025)
A Low-Latency Fraud Detection Layer for Detecting Adversarial Interaction Patterns in LLM-Powered Agents
by: Yu, Sheldon, et al.
Published: (2026)
by: Yu, Sheldon, et al.
Published: (2026)
Drift No More? Context Equilibria in Multi-Turn LLM Interactions
by: Dongre, Vardhan, et al.
Published: (2025)
by: Dongre, Vardhan, et al.
Published: (2025)
Forecasting Live Chat Intent from Browsing History
by: Yoon, Se-eun, et al.
Published: (2024)
by: Yoon, Se-eun, et al.
Published: (2024)
RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning
by: Wang, Zihan, et al.
Published: (2025)
by: Wang, Zihan, et al.
Published: (2025)
Explainable Chain-of-Thought Reasoning: An Empirical Analysis on State-Aware Reasoning Dynamics
by: Yu, Sheldon, et al.
Published: (2025)
by: Yu, Sheldon, et al.
Published: (2025)
Drift-Bench: Diagnosing Cooperative Breakdowns in LLM Agents under Input Faults via Multi-Turn Interaction
by: Bao, Han, et al.
Published: (2026)
by: Bao, Han, et al.
Published: (2026)
BiasFreeBench: a Benchmark for Mitigating Bias in Large Language Model Responses
by: Xu, Xin, et al.
Published: (2025)
by: Xu, Xin, et al.
Published: (2025)
Adaptive Stopping for Multi-Turn LLM Reasoning
by: Zhou, Xiaofan, et al.
Published: (2026)
by: Zhou, Xiaofan, et al.
Published: (2026)
Thinker: Training LLMs in Hierarchical Thinking for Deep Search via Multi-Turn Interaction
by: Xu, Jun, et al.
Published: (2025)
by: Xu, Jun, et al.
Published: (2025)
CostBench: Evaluating Multi-Turn Cost-Optimal Planning and Adaptation in Dynamic Environments for LLM Tool-Use Agents
by: Liu, Jiayu, et al.
Published: (2025)
by: Liu, Jiayu, et al.
Published: (2025)
StoryBench: A Dynamic Benchmark for Evaluating Long-Term Memory with Multi Turns
by: Wan, Luanbo, et al.
Published: (2025)
by: Wan, Luanbo, et al.
Published: (2025)
Reindex-Then-Adapt: Improving Large Language Models for Conversational Recommendation
by: He, Zhankui, et al.
Published: (2024)
by: He, Zhankui, et al.
Published: (2024)
Offline Policy Evaluation of Multi-Turn LLM Health Coaching with Real Users
by: Ozolcer, Melik, et al.
Published: (2025)
by: Ozolcer, Melik, et al.
Published: (2025)
Locomo-Plus: Beyond-Factual Cognitive Memory Evaluation Framework for LLM Agents
by: Li, Yifei, et al.
Published: (2026)
by: Li, Yifei, et al.
Published: (2026)
LLM-Driven Multi-Turn Task-Oriented Dialogue Synthesis for Realistic Reasoning
by: Zhu, Yu, et al.
Published: (2026)
by: Zhu, Yu, et al.
Published: (2026)
MTRouter: Cost-Aware Multi-Turn LLM Routing with History-Model Joint Embeddings
by: Zhang, Yiqun, et al.
Published: (2026)
by: Zhang, Yiqun, et al.
Published: (2026)
MemoryArena: Benchmarking Agent Memory in Interdependent Multi-Session Agentic Tasks
by: He, Zexue, et al.
Published: (2026)
by: He, Zexue, et al.
Published: (2026)
Beyond Single-Turn: A Survey on Multi-Turn Interactions with Large Language Models
by: Li, Yubo, et al.
Published: (2025)
by: Li, Yubo, et al.
Published: (2025)
DPRF: A Generalizable Dynamic Persona Refinement Framework for Optimizing Behavior Alignment Between Personalized LLM Role-Playing Agents and Humans
by: Yao, Bingsheng, et al.
Published: (2025)
by: Yao, Bingsheng, et al.
Published: (2025)
OnePred: Next-Query Prediction via Recursive Intent Memory in Multi-Turn Conversations
by: Chen, Jiangwang, et al.
Published: (2026)
by: Chen, Jiangwang, et al.
Published: (2026)
TSR: Trajectory-Search Rollouts for Multi-Turn RL of LLM Agents
by: Djuhera, Aladin, et al.
Published: (2026)
by: Djuhera, Aladin, et al.
Published: (2026)
Beyond Static Summarization: Proactive Memory Extraction for LLM Agents
by: Yang, Chengyuan, et al.
Published: (2026)
by: Yang, Chengyuan, et al.
Published: (2026)
On the Structural Memory of LLM Agents
by: Zeng, Ruihong, et al.
Published: (2024)
by: Zeng, Ruihong, et al.
Published: (2024)
Similar Items
-
BiasEdit: Debiasing Stereotyped Language Models via Model Editing
by: Xu, Xin, et al.
Published: (2025) -
Evaluating Large Language Models as Generative User Simulators for Conversational Recommendation
by: Yoon, Se-eun, et al.
Published: (2024) -
ThinkRouter: Efficient Reasoning via Routing Thinking between Latent and Discrete Spaces
by: Xu, Xin, et al.
Published: (2026) -
Pluralistic Off-policy Evaluation and Alignment
by: Huang, Chengkai, et al.
Published: (2025) -
Cognitive Bias in Decision-Making with LLMs
by: Echterhoff, Jessica, et al.
Published: (2024)