EngramaBench: Evaluating Long-Term Conversational Memory with Structured Graph Retrieval
Fuente:
arXiv
Guardado en:
| Autor principal: | Acuna, Julian |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
StoryBench: A Dynamic Benchmark for Evaluating Long-Term Memory with Multi Turns
por: Wan, Luanbo, et al.
Publicado: (2025)
por: Wan, Luanbo, et al.
Publicado: (2025)
Evaluating Very Long-Term Conversational Memory of LLM Agents
por: Maharana, Adyasha, et al.
Publicado: (2024)
por: Maharana, Adyasha, et al.
Publicado: (2024)
HyperMem: Hypergraph Memory for Long-Term Conversations
por: Yue, Juwei, et al.
Publicado: (2026)
por: Yue, Juwei, et al.
Publicado: (2026)
MemRouter: Memory-as-Embedding Routing for Long-Term Conversational Agents
por: Hu, Tianyu, et al.
Publicado: (2026)
por: Hu, Tianyu, et al.
Publicado: (2026)
MemoryRewardBench: Benchmarking Reward Models for Long-Term Memory Management in Large Language Models
por: Tang, Zecheng, et al.
Publicado: (2026)
por: Tang, Zecheng, et al.
Publicado: (2026)
Mem2ActBench: A Benchmark for Evaluating Long-Term Memory Utilization in Task-Oriented Autonomous Agents
por: Shen, Yiting, et al.
Publicado: (2026)
por: Shen, Yiting, et al.
Publicado: (2026)
Mem-Gallery: Benchmarking Multimodal Long-Term Conversational Memory for MLLM Agents
por: Bei, Yuanchen, et al.
Publicado: (2026)
por: Bei, Yuanchen, et al.
Publicado: (2026)
VehicleMemBench: An Executable Benchmark for Multi-User Long-Term Memory in In-Vehicle Agents
por: Chen, Yuhao, et al.
Publicado: (2026)
por: Chen, Yuhao, et al.
Publicado: (2026)
APEX-MEM: Agentic Semi-Structured Memory with Temporal Reasoning for Long-Term Conversational AI
por: Banerjee, Pratyay, et al.
Publicado: (2026)
por: Banerjee, Pratyay, et al.
Publicado: (2026)
GRAVITY: Architecture-Agnostic Structured Anchoring for Long-Horizon Conversational Memory
por: Sun, Yushi, et al.
Publicado: (2026)
por: Sun, Yushi, et al.
Publicado: (2026)
Does Memory Need Graphs? A Unified Framework and Empirical Analysis for Long-Term Dialog Memory
por: Hu, Sen, et al.
Publicado: (2026)
por: Hu, Sen, et al.
Publicado: (2026)
GraphRAG-Bench: Challenging Domain-Specific Reasoning for Evaluating Graph Retrieval-Augmented Generation
por: Xiao, Yilin, et al.
Publicado: (2025)
por: Xiao, Yilin, et al.
Publicado: (2025)
HingeMem: Boundary Guided Long-Term Memory with Query Adaptive Retrieval for Scalable Dialogues
por: Zhong, Yijie, et al.
Publicado: (2026)
por: Zhong, Yijie, et al.
Publicado: (2026)
StratMem-Bench: Evaluating Strategic Memory Use in Virtual Character Conversation Beyond Factual Recall
por: Wu, Yerong, et al.
Publicado: (2026)
por: Wu, Yerong, et al.
Publicado: (2026)
On Memory Construction and Retrieval for Personalized Conversational Agents
por: Pan, Zhuoshi, et al.
Publicado: (2025)
por: Pan, Zhuoshi, et al.
Publicado: (2025)
NC-Bench: An LLM Benchmark for Evaluating Conversational Competence
por: Moore, Robert J., et al.
Publicado: (2026)
por: Moore, Robert J., et al.
Publicado: (2026)
OP-Bench: Benchmarking Over-Personalization for Memory-Augmented Personalized Conversational Agents
por: Hu, Yulin, et al.
Publicado: (2026)
por: Hu, Yulin, et al.
Publicado: (2026)
MemGround: Long-Term Memory Evaluation Kit for Large Language Models in Gamified Scenarios
por: Ding, Yihang, et al.
Publicado: (2026)
por: Ding, Yihang, et al.
Publicado: (2026)
MemLong: Memory-Augmented Retrieval for Long Text Modeling
por: Liu, Weijie, et al.
Publicado: (2024)
por: Liu, Weijie, et al.
Publicado: (2024)
MEMTRACK: Evaluating Long-Term Memory and State Tracking in Multi-Platform Dynamic Agent Environments
por: Deshpande, Darshan, et al.
Publicado: (2025)
por: Deshpande, Darshan, et al.
Publicado: (2025)
ColorBench: Benchmarking Mobile Agents with Graph-Structured Framework for Complex Long-Horizon Tasks
por: Song, Yuanyi, et al.
Publicado: (2025)
por: Song, Yuanyi, et al.
Publicado: (2025)
PerLTQA: A Personal Long-Term Memory Dataset for Memory Classification, Retrieval, and Synthesis in Question Answering
por: Du, Yiming, et al.
Publicado: (2024)
por: Du, Yiming, et al.
Publicado: (2024)
DialSim: A Dialogue Simulator for Evaluating Long-Term Multi-Party Dialogue Understanding of Conversational Agents
por: Kim, Jiho, et al.
Publicado: (2024)
por: Kim, Jiho, et al.
Publicado: (2024)
Preference-Aware Memory Update for Long-Term LLM Agents
por: Sun, Haoran, et al.
Publicado: (2025)
por: Sun, Haoran, et al.
Publicado: (2025)
$\texttt{YC-Bench}$: Benchmarking AI Agents for Long-Term Planning and Consistent Execution
por: He, Muyu, et al.
Publicado: (2026)
por: He, Muyu, et al.
Publicado: (2026)
Enhancing Long-Term Memory using Hierarchical Aggregate Tree for Retrieval Augmented Generation
por: A, Aadharsh Aadhithya, et al.
Publicado: (2024)
por: A, Aadharsh Aadhithya, et al.
Publicado: (2024)
Hierarchical Memory for High-Efficiency Long-Term Reasoning in LLM Agents
por: Sun, Haoran, et al.
Publicado: (2025)
por: Sun, Haoran, et al.
Publicado: (2025)
AMemGym: Interactive Memory Benchmarking for Assistants in Long-Horizon Conversations
por: Jiayang, Cheng, et al.
Publicado: (2026)
por: Jiayang, Cheng, et al.
Publicado: (2026)
Cooperative Memory Paging with Keyword Bookmarks for Long-Horizon LLM Conversations
por: Liu, Ziyang
Publicado: (2026)
por: Liu, Ziyang
Publicado: (2026)
$τ^2$-Bench: Evaluating Conversational Agents in a Dual-Control Environment
por: Barres, Victor, et al.
Publicado: (2025)
por: Barres, Victor, et al.
Publicado: (2025)
ES-Mem: Event Segmentation-Based Memory for Long-Term Dialogue Agents
por: Zou, Huhai, et al.
Publicado: (2026)
por: Zou, Huhai, et al.
Publicado: (2026)
HippoRAG: Neurobiologically Inspired Long-Term Memory for Large Language Models
por: Gutiérrez, Bernal Jiménez, et al.
Publicado: (2024)
por: Gutiérrez, Bernal Jiménez, et al.
Publicado: (2024)
Recursively Summarizing Enables Long-Term Dialogue Memory in Large Language Models
por: Wang, Qingyue, et al.
Publicado: (2023)
por: Wang, Qingyue, et al.
Publicado: (2023)
Semantic XPath: Structured Agentic Memory Access for Conversational AI
por: Liu, Yifan Simon, et al.
Publicado: (2026)
por: Liu, Yifan Simon, et al.
Publicado: (2026)
ES-MemEval: Benchmarking Conversational Agents on Personalized Long-Term Emotional Support
por: Chen, Tiantian, et al.
Publicado: (2026)
por: Chen, Tiantian, et al.
Publicado: (2026)
Dynamic Long Short-Term Memory Based Memory Storage For Long Horizon LLM Interaction
por: Lou, Yuyang, et al.
Publicado: (2025)
por: Lou, Yuyang, et al.
Publicado: (2025)
TiMem: Temporal-Hierarchical Memory Consolidation for Long-Horizon Conversational Agents
por: Li, Kai, et al.
Publicado: (2026)
por: Li, Kai, et al.
Publicado: (2026)
MemBench: Towards More Comprehensive Evaluation on the Memory of LLM-based Agents
por: Tan, Haoran, et al.
Publicado: (2025)
por: Tan, Haoran, et al.
Publicado: (2025)
MADial-Bench: Towards Real-world Evaluation of Memory-Augmented Dialogue Generation
por: He, Junqing, et al.
Publicado: (2024)
por: He, Junqing, et al.
Publicado: (2024)
MedMT-Bench: Can LLMs Memorize and Understand Long Multi-Turn Conversations in Medical Scenarios?
por: Yang, Lin, et al.
Publicado: (2026)
por: Yang, Lin, et al.
Publicado: (2026)
Ejemplares similares
-
StoryBench: A Dynamic Benchmark for Evaluating Long-Term Memory with Multi Turns
por: Wan, Luanbo, et al.
Publicado: (2025) -
Evaluating Very Long-Term Conversational Memory of LLM Agents
por: Maharana, Adyasha, et al.
Publicado: (2024) -
HyperMem: Hypergraph Memory for Long-Term Conversations
por: Yue, Juwei, et al.
Publicado: (2026) -
MemRouter: Memory-as-Embedding Routing for Long-Term Conversational Agents
por: Hu, Tianyu, et al.
Publicado: (2026) -
MemoryRewardBench: Benchmarking Reward Models for Long-Term Memory Management in Large Language Models
por: Tang, Zecheng, et al.
Publicado: (2026)