HaluMem: Evaluating Hallucinations in Memory Systems of Agents
Fuente:
arXiv
Saved in:
| Main Authors: | Chen, Ding, Niu, Simin, Li, Kehang, Liu, Peng, Zheng, Xiangping, Tang, Bo, Li, Xinchi, Xiong, Feiyu, Li, Zhiyu |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MemReader: From Passive to Active Extraction for Long-Term Agent Memory
by: Kang, Jingyi, et al.
Published: (2026)
by: Kang, Jingyi, et al.
Published: (2026)
MemFactory: Unified Inference & Training Framework for Agent Memory
by: Guo, Ziliang, et al.
Published: (2026)
by: Guo, Ziliang, et al.
Published: (2026)
MemReranker: Reasoning-Aware Reranking for Agent Memory Retrieval
by: Li, Chunyu, et al.
Published: (2026)
by: Li, Chunyu, et al.
Published: (2026)
MemEmo: Evaluating Emotion in Memory Systems of Agents
by: Liu, Peng, et al.
Published: (2026)
by: Liu, Peng, et al.
Published: (2026)
GuessArena: Guess Who I Am? A Self-Adaptive Framework for Evaluating LLMs in Domain-Specific Knowledge and Reasoning
by: Yu, Qingchen, et al.
Published: (2025)
by: Yu, Qingchen, et al.
Published: (2025)
Text2Mem: A Unified Memory Operation Language for Memory Operating System
by: Wang, Yi, et al.
Published: (2025)
by: Wang, Yi, et al.
Published: (2025)
MemPrivacy: Privacy-Preserving Personalized Memory Management for Edge-Cloud Agents
by: Chen, Yining, et al.
Published: (2026)
by: Chen, Yining, et al.
Published: (2026)
MemOS: An Operating System for Memory-Augmented Generation (MAG) in Large Language Models
by: Li, Zhiyu, et al.
Published: (2025)
by: Li, Zhiyu, et al.
Published: (2025)
MoM: Mixtures of Scenario-Aware Document Memories for Retrieval-Augmented Generation Systems
by: Zhao, Jihao, et al.
Published: (2025)
by: Zhao, Jihao, et al.
Published: (2025)
MemOS: A Memory OS for AI System
by: Li, Zhiyu, et al.
Published: (2025)
by: Li, Zhiyu, et al.
Published: (2025)
MemRL: Self-Evolving Agents via Runtime Reinforcement Learning on Episodic Memory
by: Zhang, Shengtao, et al.
Published: (2026)
by: Zhang, Shengtao, et al.
Published: (2026)
UHGEval: Benchmarking the Hallucination of Chinese Large Language Models via Unconstrained Generation
by: Liang, Xun, et al.
Published: (2023)
by: Liang, Xun, et al.
Published: (2023)
MoC: Mixtures of Text Chunking Learners for Retrieval-Augmented Generation System
by: Zhao, Jihao, et al.
Published: (2025)
by: Zhao, Jihao, et al.
Published: (2025)
xFinder: Large Language Models as Automated Evaluators for Reliable Evaluation
by: Yu, Qingchen, et al.
Published: (2024)
by: Yu, Qingchen, et al.
Published: (2024)
HRDE: Retrieval-Augmented Large Language Models for Chinese Health Rumor Detection and Explainability
by: Chen, Yanfang, et al.
Published: (2024)
by: Chen, Yanfang, et al.
Published: (2024)
Inside Out: Evolving User-Centric Core Memory Trees for Long-Term Personalized Dialogue Systems
by: Zhao, Jihao, et al.
Published: (2026)
by: Zhao, Jihao, et al.
Published: (2026)
Meta-Chunking: Learning Text Segmentation and Semantic Completion via Logical Perception
by: Zhao, Jihao, et al.
Published: (2024)
by: Zhao, Jihao, et al.
Published: (2024)
HaluEval-Wild: Evaluating Hallucinations of Language Models in the Wild
by: Zhu, Zhiying, et al.
Published: (2024)
by: Zhu, Zhiying, et al.
Published: (2024)
Halu-J: Critique-Based Hallucination Judge
by: Wang, Binjie, et al.
Published: (2024)
by: Wang, Binjie, et al.
Published: (2024)
xVerify: Efficient Answer Verifier for Reasoning Model Evaluations
by: Chen, Ding, et al.
Published: (2025)
by: Chen, Ding, et al.
Published: (2025)
FastMem: Fast Memorization of Prompt Improves Context Awareness of Large Language Models
by: Zhu, Junyi, et al.
Published: (2024)
by: Zhu, Junyi, et al.
Published: (2024)
SkillsVote: Lifecycle Governance of Agent Skills from Collection, Recommendation to Evolution
by: Liu, Hongyi, et al.
Published: (2026)
by: Liu, Hongyi, et al.
Published: (2026)
KnowHalu: Hallucination Detection via Multi-Form Knowledge Based Factual Checking
by: Zhang, Jiawei, et al.
Published: (2024)
by: Zhang, Jiawei, et al.
Published: (2024)
CRUD-RAG: A Comprehensive Chinese Benchmark for Retrieval-Augmented Generation of Large Language Models
by: Lyu, Yuanjie, et al.
Published: (2024)
by: Lyu, Yuanjie, et al.
Published: (2024)
DiaHalu: A Dialogue-level Hallucination Evaluation Benchmark for Large Language Models
by: Chen, Kedi, et al.
Published: (2024)
by: Chen, Kedi, et al.
Published: (2024)
QAEncoder: Towards Aligned Representation Learning in Question Answering Systems
by: Wang, Zhengren, et al.
Published: (2024)
by: Wang, Zhengren, et al.
Published: (2024)
InfMem: Learning System-2 Memory Control for Long-Context Agent
by: Wang, Xinyu, et al.
Published: (2026)
by: Wang, Xinyu, et al.
Published: (2026)
MeasHalu: Mitigation of Scientific Measurement Hallucinations for Large Language Models with Enhanced Reasoning
by: Huang, Ruijun, et al.
Published: (2026)
by: Huang, Ruijun, et al.
Published: (2026)
Grimoire is All You Need for Enhancing Large Language Models
by: Chen, Ding, et al.
Published: (2024)
by: Chen, Ding, et al.
Published: (2024)
SEAP: Training-free Sparse Expert Activation Pruning Unlock the Brainpower of Large Language Models
by: Liang, Xun, et al.
Published: (2025)
by: Liang, Xun, et al.
Published: (2025)
Mem-T: Densifying Rewards for Long-Horizon Memory Agents
by: Yue, Yanwei, et al.
Published: (2026)
by: Yue, Yanwei, et al.
Published: (2026)
MemCog: From Memory-as-Tool to Memory-as-Cognition in Conversational Agents
by: Li, Zihan, et al.
Published: (2026)
by: Li, Zihan, et al.
Published: (2026)
ToolMem: Enhancing Multimodal Agents with Learnable Tool Capability Memory
by: Xiao, Yunzhong, et al.
Published: (2025)
by: Xiao, Yunzhong, et al.
Published: (2025)
HaluNet: Learning Hallucination Risk from Internal Signals in LLM Question Answering
by: Tong, Chaodong, et al.
Published: (2025)
by: Tong, Chaodong, et al.
Published: (2025)
CodeHalu: Investigating Code Hallucinations in LLMs via Execution-based Verification
by: Tian, Yuchen, et al.
Published: (2024)
by: Tian, Yuchen, et al.
Published: (2024)
MedHalu: Hallucinations in Responses to Healthcare Queries by Large Language Models
by: Agarwal, Vibhor, et al.
Published: (2024)
by: Agarwal, Vibhor, et al.
Published: (2024)
MemLong: Memory-Augmented Retrieval for Long Text Modeling
by: Liu, Weijie, et al.
Published: (2024)
by: Liu, Weijie, et al.
Published: (2024)
HeLa-Mem: Hebbian Learning and Associative Memory for LLM Agents
by: Zhu, Jinchang, et al.
Published: (2026)
by: Zhu, Jinchang, et al.
Published: (2026)
LatentMem: Customizing Latent Memory for Multi-Agent Systems
by: Fu, Muxin, et al.
Published: (2026)
by: Fu, Muxin, et al.
Published: (2026)
SymLoc: Symbolic Localization of Hallucination across HaluEval and TruthfulQA
by: Lamba, Naveen, et al.
Published: (2025)
by: Lamba, Naveen, et al.
Published: (2025)
Similar Items
-
MemReader: From Passive to Active Extraction for Long-Term Agent Memory
by: Kang, Jingyi, et al.
Published: (2026) -
MemFactory: Unified Inference & Training Framework for Agent Memory
by: Guo, Ziliang, et al.
Published: (2026) -
MemReranker: Reasoning-Aware Reranking for Agent Memory Retrieval
by: Li, Chunyu, et al.
Published: (2026) -
MemEmo: Evaluating Emotion in Memory Systems of Agents
by: Liu, Peng, et al.
Published: (2026) -
GuessArena: Guess Who I Am? A Self-Adaptive Framework for Evaluating LLMs in Domain-Specific Knowledge and Reasoning
by: Yu, Qingchen, et al.
Published: (2025)