MemFail: Stress-Testing Failure Modes of LLM Memory Systems
Fuente:
arXiv
Saved in:
| Main Authors: | Garg, Ishir, Kolhe, Neel, Song, Dawn, Zhao, Xuandong |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Fisher-Orthogonal Projected Natural Gradient Descent for Continual Learning
by: Garg, Ishir, et al.
Published: (2026)
by: Garg, Ishir, et al.
Published: (2026)
InfoSynth: Information-Guided Benchmark Synthesis for LLMs
by: Garg, Ishir, et al.
Published: (2026)
by: Garg, Ishir, et al.
Published: (2026)
Scalable Best-of-N Selection for Large Language Models via Self-Certainty
by: Kang, Zhewei, et al.
Published: (2025)
by: Kang, Zhewei, et al.
Published: (2025)
An Undetectable Watermark for Generative Image Models
by: Gunn, Sam, et al.
Published: (2024)
by: Gunn, Sam, et al.
Published: (2024)
LeakAgent: RL-based Red-teaming Agent for LLM Privacy Leakage
by: Nie, Yuzhou, et al.
Published: (2024)
by: Nie, Yuzhou, et al.
Published: (2024)
NextMem: Towards Latent Factual Memory for LLM-based Agents
by: Zhang, Zeyu, et al.
Published: (2026)
by: Zhang, Zeyu, et al.
Published: (2026)
MemFly: On-the-Fly Memory Optimization via Information Bottleneck
by: Zhang, Zhenyuan, et al.
Published: (2026)
by: Zhang, Zhenyuan, et al.
Published: (2026)
EvolveMem:Self-Evolving Memory Architecture via AutoResearch for LLM Agents
by: Liu, Jiaqi, et al.
Published: (2026)
by: Liu, Jiaqi, et al.
Published: (2026)
MemReward: Graph-Based Experience Memory for LLM Reward Prediction with Limited Labels
by: Luo, Tianyang, et al.
Published: (2026)
by: Luo, Tianyang, et al.
Published: (2026)
AgenticPay: A Multi-Agent LLM Negotiation System for Buyer-Seller Transactions
by: Liu, Xianyang, et al.
Published: (2026)
by: Liu, Xianyang, et al.
Published: (2026)
Prediction Is Not Physics: Learning and Evaluating Conserved Quantities in Neural Simulators
by: Bukowski, Andrew, et al.
Published: (2026)
by: Bukowski, Andrew, et al.
Published: (2026)
When Stability Fails: Hidden Failure Modes Of LLMS in Data-Constrained Scientific Decision-Making
by: Riasat, Nazia
Published: (2026)
by: Riasat, Nazia
Published: (2026)
Style Outweighs Substance: Failure Modes of LLM Judges in Alignment Benchmarking
by: Feuer, Benjamin, et al.
Published: (2024)
by: Feuer, Benjamin, et al.
Published: (2024)
StockMem: An Event-Reflection Memory Framework for Stock Forecasting
by: Wang, He, et al.
Published: (2025)
by: Wang, He, et al.
Published: (2025)
AriadneMem: Threading the Maze of Lifelong Memory for LLM Agents
by: Zhu, Wenhui, et al.
Published: (2026)
by: Zhu, Wenhui, et al.
Published: (2026)
Mem-Rec: Memory Efficient Recommendation System using Alternative Representation
by: Jha, Gopi Krishna, et al.
Published: (2023)
by: Jha, Gopi Krishna, et al.
Published: (2023)
Machine Bullshit: Characterizing the Emergent Disregard for Truth in Large Language Models
by: Liang, Kaiqu, et al.
Published: (2025)
by: Liang, Kaiqu, et al.
Published: (2025)
When Planning Fails Despite Correct Execution: On Epistemic Calibration for LLM-Based Multi-Agent Systems
by: Wang, Zehao, et al.
Published: (2026)
by: Wang, Zehao, et al.
Published: (2026)
MemTrace: Tracing and Attributing Errors in Large Language Model Memory Systems
by: Deng, Xinle, et al.
Published: (2026)
by: Deng, Xinle, et al.
Published: (2026)
PolarMem: A Training-Free Polarized Latent Graph Memory for Verifiable Vision-Language Models
by: Chen, Zhisheng, et al.
Published: (2026)
by: Chen, Zhisheng, et al.
Published: (2026)
RecMem: Recurrence-based Memory Consolidation for Efficient and Effective Long-Running LLM Agents
by: Dai, Zijie, et al.
Published: (2026)
by: Dai, Zijie, et al.
Published: (2026)
MemAgent: Reshaping Long-Context LLM with Multi-Conv RL-based Memory Agent
by: Yu, Hongli, et al.
Published: (2025)
by: Yu, Hongli, et al.
Published: (2025)
MemCollab: Cross-Model Memory Collaboration via Contrastive Trajectory Distillation
by: Chang, Yurui, et al.
Published: (2026)
by: Chang, Yurui, et al.
Published: (2026)
MemCast: Memory-Driven Time Series Forecasting with Experience-Conditioned Reasoning
by: Tao, Xiaoyu, et al.
Published: (2026)
by: Tao, Xiaoyu, et al.
Published: (2026)
MemRerank: Preference Memory for Personalized Product Reranking
by: Peng, Zhiyuan, et al.
Published: (2026)
by: Peng, Zhiyuan, et al.
Published: (2026)
From Signal Degradation to Computation Collapse: Uncovering the Two Failure Modes of LLM Quantization
by: Zhou, Chenxi, et al.
Published: (2026)
by: Zhou, Chenxi, et al.
Published: (2026)
CoMemNet: Contrastive Sampling with Memory Replay Network for Continual Traffic Prediction
by: Wu, Mei, et al.
Published: (2026)
by: Wu, Mei, et al.
Published: (2026)
MemMamba: Rethinking Memory Patterns in State Space Model
by: Wang, Youjin, et al.
Published: (2025)
by: Wang, Youjin, et al.
Published: (2025)
MemER: Scaling Up Memory for Robot Control via Experience Retrieval
by: Sridhar, Ajay, et al.
Published: (2025)
by: Sridhar, Ajay, et al.
Published: (2025)
Revealing Interpretable Failure Modes of VLMs
by: Chaudhary, Isha, et al.
Published: (2026)
by: Chaudhary, Isha, et al.
Published: (2026)
MemPromptTSS: Persistent Prompt Memory for Iterative Multi-Granularity Time Series State Segmentation
by: Chang, Ching, et al.
Published: (2025)
by: Chang, Ching, et al.
Published: (2025)
MemGuard: Preventing Memory Contamination in Long-Term Memory-Augmented Large Language Models
by: Ha, Hyeonjeong, et al.
Published: (2026)
by: Ha, Hyeonjeong, et al.
Published: (2026)
MemSkill: Learning and Evolving Memory Skills for Self-Evolving Agents
by: Zhang, Haozhen, et al.
Published: (2026)
by: Zhang, Haozhen, et al.
Published: (2026)
EvoMem: Improving Multi-Agent Planning with Dual-Evolving Memory
by: Fan, Wenzhe, et al.
Published: (2025)
by: Fan, Wenzhe, et al.
Published: (2025)
DUET: Optimize Token-Budget Allocation for Reinforcement Learning with Verifiable Rewards
by: Hu, Haoyu, et al.
Published: (2026)
by: Hu, Haoyu, et al.
Published: (2026)
Consensus is Not Verification: Why Crowd Wisdom Strategies Fail for LLM Truthfulness
by: Denisov-Blanch, Yegor, et al.
Published: (2026)
by: Denisov-Blanch, Yegor, et al.
Published: (2026)
Degradation Modeling and Prognostic Analysis Under Unknown Failure Modes
by: Fu, Ying, et al.
Published: (2024)
by: Fu, Ying, et al.
Published: (2024)
Evaluating LLM Safety Under Repeated Inference via Accelerated Prompt Stress Testing
by: Broadwater, Keita
Published: (2026)
by: Broadwater, Keita
Published: (2026)
Machine Unlearning Fails to Remove Data Poisoning Attacks
by: Pawelczyk, Martin, et al.
Published: (2024)
by: Pawelczyk, Martin, et al.
Published: (2024)
Solving Dual Sourcing Problems with Supply Mode Dependent Failure Rates
by: Akkerman, Fabian, et al.
Published: (2024)
by: Akkerman, Fabian, et al.
Published: (2024)
Similar Items
-
Fisher-Orthogonal Projected Natural Gradient Descent for Continual Learning
by: Garg, Ishir, et al.
Published: (2026) -
InfoSynth: Information-Guided Benchmark Synthesis for LLMs
by: Garg, Ishir, et al.
Published: (2026) -
Scalable Best-of-N Selection for Large Language Models via Self-Certainty
by: Kang, Zhewei, et al.
Published: (2025) -
An Undetectable Watermark for Generative Image Models
by: Gunn, Sam, et al.
Published: (2024) -
LeakAgent: RL-based Red-teaming Agent for LLM Privacy Leakage
by: Nie, Yuzhou, et al.
Published: (2024)