When Stored Evidence Stops Being Usable: Scale-Conditioned Evaluation of Agent Memory
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Shao, Jiaqi, Lu, Yiyi, Zhang, Yunzhen, Luo, Bing |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Improving and Evaluating Open Deep Research Agents
par: Allabadi, Doaa, et autres
Publié: (2025)
par: Allabadi, Doaa, et autres
Publié: (2025)
ByteRover: Agent-Native Memory Through LLM-Curated Hierarchical Context
par: Nguyen, Andy, et autres
Publié: (2026)
par: Nguyen, Andy, et autres
Publié: (2026)
RLM-on-KG: Heuristics First, LLMs When Needed: Adaptive Retrieval Control over Mention Graphs for Scattered Evidence
par: Volpini, Andrea, et autres
Publié: (2026)
par: Volpini, Andrea, et autres
Publié: (2026)
GISTBench: Evaluating LLM User Understanding via Evidence-Based Interest Verification
par: Fostiropoulos, Iordanis, et autres
Publié: (2026)
par: Fostiropoulos, Iordanis, et autres
Publié: (2026)
Automating Pharmacovigilance Evidence Generation: Using Large Language Models to Produce Context-Aware SQL
par: Painter, Jeffery L., et autres
Publié: (2024)
par: Painter, Jeffery L., et autres
Publié: (2024)
Extending AI for Research to the Humanities: A Multi-Agent Framework for Evidence-Grounded Scholarship
par: Pan, Yating, et autres
Publié: (2026)
par: Pan, Yating, et autres
Publié: (2026)
Fine-Grained Emotion Recognition via In-Context Learning
par: Ren, Zhaochun, et autres
Publié: (2025)
par: Ren, Zhaochun, et autres
Publié: (2025)
Adaptive ToR: Complexity-Aware Tree-Based Retrieval for Pareto-Optimal Multi-Intent NLU
par: Yoo, Hee-Kyong, et autres
Publié: (2026)
par: Yoo, Hee-Kyong, et autres
Publié: (2026)
Optimizing Retrieval-Augmented Generation for Electrical Engineering: A Case Study on ABB Circuit Breakers
par: Alawadhi, Salahuddin, et autres
Publié: (2025)
par: Alawadhi, Salahuddin, et autres
Publié: (2025)
QUARK: Robust Retrieval under Non-Faithful Queries via Query-Anchored Aggregation
par: Lyu, Rita Qiuran, et autres
Publié: (2026)
par: Lyu, Rita Qiuran, et autres
Publié: (2026)
Seeing through the Conflict: Transparent Knowledge Conflict Handling in Retrieval-Augmented Generation
par: Ye, Hua, et autres
Publié: (2026)
par: Ye, Hua, et autres
Publié: (2026)
Promoting Research Collaboration with Open Data Driven Team Recommendation in Response to Call for Proposals
par: Valluru, Siva Likitha, et autres
Publié: (2023)
par: Valluru, Siva Likitha, et autres
Publié: (2023)
Architecture Matters More Than Scale: A Comparative Study of Retrieval and Memory Augmentation for Financial QA Under SME Compute Constraints
par: Liu, Jianan, et autres
Publié: (2026)
par: Liu, Jianan, et autres
Publié: (2026)
Neuromem: A Granular Decomposition of the Streaming Lifecycle in External Memory for LLMs
par: Zhang, Ruicheng, et autres
Publié: (2026)
par: Zhang, Ruicheng, et autres
Publié: (2026)
Grounding Agent Memory in Contextual Intent
par: Yang, Ruozhen, et autres
Publié: (2026)
par: Yang, Ruozhen, et autres
Publié: (2026)
Enhancing Long-term RAG Chatbots with Psychological Models of Memory Importance and Forgetting
par: Sumida, Ryuichi, et autres
Publié: (2024)
par: Sumida, Ryuichi, et autres
Publié: (2024)
Comparison between the Structures of Word Co-occurrence and Word Similarity Networks for Ill-formed and Well-formed Texts in Taiwan Mandarin
par: Huang, Po-Hsuan, et autres
Publié: (2024)
par: Huang, Po-Hsuan, et autres
Publié: (2024)
Storage Is Not Memory: A Retrieval-Centered Architecture for Agent Recall
par: Adler, Joshua, et autres
Publié: (2026)
par: Adler, Joshua, et autres
Publié: (2026)
Evaluating the Effectiveness of Large Language Models in Automated News Article Summarization
par: Houamegni, Lionel Richy Panlap, et autres
Publié: (2025)
par: Houamegni, Lionel Richy Panlap, et autres
Publié: (2025)
Bhakti: A Lightweight Vector Database Management System for Endowing Large Language Models with Semantic Search Capabilities and Memory
par: Wu, Zihao
Publié: (2025)
par: Wu, Zihao
Publié: (2025)
Peeling Back the Layers: An In-Depth Evaluation of Encoder Architectures in Neural News Recommenders
par: Iana, Andreea, et autres
Publié: (2024)
par: Iana, Andreea, et autres
Publié: (2024)
Entity-Collision: A Stratified Protocol for Attributing Retrieval Lift in Agent Memory
par: Deng, Youwang
Publié: (2026)
par: Deng, Youwang
Publié: (2026)
BridgeRAG: Training-Free Bridge-Conditioned Retrieval for Multi-Hop Question Answering
par: Bacellar, Andre
Publié: (2026)
par: Bacellar, Andre
Publié: (2026)
Scaling Multilingual Semantic Search in Uber Eats Delivery
par: Ling, Bo, et autres
Publié: (2026)
par: Ling, Bo, et autres
Publié: (2026)
Exploring Information Retrieval Landscapes: An Investigation of a Novel Evaluation Techniques and Comparative Document Splitting Methods
par: Narimissa, Esmaeil, et autres
Publié: (2024)
par: Narimissa, Esmaeil, et autres
Publié: (2024)
Persistent Identity in AI Agents: A Multi-Anchor Architecture for Resilient Memory and Continuity
par: Menon, Prahlad G.
Publié: (2026)
par: Menon, Prahlad G.
Publié: (2026)
Memory as Metabolism: A Design for Companion Knowledge Systems
par: Miteski, Stefan
Publié: (2026)
par: Miteski, Stefan
Publié: (2026)
NCTB-QA: A Large-Scale Bangla Educational Question Answering Dataset and Benchmarking Performance
par: Eyasir, Abrar, et autres
Publié: (2026)
par: Eyasir, Abrar, et autres
Publié: (2026)
NameBERT: Scaling Name-Based Nationality Classification with LLM-Augmented Open Academic Data
par: Ming, Cong, et autres
Publié: (2026)
par: Ming, Cong, et autres
Publié: (2026)
SGMem: Sentence Graph Memory for Long-Term Conversational Agents
par: Wu, Yaxiong, et autres
Publié: (2025)
par: Wu, Yaxiong, et autres
Publié: (2025)
MasterSet: A Large-Scale Benchmark for Must-Cite Citation Recommendation in the AI/ML Literature
par: Ratul, Md Toyaha Rahman, et autres
Publié: (2026)
par: Ratul, Md Toyaha Rahman, et autres
Publié: (2026)
The Case for Intent-Based Query Rewriting
par: Nicolai, Gianna Lisa, et autres
Publié: (2025)
par: Nicolai, Gianna Lisa, et autres
Publié: (2025)
ToolForge: A Data Synthesis Pipeline for Multi-Hop Search without Real-World APIs
par: Chen, Hao, et autres
Publié: (2025)
par: Chen, Hao, et autres
Publié: (2025)
RobustExplain: Evaluating Robustness of LLM-Based Explanation Agents for Recommendation
par: Zhang, Guilin, et autres
Publié: (2026)
par: Zhang, Guilin, et autres
Publié: (2026)
Evaluation of Chunking Strategies for Effective Text Embedding in Low-Resource Language on Agricultural Documents
par: Chhoun, Sovandara, et autres
Publié: (2026)
par: Chhoun, Sovandara, et autres
Publié: (2026)
Memory Architectures for Multi-Turn Text-to-SQL: A Benchmark and Empirical Study
par: Tummalapenta, Ravi Kumar, et autres
Publié: (2026)
par: Tummalapenta, Ravi Kumar, et autres
Publié: (2026)
BudgetMem: Learning Selective Memory Policies for Cost-Efficient Long-Context Processing in Language Models
par: Alla, Chandra Vamsi Krishna, et autres
Publié: (2025)
par: Alla, Chandra Vamsi Krishna, et autres
Publié: (2025)
SkillForge: Forging Domain-Specific, Self-Evolving Agent Skills in Cloud Technical Support
par: Liu, Xingyan, et autres
Publié: (2026)
par: Liu, Xingyan, et autres
Publié: (2026)
Reconnecting Fragmented Citation Networks with Semantic Augmentation
par: Huong, Vu Thi, et autres
Publié: (2026)
par: Huong, Vu Thi, et autres
Publié: (2026)
Understanding Multi-Agent LLM Frameworks: A Unified Benchmark and Experimental Analysis
par: Orogat, Abdelghny, et autres
Publié: (2026)
par: Orogat, Abdelghny, et autres
Publié: (2026)
Documents similaires
-
Improving and Evaluating Open Deep Research Agents
par: Allabadi, Doaa, et autres
Publié: (2025) -
ByteRover: Agent-Native Memory Through LLM-Curated Hierarchical Context
par: Nguyen, Andy, et autres
Publié: (2026) -
RLM-on-KG: Heuristics First, LLMs When Needed: Adaptive Retrieval Control over Mention Graphs for Scattered Evidence
par: Volpini, Andrea, et autres
Publié: (2026) -
GISTBench: Evaluating LLM User Understanding via Evidence-Based Interest Verification
par: Fostiropoulos, Iordanis, et autres
Publié: (2026) -
Automating Pharmacovigilance Evidence Generation: Using Large Language Models to Produce Context-Aware SQL
par: Painter, Jeffery L., et autres
Publié: (2024)