PersistBench: When Should Long-Term Memories Be Forgotten by LLMs?
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Pulipaka, Sidharth, Chen, Oliver, Sharma, Manas, Bajwa, Taaha S, Raina, Vyas, Sheth, Ivaxi |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Hidden in Memory: Sleeper Memory Poisoning in LLM Agents
par: Pulipaka, Sidharth, et autres
Publié: (2026)
par: Pulipaka, Sidharth, et autres
Publié: (2026)
MALT: Mechanistic Ablation of Lossy Translation in LLMs for a Low-Resource Language: Urdu
par: Bajwa, Taaha Saleem
Publié: (2025)
par: Bajwa, Taaha Saleem
Publié: (2025)
PSK at SemEval-2026 Task 9: Multilingual Polarization Detection Using Ensemble Gemma Models with Synthetic Data Augmentation
par: Pulipaka, Srikar Kashyap
Publié: (2026)
par: Pulipaka, Srikar Kashyap
Publié: (2026)
CRISP: Persistent Concept Unlearning via Sparse Autoencoders
par: Ashuach, Tomer, et autres
Publié: (2025)
par: Ashuach, Tomer, et autres
Publié: (2025)
A Domain-Agnostic Neurosymbolic Approach for Big Social Data Analysis: Evaluating Mental Health Sentiment on Social Media during COVID-19
par: Khandelwal, Vedant, et autres
Publié: (2024)
par: Khandelwal, Vedant, et autres
Publié: (2024)
Merge-Bench: Resolve Merge Conflicts with Large Language Models
par: Schesch, Benedikt, et autres
Publié: (2026)
par: Schesch, Benedikt, et autres
Publié: (2026)
ManagerBench: Evaluating the Safety-Pragmatism Trade-off in Autonomous LLMs
par: Simhi, Adi, et autres
Publié: (2025)
par: Simhi, Adi, et autres
Publié: (2025)
RomanLens: The Role Of Latent Romanization In Multilinguality In LLMs
par: Saji, Alan, et autres
Publié: (2025)
par: Saji, Alan, et autres
Publié: (2025)
Enhancing Long-Term Memory using Hierarchical Aggregate Tree for Retrieval Augmented Generation
par: A, Aadharsh Aadhithya, et autres
Publié: (2024)
par: A, Aadharsh Aadhithya, et autres
Publié: (2024)
From Guessing to Asking: An Approach to Resolving the Persona Knowledge Gap in LLMs during Multi-Turn Conversations
par: Baskar, Sarvesh, et autres
Publié: (2025)
par: Baskar, Sarvesh, et autres
Publié: (2025)
EduGuardBench: A Holistic Benchmark for Evaluating the Pedagogical Fidelity and Adversarial Safety of LLMs as Simulated Teachers
par: Jiang, Yilin, et autres
Publié: (2025)
par: Jiang, Yilin, et autres
Publié: (2025)
ExpressivityBench: Can LLMs Communicate Implicitly?
par: Tint, Joshua, et autres
Publié: (2024)
par: Tint, Joshua, et autres
Publié: (2024)
MedMemoryBench: Benchmarking Agent Memory in Personalized Healthcare
par: Wang, Yihao, et autres
Publié: (2026)
par: Wang, Yihao, et autres
Publié: (2026)
PathBench: Speech Intelligibility Benchmark for Automatic Pathological Speech Assessment
par: Halpern, Bence Mark, et autres
Publié: (2026)
par: Halpern, Bence Mark, et autres
Publié: (2026)
ChemPro: A Progressive Chemistry Benchmark for Large Language Models
par: Baranwal, Aaditya, et autres
Publié: (2026)
par: Baranwal, Aaditya, et autres
Publié: (2026)
A Multi-Memory Segment System for Generating High-Quality Long-Term Memory Content in Agents
par: Zhang, Gaoke, et autres
Publié: (2025)
par: Zhang, Gaoke, et autres
Publié: (2025)
Homogeneous Keys, Heterogeneous Values: Exploiting Local KV Cache Asymmetry for Long-Context LLMs
par: Cui, Wanyun, et autres
Publié: (2025)
par: Cui, Wanyun, et autres
Publié: (2025)
PaperAudit-Bench: Benchmarking Error Detection in Research Papers for Critical Automated Peer Review
par: Tu, Songjun, et autres
Publié: (2026)
par: Tu, Songjun, et autres
Publié: (2026)
SGMem: Sentence Graph Memory for Long-Term Conversational Agents
par: Wu, Yaxiong, et autres
Publié: (2025)
par: Wu, Yaxiong, et autres
Publié: (2025)
MEMTIER: Tiered Memory Architecture and Retrieval Bottleneck Analysis for Long-Running Autonomous AI Agents
par: Sidik, Bronislav, et autres
Publié: (2026)
par: Sidik, Bronislav, et autres
Publié: (2026)
EVM-QuestBench: An Execution-Grounded Benchmark for Natural-Language Transaction Code Generation
par: Yang, Pei, et autres
Publié: (2026)
par: Yang, Pei, et autres
Publié: (2026)
Can LLMs Compute with Reasons?
par: Sandilya, Harshit, et autres
Publié: (2024)
par: Sandilya, Harshit, et autres
Publié: (2024)
Forgotten Words: Benchmarking NeoBERT for Dementia Detection in Low-Resource Conversational Filipino and English Speech
par: Floresca, Rez Samantha Z., et autres
Publié: (2026)
par: Floresca, Rez Samantha Z., et autres
Publié: (2026)
LLMs for Legal Subsumption in German Employment Contracts
par: Wardas, Oliver, et autres
Publié: (2025)
par: Wardas, Oliver, et autres
Publié: (2025)
When Retrieval Succeeds and Fails: Rethinking Retrieval-Augmented Generation for LLMs
par: Wang, Yongjie, et autres
Publié: (2025)
par: Wang, Yongjie, et autres
Publié: (2025)
LCFO: Long Context and Long Form Output Dataset and Benchmarking
par: Costa-jussà, Marta R., et autres
Publié: (2024)
par: Costa-jussà, Marta R., et autres
Publié: (2024)
When Words Change the Model: Sensitivity of LLMs for Constraint Programming Modelling
par: Pellegrino, Alessio, et autres
Publié: (2025)
par: Pellegrino, Alessio, et autres
Publié: (2025)
UA-Legal-Bench: A Benchmark for Evaluating Large Language Models on Ukrainian Legal Reasoning
par: Ovcharov, Volodymyr
Publié: (2026)
par: Ovcharov, Volodymyr
Publié: (2026)
Efficient Solutions For An Intriguing Failure of LLMs: Long Context Window Does Not Mean LLMs Can Analyze Long Sequences Flawlessly
par: Hosseini, Peyman, et autres
Publié: (2024)
par: Hosseini, Peyman, et autres
Publié: (2024)
RTI-Bench: A Structured Dataset for Indian Right-to-Information Decision Analysis
par: Bose, Joy
Publié: (2026)
par: Bose, Joy
Publié: (2026)
Unlearning at Scale: Implementing the Right to be Forgotten in Large Language Models
par: X, Abdullah
Publié: (2025)
par: X, Abdullah
Publié: (2025)
When Models Can't Follow: Testing Instruction Adherence Across 256 LLMs
par: Young, Richard J., et autres
Publié: (2025)
par: Young, Richard J., et autres
Publié: (2025)
OPOR-Bench: Evaluating Large Language Models on Online Public Opinion Report Generation
par: Yu, Jinzheng, et autres
Publié: (2025)
par: Yu, Jinzheng, et autres
Publié: (2025)
XferBench: a Data-Driven Benchmark for Emergent Language
par: Boldt, Brendon, et autres
Publié: (2024)
par: Boldt, Brendon, et autres
Publié: (2024)
ATANT v1.1: Positioning Continuity Evaluation Against Memory, Long-Context, and Agentic-Memory Benchmarks
par: Tanguturi, Samuel Sameer
Publié: (2026)
par: Tanguturi, Samuel Sameer
Publié: (2026)
MedFuzz: Exploring the Robustness of Large Language Models in Medical Question Answering
par: Ness, Robert Osazuwa, et autres
Publié: (2024)
par: Ness, Robert Osazuwa, et autres
Publié: (2024)
Text-Based Approaches to Item Difficulty Modeling in Large-Scale Assessments: A Systematic Review
par: Peters, Sydney, et autres
Publié: (2025)
par: Peters, Sydney, et autres
Publié: (2025)
BlasBench: An Open Benchmark for Irish Speech Recognition
par: Raj, Jyoutir, et autres
Publié: (2026)
par: Raj, Jyoutir, et autres
Publié: (2026)
Evaluating Relational Reasoning in LLMs with REL
par: Fesser, Lukas, et autres
Publié: (2026)
par: Fesser, Lukas, et autres
Publié: (2026)
When Self-Reference Fails to Close: Matrix-Level Dynamics in Large Language Models
par: Bae, Ji Ho
Publié: (2026)
par: Bae, Ji Ho
Publié: (2026)
Documents similaires
-
Hidden in Memory: Sleeper Memory Poisoning in LLM Agents
par: Pulipaka, Sidharth, et autres
Publié: (2026) -
MALT: Mechanistic Ablation of Lossy Translation in LLMs for a Low-Resource Language: Urdu
par: Bajwa, Taaha Saleem
Publié: (2025) -
PSK at SemEval-2026 Task 9: Multilingual Polarization Detection Using Ensemble Gemma Models with Synthetic Data Augmentation
par: Pulipaka, Srikar Kashyap
Publié: (2026) -
CRISP: Persistent Concept Unlearning via Sparse Autoencoders
par: Ashuach, Tomer, et autres
Publié: (2025) -
A Domain-Agnostic Neurosymbolic Approach for Big Social Data Analysis: Evaluating Mental Health Sentiment on Social Media during COVID-19
par: Khandelwal, Vedant, et autres
Publié: (2024)