Locomo-Plus: Beyond-Factual Cognitive Memory Evaluation Framework for LLM Agents
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Yifei, Guo, Weidong, Zhang, Lingling, Xu, Rongman, Huang, Muye, Liu, Hui, Xu, Lijiao, Xu, Yu, Liu, Jun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SIFiD: Reassess Summary Factual Inconsistency Detection with LLM
por: Yang, Jiuding, et al.
Publicado: (2024)
por: Yang, Jiuding, et al.
Publicado: (2024)
JudgeAgent: Beyond Static Benchmarks for Knowledge-Driven and Dynamic LLM Evaluation
por: Shi, Zhichao, et al.
Publicado: (2025)
por: Shi, Zhichao, et al.
Publicado: (2025)
MemBench: Towards More Comprehensive Evaluation on the Memory of LLM-based Agents
por: Tan, Haoran, et al.
Publicado: (2025)
por: Tan, Haoran, et al.
Publicado: (2025)
StratMem-Bench: Evaluating Strategic Memory Use in Virtual Character Conversation Beyond Factual Recall
por: Wu, Yerong, et al.
Publicado: (2026)
por: Wu, Yerong, et al.
Publicado: (2026)
Beyond Perfect APIs: A Comprehensive Evaluation of LLM Agents Under Real-World API Complexity
por: Kim, Doyoung, et al.
Publicado: (2026)
por: Kim, Doyoung, et al.
Publicado: (2026)
On the Structural Memory of LLM Agents
por: Zeng, Ruihong, et al.
Publicado: (2024)
por: Zeng, Ruihong, et al.
Publicado: (2024)
Learning from Semi-Factuals: A Debiased and Semantic-Aware Framework for Generalized Relation Discovery
por: Wang, Jiaxin, et al.
Publicado: (2024)
por: Wang, Jiaxin, et al.
Publicado: (2024)
Face4RAG: Factual Consistency Evaluation for Retrieval Augmented Generation in Chinese
por: Xu, Yunqi, et al.
Publicado: (2024)
por: Xu, Yunqi, et al.
Publicado: (2024)
Detecting Errors through Ensembling Prompts (DEEP): An End-to-End LLM Framework for Detecting Factual Errors
por: Chandler, Alex, et al.
Publicado: (2024)
por: Chandler, Alex, et al.
Publicado: (2024)
Beyond Under-Alignment: Atomic Preference Enhanced Factuality Tuning for Large Language Models
por: Yuan, Hongbang, et al.
Publicado: (2024)
por: Yuan, Hongbang, et al.
Publicado: (2024)
Learn to Memorize: Optimizing LLM-based Agents with Adaptive Memory Framework
por: Zhang, Zeyu, et al.
Publicado: (2025)
por: Zhang, Zeyu, et al.
Publicado: (2025)
Towards Understanding Continual Factual Knowledge Acquisition of Language Models: From Theory to Algorithm
por: Wang, Haoyu, et al.
Publicado: (2026)
por: Wang, Haoyu, et al.
Publicado: (2026)
Beyond Static Summarization: Proactive Memory Extraction for LLM Agents
por: Yang, Chengyuan, et al.
Publicado: (2026)
por: Yang, Chengyuan, et al.
Publicado: (2026)
Evaluating the Factuality of Large Language Models using Large-Scale Knowledge Graphs
por: Liu, Xiaoze, et al.
Publicado: (2024)
por: Liu, Xiaoze, et al.
Publicado: (2024)
MAD-Fact: A Multi-Agent Debate Framework for Long-Form Factuality Evaluation in LLMs
por: Ning, Yucheng, et al.
Publicado: (2025)
por: Ning, Yucheng, et al.
Publicado: (2025)
DatawiseAgent: A Notebook-Centric LLM Agent Framework for Adaptive and Robust Data Science Automation
por: You, Ziming, et al.
Publicado: (2025)
por: You, Ziming, et al.
Publicado: (2025)
Evaluating Memory in LLM Agents via Incremental Multi-Turn Interactions
por: Hu, Yuanzhe, et al.
Publicado: (2025)
por: Hu, Yuanzhe, et al.
Publicado: (2025)
Mobile-Bench: An Evaluation Benchmark for LLM-based Mobile Agents
por: Deng, Shihan, et al.
Publicado: (2024)
por: Deng, Shihan, et al.
Publicado: (2024)
CoSER: A Comprehensive Literary Dataset and Framework for Training and Evaluating LLM Role-Playing and Persona Simulation
por: Wang, Xintao, et al.
Publicado: (2025)
por: Wang, Xintao, et al.
Publicado: (2025)
Adaptive Memory Admission Control for LLM Agents
por: Zhang, Guilin, et al.
Publicado: (2026)
por: Zhang, Guilin, et al.
Publicado: (2026)
Are Large Language Models Really Good Logical Reasoners? A Comprehensive Evaluation and Beyond
por: Xu, Fangzhi, et al.
Publicado: (2023)
por: Xu, Fangzhi, et al.
Publicado: (2023)
JAILJUDGE: A Comprehensive Jailbreak Judge Benchmark with Multi-Agent Enhanced Explanation Evaluation Framework
por: Liu, Fan, et al.
Publicado: (2024)
por: Liu, Fan, et al.
Publicado: (2024)
Beyond Instruction Following: Evaluating Inferential Rule Following of Large Language Models
por: Sun, Wangtao, et al.
Publicado: (2024)
por: Sun, Wangtao, et al.
Publicado: (2024)
ExpeL: LLM Agents Are Experiential Learners
por: Zhao, Andrew, et al.
Publicado: (2023)
por: Zhao, Andrew, et al.
Publicado: (2023)
Reasoning Factual Knowledge in Structured Data with Large Language Models
por: Huang, Sirui, et al.
Publicado: (2024)
por: Huang, Sirui, et al.
Publicado: (2024)
Permutation-Consensus Listwise Judging for Robust Factuality Evaluation
por: Huang, Tianyi, et al.
Publicado: (2026)
por: Huang, Tianyi, et al.
Publicado: (2026)
MIRIX: Multi-Agent Memory System for LLM-Based Agents
por: Wang, Yu, et al.
Publicado: (2025)
por: Wang, Yu, et al.
Publicado: (2025)
Editing Factual Knowledge and Explanatory Ability of Medical Large Language Models
por: Xu, Derong, et al.
Publicado: (2024)
por: Xu, Derong, et al.
Publicado: (2024)
IndexMem: Learned KV-Cache Eviction with Latent Memory for Long-Context LLM Inference
por: Yang, Xintong, et al.
Publicado: (2026)
por: Yang, Xintong, et al.
Publicado: (2026)
MATEval: A Multi-Agent Discussion Framework for Advancing Open-Ended Text Evaluation
por: Li, Yu, et al.
Publicado: (2024)
por: Li, Yu, et al.
Publicado: (2024)
G-MemLLM: Gated Latent Memory Augmentation for Long-Context Reasoning in Large Language Models
por: Xu, Xun
Publicado: (2026)
por: Xu, Xun
Publicado: (2026)
VehicleMemBench: An Executable Benchmark for Multi-User Long-Term Memory in In-Vehicle Agents
por: Chen, Yuhao, et al.
Publicado: (2026)
por: Chen, Yuhao, et al.
Publicado: (2026)
Evaluating Robustness of Generative Search Engine on Adversarial Factual Questions
por: Hu, Xuming, et al.
Publicado: (2024)
por: Hu, Xuming, et al.
Publicado: (2024)
DecMetrics: Structured Claim Decomposition Scoring for Factually Consistent LLM Outputs
por: Huang, Minghui
Publicado: (2025)
por: Huang, Minghui
Publicado: (2025)
How Does Response Length Affect Long-Form Factuality
por: Zhao, James Xu, et al.
Publicado: (2025)
por: Zhao, James Xu, et al.
Publicado: (2025)
Do Automatic Factuality Metrics Measure Factuality? A Critical Evaluation
por: Ramprasad, Sanjana, et al.
Publicado: (2024)
por: Ramprasad, Sanjana, et al.
Publicado: (2024)
Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes
por: Jiao, Rui, et al.
Publicado: (2025)
por: Jiao, Rui, et al.
Publicado: (2025)
Does Context Matter? ContextualJudgeBench for Evaluating LLM-based Judges in Contextual Settings
por: Xu, Austin, et al.
Publicado: (2025)
por: Xu, Austin, et al.
Publicado: (2025)
FaStfact: Faster, Stronger Long-Form Factuality Evaluations in LLMs
por: Wan, Yingjia, et al.
Publicado: (2025)
por: Wan, Yingjia, et al.
Publicado: (2025)
Generate-on-Graph: Treat LLM as both Agent and KG in Incomplete Knowledge Graph Question Answering
por: Xu, Yao, et al.
Publicado: (2024)
por: Xu, Yao, et al.
Publicado: (2024)
Ejemplares similares
-
SIFiD: Reassess Summary Factual Inconsistency Detection with LLM
por: Yang, Jiuding, et al.
Publicado: (2024) -
JudgeAgent: Beyond Static Benchmarks for Knowledge-Driven and Dynamic LLM Evaluation
por: Shi, Zhichao, et al.
Publicado: (2025) -
MemBench: Towards More Comprehensive Evaluation on the Memory of LLM-based Agents
por: Tan, Haoran, et al.
Publicado: (2025) -
StratMem-Bench: Evaluating Strategic Memory Use in Virtual Character Conversation Beyond Factual Recall
por: Wu, Yerong, et al.
Publicado: (2026) -
Beyond Perfect APIs: A Comprehensive Evaluation of LLM Agents Under Real-World API Complexity
por: Kim, Doyoung, et al.
Publicado: (2026)