Evo-Memory: Benchmarking LLM Agent Test-time Learning with Self-Evolving Memory
Fuente:
arXiv
Saved in:
| Main Authors: | Wei, Tianxin, Sachdeva, Noveen, Coleman, Benjamin, He, Zhankui, Bei, Yuanchen, Ning, Xuying, Ai, Mengting, Li, Yunzhe, He, Jingrui, Chi, Ed H., Wang, Chi, Chen, Shuo, Pereira, Fernando, Kang, Wang-Cheng, Cheng, Derek Zhiyuan |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
ActionPiece: Contextually Tokenizing Action Sequences for Generative Recommendation
by: Hou, Yupeng, et al.
Published: (2025)
by: Hou, Yupeng, et al.
Published: (2025)
Mem-Gallery: Benchmarking Multimodal Long-Term Conversational Memory for MLLM Agents
by: Bei, Yuanchen, et al.
Published: (2026)
by: Bei, Yuanchen, et al.
Published: (2026)
PACEvolve++: Improving Test-time Learning for Evolutionary Search Agents
by: Yan, Minghao, et al.
Published: (2026)
by: Yan, Minghao, et al.
Published: (2026)
PACEvolve: Enabling Long-Horizon Progress-Aware Consistent Evolution
by: Yan, Minghao, et al.
Published: (2026)
by: Yan, Minghao, et al.
Published: (2026)
How to Train Data-Efficient LLMs
by: Sachdeva, Noveen, et al.
Published: (2024)
by: Sachdeva, Noveen, et al.
Published: (2024)
NIRVANA: Structured pruning reimagined for large language models compression
by: Ai, Mengting, et al.
Published: (2025)
by: Ai, Mengting, et al.
Published: (2025)
PaperMind: Benchmarking Agentic Reasoning and Critique over Scientific Papers in Multimodal LLMs
by: Zhao, Yanjun, et al.
Published: (2026)
by: Zhao, Yanjun, et al.
Published: (2026)
Graph4MM: Weaving Multimodal Learning with Structural Information
by: Ning, Xuying, et al.
Published: (2025)
by: Ning, Xuying, et al.
Published: (2025)
EvoMemBench: Benchmarking Agent Memory from a Self-Evolving Perspective
by: Wang, Yuyao, et al.
Published: (2026)
by: Wang, Yuyao, et al.
Published: (2026)
Heterogeneous Scientific Foundation Model Collaboration
by: Li, Zihao, et al.
Published: (2026)
by: Li, Zihao, et al.
Published: (2026)
MLP Fusion: Towards Efficient Fine-tuning of Dense and Mixture-of-Experts Language Models
by: Ai, Mengting, et al.
Published: (2023)
by: Ai, Mengting, et al.
Published: (2023)
AgenticTagger: Structured Item Representation for Recommendation with LLM Agents
by: Xie, Zhouhang, et al.
Published: (2026)
by: Xie, Zhouhang, et al.
Published: (2026)
Meta Clustering of Neural Bandits
by: Ban, Yikun, et al.
Published: (2024)
by: Ban, Yikun, et al.
Published: (2024)
EvoMem: Improving Multi-Agent Planning with Dual-Evolving Memory
by: Fan, Wenzhe, et al.
Published: (2025)
by: Fan, Wenzhe, et al.
Published: (2025)
MC-Search: Evaluating and Enhancing Multimodal Agentic Search with Structured Long Reasoning Chains
by: Ning, Xuying, et al.
Published: (2026)
by: Ning, Xuying, et al.
Published: (2026)
EvoWorld: Evolving Panoramic World Generation with Explicit 3D Memory
by: Wang, Jiahao, et al.
Published: (2025)
by: Wang, Jiahao, et al.
Published: (2025)
Generalizable Self-Evolving Memory for Automatic Prompt Optimization
by: Liang, Guanbao, et al.
Published: (2026)
by: Liang, Guanbao, et al.
Published: (2026)
FeDecider: An LLM-Based Framework for Federated Cross-Domain Recommendation
by: He, Xinrui, et al.
Published: (2026)
by: He, Xinrui, et al.
Published: (2026)
Influence-Preserving Proxies for Gradient-Based Data Selection in LLM Fine-tuning
by: Chen, Sirui, et al.
Published: (2026)
by: Chen, Sirui, et al.
Published: (2026)
Unified Embedding: Battle-Tested Feature Representations for Web-Scale ML Systems
by: Coleman, Benjamin, et al.
Published: (2023)
by: Coleman, Benjamin, et al.
Published: (2023)
AutoTool: Dynamic Tool Selection and Integration for Agentic Reasoning
by: Zou, Jiaru, et al.
Published: (2025)
by: Zou, Jiaru, et al.
Published: (2025)
EvoSelect: Data-Efficient LLM Evolution for Targeted Task Adaptation
by: Li, Ting-Wei, et al.
Published: (2026)
by: Li, Ting-Wei, et al.
Published: (2026)
APEX$^2$: Adaptive and Extreme Summarization for Personalized Knowledge Graphs
by: Li, Zihao, et al.
Published: (2024)
by: Li, Zihao, et al.
Published: (2024)
GC4NC: A Benchmark Framework for Graph Condensation on Node Classification with New Insights
by: Gong, Shengbo, et al.
Published: (2024)
by: Gong, Shengbo, et al.
Published: (2024)
EvoOpt-LLM: Evolving industrial optimization models with large language models
by: He, Yiliu, et al.
Published: (2026)
by: He, Yiliu, et al.
Published: (2026)
CoFiRec: Coarse-to-Fine Tokenization for Generative Recommendation
by: Wei, Tianxin, et al.
Published: (2025)
by: Wei, Tianxin, et al.
Published: (2025)
AdaFuse: Adaptive Ensemble Decoding with Test-Time Scaling for LLMs
by: Cui, Chengming, et al.
Published: (2026)
by: Cui, Chengming, et al.
Published: (2026)
Harnessing Consistency for Robust Test-Time LLM Ensemble
by: Zeng, Zhichen, et al.
Published: (2025)
by: Zeng, Zhichen, et al.
Published: (2025)
RAG over Tables: Hierarchical Memory Index, Multi-Stage Retrieval, and Benchmarking
by: Zou, Jiaru, et al.
Published: (2025)
by: Zou, Jiaru, et al.
Published: (2025)
i$^2$VAE: Interest Information Augmentation with Variational Regularizers for Cross-Domain Sequential Recommendation
by: Ning, Xuying, et al.
Published: (2024)
by: Ning, Xuying, et al.
Published: (2024)
Subspace Alignment for Vision-Language Model Test-time Adaptation
by: Zeng, Zhichen, et al.
Published: (2026)
by: Zeng, Zhichen, et al.
Published: (2026)
Panda: Test-Time Adaptation with Negative Data Augmentation
by: Deng, Ruxi, et al.
Published: (2025)
by: Deng, Ruxi, et al.
Published: (2025)
ReMem: Mutual Information-Aware Fine-tuning of Pretrained Vision Transformers for Effective Knowledge Distillation
by: Dong, Chengyu, et al.
Published: (2025)
by: Dong, Chengyu, et al.
Published: (2025)
Connecting Domains and Contrasting Samples: A Ladder for Domain Generalization
by: Wei, Tianxin, et al.
Published: (2025)
by: Wei, Tianxin, et al.
Published: (2025)
$A^3$-Bench: Benchmarking Memory-Driven Scientific Reasoning via Anchor and Attractor Activation
by: Zhang, Jian, et al.
Published: (2026)
by: Zhang, Jian, et al.
Published: (2026)
EvoFlow: Evolving Diverse Agentic Workflows On The Fly
by: Zhang, Guibin, et al.
Published: (2025)
by: Zhang, Guibin, et al.
Published: (2025)
On zero-sum Ramsey numbers of cycles and wheels
by: Chi, Cheng, et al.
Published: (2026)
by: Chi, Cheng, et al.
Published: (2026)
EvoEGF-Mol: Evolving Exponential Geodesic Flow for Structure-based Drug Design
by: Jin, Yaowei, et al.
Published: (2026)
by: Jin, Yaowei, et al.
Published: (2026)
MemoryBench: A Benchmark for Memory and Continual Learning in LLM Systems
by: Ai, Qingyao, et al.
Published: (2025)
by: Ai, Qingyao, et al.
Published: (2025)
Evolving Skill-Structured Attack Memory Enhances LLM Jailbreaking
by: Zhang, Junke, et al.
Published: (2026)
by: Zhang, Junke, et al.
Published: (2026)
Similar Items
-
ActionPiece: Contextually Tokenizing Action Sequences for Generative Recommendation
by: Hou, Yupeng, et al.
Published: (2025) -
Mem-Gallery: Benchmarking Multimodal Long-Term Conversational Memory for MLLM Agents
by: Bei, Yuanchen, et al.
Published: (2026) -
PACEvolve++: Improving Test-time Learning for Evolutionary Search Agents
by: Yan, Minghao, et al.
Published: (2026) -
PACEvolve: Enabling Long-Horizon Progress-Aware Consistent Evolution
by: Yan, Minghao, et al.
Published: (2026) -
How to Train Data-Efficient LLMs
by: Sachdeva, Noveen, et al.
Published: (2024)