EvolMem: A Cognitive-Driven Benchmark for Multi-Session Dialogue Memory
Fuente:
arXiv
Saved in:
| Main Authors: | Shen, Ye, Pei, Dun, Guo, Yiqiu, Wang, Junying, Guo, Yijin, Zhang, Zicheng, Jia, Qi, Zhou, Jun, Zhai, Guangtao |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
A Multi-To-One Interview Paradigm for Efficient MLLM Evaluation
by: Shen, Ye, et al.
Published: (2025)
by: Shen, Ye, et al.
Published: (2025)
QoNext: Towards Next-generation QoE for Foundation Models
by: Guo, Yijin, et al.
Published: (2025)
by: Guo, Yijin, et al.
Published: (2025)
Q-Mirror: Unlocking the Multi-Modal Potential of Scientific Text-Only QA Pairs
by: Wang, Junying, et al.
Published: (2025)
by: Wang, Junying, et al.
Published: (2025)
Affordance Benchmark for MLLMs
by: Wang, Junying, et al.
Published: (2025)
by: Wang, Junying, et al.
Published: (2025)
Improve MLLM Benchmark Efficiency through Interview
by: Wen, Farong, et al.
Published: (2025)
by: Wen, Farong, et al.
Published: (2025)
One Battle After Another: Probing LLMs' Limits on Multi-Turn Instruction Following with a Benchmark Evolving Framework
by: Jia, Qi, et al.
Published: (2025)
by: Jia, Qi, et al.
Published: (2025)
User-centric Subjective Leaderboard by Customizable Reward Modeling
by: Jia, Qi, et al.
Published: (2025)
by: Jia, Qi, et al.
Published: (2025)
Human-Centric Evaluation for Foundation Models
by: Guo, Yijin, et al.
Published: (2025)
by: Guo, Yijin, et al.
Published: (2025)
UniDial-EvalKit: A Unified Toolkit for Evaluating Multi-Faceted Conversational Abilities
by: Jia, Qi, et al.
Published: (2026)
by: Jia, Qi, et al.
Published: (2026)
The Ever-Evolving Science Exam
by: Wang, Junying, et al.
Published: (2025)
by: Wang, Junying, et al.
Published: (2025)
MedOmni-45°: A Safety-Performance Benchmark for Reasoning-Oriented LLMs in Medicine
by: Ji, Kaiyuan, et al.
Published: (2025)
by: Ji, Kaiyuan, et al.
Published: (2025)
STAR : Bridging Statistical and Agentic Reasoning for Large Model Performance Prediction
by: Wang, Xiaoxiao, et al.
Published: (2026)
by: Wang, Xiaoxiao, et al.
Published: (2026)
SIQA: Toward Reliable Scientific Image Quality Assessment
by: Li, Wenzhe, et al.
Published: (2026)
by: Li, Wenzhe, et al.
Published: (2026)
MemGuide: Intent-Driven Memory Selection for Goal-Oriented Multi-Session LLM Agents
by: Du, Yiming, et al.
Published: (2025)
by: Du, Yiming, et al.
Published: (2025)
RealMem: Benchmarking LLMs in Real-World Memory-Driven Interaction
by: Bian, Haonan, et al.
Published: (2026)
by: Bian, Haonan, et al.
Published: (2026)
Q-Bench+: A Benchmark for Multi-modal Foundation Models on Low-level Vision from Single Images to Pairs
by: Zhang, Zicheng, et al.
Published: (2024)
by: Zhang, Zicheng, et al.
Published: (2024)
MemCast: Memory-Driven Time Series Forecasting with Experience-Conditioned Reasoning
by: Tao, Xiaoyu, et al.
Published: (2026)
by: Tao, Xiaoyu, et al.
Published: (2026)
MirrorBench: Evaluating Self-centric Intelligence in MLLMs by Introducing a Mirror
by: Guo, Shengyu, et al.
Published: (2026)
by: Guo, Shengyu, et al.
Published: (2026)
Post Persona Alignment for Multi-Session Dialogue Generation
by: Chen, Yi-Pei, et al.
Published: (2025)
by: Chen, Yi-Pei, et al.
Published: (2025)
Tag-Evol: Achieving Efficient Instruction Evolving via Tag Injection
by: Wang, Yixuan, et al.
Published: (2025)
by: Wang, Yixuan, et al.
Published: (2025)
LM Fight Arena: Benchmarking Large Multimodal Models via Game Competition
by: Zheng, Yushuo, et al.
Published: (2025)
by: Zheng, Yushuo, et al.
Published: (2025)
VideoAesBench: Benchmarking the Video Aesthetics Perception Capabilities of Large Multimodal Models
by: Li, Yunhao, et al.
Published: (2026)
by: Li, Yunhao, et al.
Published: (2026)
MemoryArena: Benchmarking Agent Memory in Interdependent Multi-Session Agentic Tasks
by: He, Zexue, et al.
Published: (2026)
by: He, Zexue, et al.
Published: (2026)
Q-Bench-Portrait: Benchmarking Multimodal Large Language Models on Portrait Image Quality Perception
by: Wu, Sijing, et al.
Published: (2026)
by: Wu, Sijing, et al.
Published: (2026)
MEMO-Bench: A Multiple Benchmark for Text-to-Image and Multimodal Large Language Models on Human Emotion Analysis
by: Zhou, Yingjie, et al.
Published: (2024)
by: Zhou, Yingjie, et al.
Published: (2024)
Teaching LMMs for Image Quality Scoring and Interpreting
by: Zhang, Zicheng, et al.
Published: (2025)
by: Zhang, Zicheng, et al.
Published: (2025)
AU-IQA: A Benchmark Dataset for Perceptual Quality Assessment of AI-Enhanced User-Generated Content
by: Wang, Shushi, et al.
Published: (2025)
by: Wang, Shushi, et al.
Published: (2025)
MemFly: On-the-Fly Memory Optimization via Information Bottleneck
by: Zhang, Zhenyuan, et al.
Published: (2026)
by: Zhang, Zhenyuan, et al.
Published: (2026)
SkillEvolBench: Benchmarking the Evolution from Episodic Experience to Procedural Skills
by: Lei, Yingtie, et al.
Published: (2026)
by: Lei, Yingtie, et al.
Published: (2026)
Market-Bench: Benchmarking Large Language Models on Economic and Trade Competition
by: Zheng, Yushuo, et al.
Published: (2026)
by: Zheng, Yushuo, et al.
Published: (2026)
Large Multi-modality Model Assisted AI-Generated Image Quality Assessment
by: Wang, Puyi, et al.
Published: (2024)
by: Wang, Puyi, et al.
Published: (2024)
MemCog: From Memory-as-Tool to Memory-as-Cognition in Conversational Agents
by: Li, Zihan, et al.
Published: (2026)
by: Li, Zihan, et al.
Published: (2026)
GOBench: Benchmarking Geometric Optics Generation and Understanding of MLLMs
by: Zhu, Xiaorong, et al.
Published: (2025)
by: Zhu, Xiaorong, et al.
Published: (2025)
All-Mem: Agentic Lifelong Memory via Dynamic Topology Evolution
by: Lv, Can, et al.
Published: (2026)
by: Lv, Can, et al.
Published: (2026)
RoboMemArena: A Comprehensive and Challenging Robotic Memory Benchmark
by: Lei, Huashuo, et al.
Published: (2026)
by: Lei, Huashuo, et al.
Published: (2026)
HyperMem: Hypergraph Memory for Long-Term Conversations
by: Yue, Juwei, et al.
Published: (2026)
by: Yue, Juwei, et al.
Published: (2026)
AdaMem: Adaptive User-Centric Memory for Long-Horizon Dialogue Agents
by: Yan, Shannan, et al.
Published: (2026)
by: Yan, Shannan, et al.
Published: (2026)
ES-Mem: Event Segmentation-Based Memory for Long-Term Dialogue Agents
by: Zou, Huhai, et al.
Published: (2026)
by: Zou, Huhai, et al.
Published: (2026)
GroupMemBench: Benchmarking LLM Agent Memory in Multi-Party Conversations
by: Yang, Jingbo, et al.
Published: (2026)
by: Yang, Jingbo, et al.
Published: (2026)
IllusionBench+: A Large-scale and Comprehensive Benchmark for Visual Illusion Understanding in Vision-Language Models
by: Zhang, Yiming, et al.
Published: (2025)
by: Zhang, Yiming, et al.
Published: (2025)
Similar Items
-
A Multi-To-One Interview Paradigm for Efficient MLLM Evaluation
by: Shen, Ye, et al.
Published: (2025) -
QoNext: Towards Next-generation QoE for Foundation Models
by: Guo, Yijin, et al.
Published: (2025) -
Q-Mirror: Unlocking the Multi-Modal Potential of Scientific Text-Only QA Pairs
by: Wang, Junying, et al.
Published: (2025) -
Affordance Benchmark for MLLMs
by: Wang, Junying, et al.
Published: (2025) -
Improve MLLM Benchmark Efficiency through Interview
by: Wen, Farong, et al.
Published: (2025)