Mem-Gallery: Benchmarking Multimodal Long-Term Conversational Memory for MLLM Agents
Fuente:
arXiv
Saved in:
| Main Authors: | Bei, Yuanchen, Wei, Tianxin, Ning, Xuying, Zhao, Yanjun, Liu, Zhining, Lin, Xiao, Zhu, Yada, Hamann, Hendrik, He, Jingrui, Tong, Hanghang |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MC-Search: Evaluating and Enhancing Multimodal Agentic Search with Structured Long Reasoning Chains
by: Ning, Xuying, et al.
Published: (2026)
by: Ning, Xuying, et al.
Published: (2026)
PaperMind: Benchmarking Agentic Reasoning and Critique over Scientific Papers in Multimodal LLMs
by: Zhao, Yanjun, et al.
Published: (2026)
by: Zhao, Yanjun, et al.
Published: (2026)
CLIMB: Class-imbalanced Learning Benchmark on Tabular Data
by: Liu, Zhining, et al.
Published: (2025)
by: Liu, Zhining, et al.
Published: (2025)
Breaking Silos: Adaptive Model Fusion Unlocks Better Time Series Forecasting
by: Liu, Zhining, et al.
Published: (2025)
by: Liu, Zhining, et al.
Published: (2025)
AIM: Attributing, Interpreting, Mitigating Data Unfairness
by: Liu, Zhining, et al.
Published: (2024)
by: Liu, Zhining, et al.
Published: (2024)
Graph4MM: Weaving Multimodal Learning with Structural Information
by: Ning, Xuying, et al.
Published: (2025)
by: Ning, Xuying, et al.
Published: (2025)
Evo-Memory: Benchmarking LLM Agent Test-time Learning with Self-Evolving Memory
by: Wei, Tianxin, et al.
Published: (2025)
by: Wei, Tianxin, et al.
Published: (2025)
Language in the Flow of Time: Time-Series-Paired Texts Weaved into a Unified Temporal Narrative
by: Li, Zihao, et al.
Published: (2025)
by: Li, Zihao, et al.
Published: (2025)
ClimateBench-M: A Multi-Modal Climate Data Benchmark with a Simple Generative Method
by: Fu, Dongqi, et al.
Published: (2025)
by: Fu, Dongqi, et al.
Published: (2025)
FeDecider: An LLM-Based Framework for Federated Cross-Domain Recommendation
by: He, Xinrui, et al.
Published: (2026)
by: He, Xinrui, et al.
Published: (2026)
Harnessing Consistency for Robust Test-Time LLM Ensemble
by: Zeng, Zhichen, et al.
Published: (2025)
by: Zeng, Zhichen, et al.
Published: (2025)
Flow Matching Meets Biology and Life Science: A Survey
by: Li, Zihao, et al.
Published: (2025)
by: Li, Zihao, et al.
Published: (2025)
MemRouter: Memory-as-Embedding Routing for Long-Term Conversational Agents
by: Hu, Tianyu, et al.
Published: (2026)
by: Hu, Tianyu, et al.
Published: (2026)
Matcha: Mitigating Graph Structure Shifts with Test-Time Adaptation
by: Bao, Wenxuan, et al.
Published: (2024)
by: Bao, Wenxuan, et al.
Published: (2024)
Saffron-1: Safety Inference Scaling
by: Qiu, Ruizhong, et al.
Published: (2025)
by: Qiu, Ruizhong, et al.
Published: (2025)
HyperMem: Hypergraph Memory for Long-Term Conversations
by: Yue, Juwei, et al.
Published: (2026)
by: Yue, Juwei, et al.
Published: (2026)
VehicleMemBench: An Executable Benchmark for Multi-User Long-Term Memory in In-Vehicle Agents
by: Chen, Yuhao, et al.
Published: (2026)
by: Chen, Yuhao, et al.
Published: (2026)
AdaFuse: Adaptive Ensemble Decoding with Test-Time Scaling for LLMs
by: Cui, Chengming, et al.
Published: (2026)
by: Cui, Chengming, et al.
Published: (2026)
CATS: Mitigating Correlation Shift for Multivariate Time Series Classification
by: Lin, Xiao, et al.
Published: (2025)
by: Lin, Xiao, et al.
Published: (2025)
Subspace Alignment for Vision-Language Model Test-time Adaptation
by: Zeng, Zhichen, et al.
Published: (2026)
by: Zeng, Zhichen, et al.
Published: (2026)
MemLens: Benchmarking Multimodal Long-Term Memory in Large Vision-Language Models
by: Ren, Xiyu, et al.
Published: (2026)
by: Ren, Xiyu, et al.
Published: (2026)
ES-MemEval: Benchmarking Conversational Agents on Personalized Long-Term Emotional Support
by: Chen, Tiantian, et al.
Published: (2026)
by: Chen, Tiantian, et al.
Published: (2026)
TeleMem: Building Long-Term and Multimodal Memory for Agentic AI
by: Chen, Chunliang, et al.
Published: (2025)
by: Chen, Chunliang, et al.
Published: (2025)
EviMem: Evidence-Gap-Driven Iterative Retrieval for Long-Term Conversational Memory
by: Li, Yuyang, et al.
Published: (2026)
by: Li, Yuyang, et al.
Published: (2026)
Generating Fine-Grained Causality in Climate Time Series Data for Forecasting and Anomaly Detection
by: Fu, Dongqi, et al.
Published: (2024)
by: Fu, Dongqi, et al.
Published: (2024)
SelfElicit: Your Language Model Secretly Knows Where is the Relevant Evidence
by: Liu, Zhining, et al.
Published: (2025)
by: Liu, Zhining, et al.
Published: (2025)
CloneMem: Benchmarking Long-Term Memory for AI Clones
by: Hu, Sen, et al.
Published: (2026)
by: Hu, Sen, et al.
Published: (2026)
Latte: Collaborative Test-Time Adaptation of Vision-Language Models in Federated Learning
by: Bao, Wenxuan, et al.
Published: (2025)
by: Bao, Wenxuan, et al.
Published: (2025)
LongMemEval: Benchmarking Chat Assistants on Long-Term Interactive Memory
by: Wu, Di, et al.
Published: (2024)
by: Wu, Di, et al.
Published: (2024)
Class-Imbalanced Graph Learning without Class Rebalancing
by: Liu, Zhining, et al.
Published: (2023)
by: Liu, Zhining, et al.
Published: (2023)
ES-Mem: Event Segmentation-Based Memory for Long-Term Dialogue Agents
by: Zou, Huhai, et al.
Published: (2026)
by: Zou, Huhai, et al.
Published: (2026)
HiMem: Hierarchical Long-Term Memory for LLM Long-Horizon Agents
by: Zhang, Ningning, et al.
Published: (2026)
by: Zhang, Ningning, et al.
Published: (2026)
DimMem: Dimensional Structuring for Efficient Long-Term Agent Memory
by: Qiu, Wentao, et al.
Published: (2026)
by: Qiu, Wentao, et al.
Published: (2026)
Neural Active Learning Beyond Bandits
by: Ban, Yikun, et al.
Published: (2024)
by: Ban, Yikun, et al.
Published: (2024)
MemReader: From Passive to Active Extraction for Long-Term Agent Memory
by: Kang, Jingyi, et al.
Published: (2026)
by: Kang, Jingyi, et al.
Published: (2026)
ALERT: Zero-shot LLM Jailbreak Detection via Internal Discrepancy Amplification
by: Lin, Xiao, et al.
Published: (2026)
by: Lin, Xiao, et al.
Published: (2026)
GroupMemBench: Benchmarking LLM Agent Memory in Multi-Party Conversations
by: Yang, Jingbo, et al.
Published: (2026)
by: Yang, Jingbo, et al.
Published: (2026)
TiMem: Temporal-Hierarchical Memory Consolidation for Long-Horizon Conversational Agents
by: Li, Kai, et al.
Published: (2026)
by: Li, Kai, et al.
Published: (2026)
TA-Mem: Tool-Augmented Autonomous Memory Retrieval for LLM in Long-Term Conversational QA
by: Yuan, Mengwei, et al.
Published: (2026)
by: Yuan, Mengwei, et al.
Published: (2026)
TSAQA: Time Series Analysis Question And Answering Benchmark
by: Jing, Baoyu, et al.
Published: (2026)
by: Jing, Baoyu, et al.
Published: (2026)
Similar Items
-
MC-Search: Evaluating and Enhancing Multimodal Agentic Search with Structured Long Reasoning Chains
by: Ning, Xuying, et al.
Published: (2026) -
PaperMind: Benchmarking Agentic Reasoning and Critique over Scientific Papers in Multimodal LLMs
by: Zhao, Yanjun, et al.
Published: (2026) -
CLIMB: Class-imbalanced Learning Benchmark on Tabular Data
by: Liu, Zhining, et al.
Published: (2025) -
Breaking Silos: Adaptive Model Fusion Unlocks Better Time Series Forecasting
by: Liu, Zhining, et al.
Published: (2025) -
AIM: Attributing, Interpreting, Mitigating Data Unfairness
by: Liu, Zhining, et al.
Published: (2024)