Evaluating Memory Capability in Continuous Lifelog Scenario
Fuente:
arXiv
Saved in:
| Main Authors: | Zheng, Jianjie, Liu, Zhichen, Shen, Zhanyu, Qu, Jingxiang, Chen, Guanhua, Wang, Yile, Xu, Yang, Liu, Yang, Cheng, Sijie |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
AnchorMem: Anchored Facts with Associative Contexts for Building Memory in Large Language Models
by: Shen, Zhanyu, et al.
Published: (2026)
by: Shen, Zhanyu, et al.
Published: (2026)
Beyond the Surface: Enhancing LLM-as-a-Judge Alignment with Human via Internal Representations
by: Lai, Peng, et al.
Published: (2025)
by: Lai, Peng, et al.
Published: (2025)
LDIR: Low-Dimensional Dense and Interpretable Text Embeddings with Relative Representations
by: Wang, Yile, et al.
Published: (2025)
by: Wang, Yile, et al.
Published: (2025)
DEEM: Dynamic Experienced Expert Modeling for Stance Detection
by: Wang, Xiaolong, et al.
Published: (2024)
by: Wang, Xiaolong, et al.
Published: (2024)
Speak It Out: Solving Symbol-Related Problems with Symbol-to-Language Conversion for Language Models
by: Wang, Yile, et al.
Published: (2024)
by: Wang, Yile, et al.
Published: (2024)
Think in Sentences: Explicit Sentence Boundaries Enhance Language Model's Capabilities
by: Liu, Zhichen, et al.
Published: (2026)
by: Liu, Zhichen, et al.
Published: (2026)
GIFT: Guided Fine-Tuning and Transfer for Enhancing Instruction-Tuned Language Models
by: Ruan, Zhiwen, et al.
Published: (2026)
by: Ruan, Zhiwen, et al.
Published: (2026)
EgoThink: Evaluating First-Person Perspective Thinking Capability of Vision-Language Models
by: Cheng, Sijie, et al.
Published: (2023)
by: Cheng, Sijie, et al.
Published: (2023)
Enhancing Multilingual Capabilities of Large Language Models through Self-Distillation from Resource-Rich Languages
by: Zhang, Yuanchi, et al.
Published: (2024)
by: Zhang, Yuanchi, et al.
Published: (2024)
FinSafetyBench: Evaluating LLM Safety in Real-World Financial Scenarios
by: Hou, Yutao, et al.
Published: (2026)
by: Hou, Yutao, et al.
Published: (2026)
Visual Lifelog Retrieval through Captioning-Enhanced Interpretation
by: Shih, Yu-Fei, et al.
Published: (2025)
by: Shih, Yu-Fei, et al.
Published: (2025)
Paraphrase-Induced Output-Mode Collapse: When LLMs Break Character Under Semantically Equivalent Inputs
by: Liu, Aofan, et al.
Published: (2026)
by: Liu, Aofan, et al.
Published: (2026)
A Survey on Multi-Turn Interaction Capabilities of Large Language Models
by: Zhang, Chen, et al.
Published: (2025)
by: Zhang, Chen, et al.
Published: (2025)
The Dialogue That Heals: A Comprehensive Evaluation of Doctor Agents' Inquiry Capability
by: Gong, Linlu, et al.
Published: (2025)
by: Gong, Linlu, et al.
Published: (2025)
MemGround: Long-Term Memory Evaluation Kit for Large Language Models in Gamified Scenarios
by: Ding, Yihang, et al.
Published: (2026)
by: Ding, Yihang, et al.
Published: (2026)
Detecting Subtle Differences between Human and Model Languages Using Spectrum of Relative Likelihood
by: Xu, Yang, et al.
Published: (2024)
by: Xu, Yang, et al.
Published: (2024)
VidEgoThink: Assessing Egocentric Video Understanding Capabilities for Embodied AI
by: Cheng, Sijie, et al.
Published: (2024)
by: Cheng, Sijie, et al.
Published: (2024)
OpenChat: Advancing Open-source Language Models with Mixed-Quality Data
by: Wang, Guan, et al.
Published: (2023)
by: Wang, Guan, et al.
Published: (2023)
MedMT-Bench: Can LLMs Memorize and Understand Long Multi-Turn Conversations in Medical Scenarios?
by: Yang, Lin, et al.
Published: (2026)
by: Yang, Lin, et al.
Published: (2026)
DeCoVec: Building Decoding Space based Task Vector for Large Language Models via In-Context Learning
by: Li, Feiyang, et al.
Published: (2026)
by: Li, Feiyang, et al.
Published: (2026)
OCR-Memory: Optical Context Retrieval for Long-Horizon Agent Memory
by: Li, Jinze, et al.
Published: (2026)
by: Li, Jinze, et al.
Published: (2026)
DySem: Uncovering Dynamic Semantic Components of Large Language Models for Calculating Semantic Textual Similarity
by: Zheng, Kaijie, et al.
Published: (2026)
by: Zheng, Kaijie, et al.
Published: (2026)
CHBench: A Cognitive Hierarchy Benchmark for Evaluating Strategic Reasoning Capability of LLMs
by: Liu, Hongtao, et al.
Published: (2025)
by: Liu, Hongtao, et al.
Published: (2025)
Unveiling Over-Memorization in Finetuning LLMs for Reasoning Tasks
by: Ruan, Zhiwen, et al.
Published: (2025)
by: Ruan, Zhiwen, et al.
Published: (2025)
T-Eval: Evaluating the Tool Utilization Capability of Large Language Models Step by Step
by: Chen, Zehui, et al.
Published: (2023)
by: Chen, Zehui, et al.
Published: (2023)
FOFO: A Benchmark to Evaluate LLMs' Format-Following Capability
by: Xia, Congying, et al.
Published: (2024)
by: Xia, Congying, et al.
Published: (2024)
CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios
by: Huang, Shiting, et al.
Published: (2025)
by: Huang, Shiting, et al.
Published: (2025)
ReasonAny: Incorporating Reasoning Capability to Any Model via Simple and Effective Model Merging
by: Yang, Junyao, et al.
Published: (2026)
by: Yang, Junyao, et al.
Published: (2026)
Evaluating LLMs' Divergent Thinking Capabilities for Scientific Idea Generation with Minimal Context
by: Ruan, Kai, et al.
Published: (2024)
by: Ruan, Kai, et al.
Published: (2024)
MRScore: Evaluating Radiology Report Generation with LLM-based Reward System
by: Liu, Yunyi, et al.
Published: (2024)
by: Liu, Yunyi, et al.
Published: (2024)
UltraHorizon: Benchmarking Agent Capabilities in Ultra Long-Horizon Scenarios
by: Luo, Haotian, et al.
Published: (2025)
by: Luo, Haotian, et al.
Published: (2025)
ChartMimic: Evaluating LMM's Cross-Modal Reasoning Capability via Chart-to-Code Generation
by: Yang, Cheng, et al.
Published: (2024)
by: Yang, Cheng, et al.
Published: (2024)
SWE-CI: Evaluating Agent Capabilities in Maintaining Codebases via Continuous Integration
by: Chen, Jialong, et al.
Published: (2026)
by: Chen, Jialong, et al.
Published: (2026)
Pluggable Neural Machine Translation Models via Memory-augmented Adapters
by: Xu, Yuzhuang, et al.
Published: (2023)
by: Xu, Yuzhuang, et al.
Published: (2023)
Reasoning in Conversation: Solving Subjective Tasks through Dialogue Simulation for Large Language Models
by: Wang, Xiaolong, et al.
Published: (2024)
by: Wang, Xiaolong, et al.
Published: (2024)
ReFINE: A Reward-Based Framework for Interpretable and Nuanced Evaluation of Radiology Report Generation
by: Liu, Yunyi, et al.
Published: (2024)
by: Liu, Yunyi, et al.
Published: (2024)
Towards Automatic Evaluation for LLMs' Clinical Capabilities: Metric, Data, and Algorithm
by: Liu, Lei, et al.
Published: (2024)
by: Liu, Lei, et al.
Published: (2024)
RAGEval: Scenario Specific RAG Evaluation Dataset Generation Framework
by: Zhu, Kunlun, et al.
Published: (2024)
by: Zhu, Kunlun, et al.
Published: (2024)
OMGEval: An Open Multilingual Generative Evaluation Benchmark for Large Language Models
by: Liu, Yang, et al.
Published: (2024)
by: Liu, Yang, et al.
Published: (2024)
Evaluating the Capability of Large-scale Language Models on Chinese Grammatical Error Correction Task
by: Qu, Fanyi, et al.
Published: (2023)
by: Qu, Fanyi, et al.
Published: (2023)
Similar Items
-
AnchorMem: Anchored Facts with Associative Contexts for Building Memory in Large Language Models
by: Shen, Zhanyu, et al.
Published: (2026) -
Beyond the Surface: Enhancing LLM-as-a-Judge Alignment with Human via Internal Representations
by: Lai, Peng, et al.
Published: (2025) -
LDIR: Low-Dimensional Dense and Interpretable Text Embeddings with Relative Representations
by: Wang, Yile, et al.
Published: (2025) -
DEEM: Dynamic Experienced Expert Modeling for Stance Detection
by: Wang, Xiaolong, et al.
Published: (2024) -
Speak It Out: Solving Symbol-Related Problems with Symbol-to-Language Conversion for Language Models
by: Wang, Yile, et al.
Published: (2024)