Saved in:
| Main Authors: | Bian, Haonan, Yao, Zhiyuan, Hu, Sen, Xu, Zishan, Zhang, Shaolei, Guo, Yifu, Yang, Ziliang, Han, Xueran, Wang, Huacan, Chen, Ronghao |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2601.06966 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
CloneMem: Benchmarking Long-Term Memory for AI Clones
by: Hu, Sen, et al.
Published: (2026)
by: Hu, Sen, et al.
Published: (2026)
Does Memory Need Graphs? A Unified Framework and Empirical Analysis for Long-Term Dialog Memory
by: Hu, Sen, et al.
Published: (2026)
by: Hu, Sen, et al.
Published: (2026)
Octopus: Agentic Multimodal Reasoning with Six-Capability Orchestration
by: Guo, Yifu, et al.
Published: (2025)
by: Guo, Yifu, et al.
Published: (2025)
MemGovern: Enhancing Code Agents through Learning from Governed Human Experiences
by: Wang, Qihao, et al.
Published: (2026)
by: Wang, Qihao, et al.
Published: (2026)
GitTaskBench: A Benchmark for Code Agents Solving Real-World Tasks Through Code Repository Leveraging
by: Ni, Ziyi, et al.
Published: (2025)
by: Ni, Ziyi, et al.
Published: (2025)
MemFactory: Unified Inference & Training Framework for Agent Memory
by: Guo, Ziliang, et al.
Published: (2026)
by: Guo, Ziliang, et al.
Published: (2026)
Controlled Self-Evolution for Algorithmic Code Optimization
by: Hu, Tu, et al.
Published: (2026)
by: Hu, Tu, et al.
Published: (2026)
EvolMem: A Cognitive-Driven Benchmark for Multi-Session Dialogue Memory
by: Shen, Ye, et al.
Published: (2026)
by: Shen, Ye, et al.
Published: (2026)
ACE-Router: Generalizing History-Aware Routing from MCP Tools to the Agent Web
by: Yao, Zhiyuan, et al.
Published: (2026)
by: Yao, Zhiyuan, et al.
Published: (2026)
SkillGenBench: Benchmarking Skill Generation Pipelines for LLM Agents
by: Zhou, Yifan, et al.
Published: (2026)
by: Zhou, Yifan, et al.
Published: (2026)
SE-Agent: Self-Evolution Trajectory Optimization in Multi-Step Reasoning with LLM-Based Agents
by: Lin, Jiaye, et al.
Published: (2025)
by: Lin, Jiaye, et al.
Published: (2025)
BizFinBench: A Business-Driven Real-World Financial Benchmark for Evaluating LLMs
by: Lu, Guilong, et al.
Published: (2025)
by: Lu, Guilong, et al.
Published: (2025)
WorldMemArena: Evaluating Multimodal Agent Memory Through Action-World Interaction
by: Liu, Chengzhi, et al.
Published: (2026)
by: Liu, Chengzhi, et al.
Published: (2026)
StructMem: Structured Memory for Long-Horizon Behavior in LLMs
by: Xu, Buqiang, et al.
Published: (2026)
by: Xu, Buqiang, et al.
Published: (2026)
KnowMe-Bench: Benchmarking Person Understanding for Lifelong Digital Companions
by: Wu, Tingyu, et al.
Published: (2026)
by: Wu, Tingyu, et al.
Published: (2026)
MemGS: Memory-Efficient Gaussian Splatting for Real-Time SLAM
by: Bai, Yinlong, et al.
Published: (2025)
by: Bai, Yinlong, et al.
Published: (2025)
VideoSeg-R1:Reasoning Video Object Segmentation via Reinforcement Learning
by: Xu, Zishan, et al.
Published: (2025)
by: Xu, Zishan, et al.
Published: (2025)
MineWorld: a Real-Time and Open-Source Interactive World Model on Minecraft
by: Guo, Junliang, et al.
Published: (2025)
by: Guo, Junliang, et al.
Published: (2025)
RepoMaster: Autonomous Exploration and Understanding of GitHub Repositories for Complex Task Solving
by: Wang, Huacan, et al.
Published: (2025)
by: Wang, Huacan, et al.
Published: (2025)
Neural Theorem Proving for Verification Conditions: A Real-World Benchmark
by: Xu, Qiyuan, et al.
Published: (2026)
by: Xu, Qiyuan, et al.
Published: (2026)
LongMemEval: Benchmarking Chat Assistants on Long-Term Interactive Memory
by: Wu, Di, et al.
Published: (2024)
by: Wu, Di, et al.
Published: (2024)
FINRS: A Risk-Sensitive Trading Framework for Real Financial Markets
by: Liu, Bijia, et al.
Published: (2025)
by: Liu, Bijia, et al.
Published: (2025)
$τ$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains
by: Yao, Shunyu, et al.
Published: (2024)
by: Yao, Shunyu, et al.
Published: (2024)
TRIP-Bench: A Benchmark for Long-Horizon Interactive Agents in Real-World Scenarios
by: Shen, Yuanzhe, et al.
Published: (2026)
by: Shen, Yuanzhe, et al.
Published: (2026)
PLawBench: A Rubric-Based Benchmark for Evaluating LLMs in Real-World Legal Practice
by: Shi, Yuzhen, et al.
Published: (2026)
by: Shi, Yuzhen, et al.
Published: (2026)
QuarkMedBench: A Real-World Scenario Driven Benchmark for Evaluating Large Language Models
by: Wu, Yao, et al.
Published: (2026)
by: Wu, Yao, et al.
Published: (2026)
QuantaAlpha: An Evolutionary Framework for LLM-Driven Alpha Mining
by: Han, Jun, et al.
Published: (2026)
by: Han, Jun, et al.
Published: (2026)
TerminalWorld: Benchmarking Agents on Real-World Terminal Tasks
by: Chu, Zhaoyang, et al.
Published: (2026)
by: Chu, Zhaoyang, et al.
Published: (2026)
MemRerank: Preference Memory for Personalized Product Reranking
by: Peng, Zhiyuan, et al.
Published: (2026)
by: Peng, Zhiyuan, et al.
Published: (2026)
FinPos: A Position-Aware Trading Agent System for Real Financial Markets
by: Liu, Bijia, et al.
Published: (2025)
by: Liu, Bijia, et al.
Published: (2025)
PATCHEVAL: A New Benchmark for Evaluating LLMs on Patching Real-World Vulnerabilities
by: Wei, Zichao, et al.
Published: (2025)
by: Wei, Zichao, et al.
Published: (2025)
WorldMem: Long-term Consistent World Simulation with Memory
by: Xiao, Zeqi, et al.
Published: (2025)
by: Xiao, Zeqi, et al.
Published: (2025)
RealBench: Benchmarking Verilog Generation Models with Real-World IP Designs
by: Jin, Pengwei, et al.
Published: (2025)
by: Jin, Pengwei, et al.
Published: (2025)
WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs
by: Hong, Jack, et al.
Published: (2025)
by: Hong, Jack, et al.
Published: (2025)
RIVER: A Real-Time Interaction Benchmark for Video LLMs
by: Shi, Yansong, et al.
Published: (2026)
by: Shi, Yansong, et al.
Published: (2026)
TIME: A Multi-level Benchmark for Temporal Reasoning of LLMs in Real-World Scenarios
by: Wei, Shaohang, et al.
Published: (2025)
by: Wei, Shaohang, et al.
Published: (2025)
Pastiche Novel Generation Creating: Fan Fiction You Love in Your Favorite Author's Style
by: Han, Xueran, et al.
Published: (2025)
by: Han, Xueran, et al.
Published: (2025)
Benchmarking LLMs for Unit Test Generation from Real-World Functions
by: Huang, Dong, et al.
Published: (2025)
by: Huang, Dong, et al.
Published: (2025)
Flexible Memory: Progress, Challenges, and Opportunities
by: Ruizhi Yuan, et al.
Published: (2025)
by: Ruizhi Yuan, et al.
Published: (2025)
DMAD: Dual Memory Bank for Real-World Anomaly Detection
by: Hu, Jianlong, et al.
Published: (2024)
by: Hu, Jianlong, et al.
Published: (2024)
Similar Items
-
CloneMem: Benchmarking Long-Term Memory for AI Clones
by: Hu, Sen, et al.
Published: (2026) -
Does Memory Need Graphs? A Unified Framework and Empirical Analysis for Long-Term Dialog Memory
by: Hu, Sen, et al.
Published: (2026) -
Octopus: Agentic Multimodal Reasoning with Six-Capability Orchestration
by: Guo, Yifu, et al.
Published: (2025) -
MemGovern: Enhancing Code Agents through Learning from Governed Human Experiences
by: Wang, Qihao, et al.
Published: (2026) -
GitTaskBench: A Benchmark for Code Agents Solving Real-World Tasks Through Code Repository Leveraging
by: Ni, Ziyi, et al.
Published: (2025)