AMA-Bench: Evaluating Long-Horizon Memory for Agentic Applications
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhao, Yujie, Yuan, Boqin, Huang, Junbo, Yuan, Haocheng, Yu, Zhongming, Xu, Haozhou, Hu, Lanxiang, Shankarampeta, Abhilash, Huang, Zimeng, Ni, Wentao, Tian, Yuandong, Zhao, Jishen |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Benchmarking Scientific Understanding and Reasoning for Video Generation using VideoScience-Bench
por: Hu, Lanxiang, et al.
Publicado: (2025)
por: Hu, Lanxiang, et al.
Publicado: (2025)
Towards Interpretable and Inference-Optimal COT Reasoning with Sparse Autoencoder-Guided Generation
por: Zhao, Daniel, et al.
Publicado: (2025)
por: Zhao, Daniel, et al.
Publicado: (2025)
PRO-V-R1: Reasoning Enhanced Programming Agent for RTL Verification
por: Zhao, Yujie, et al.
Publicado: (2025)
por: Zhao, Yujie, et al.
Publicado: (2025)
You Only Use Reactive Attention Slice For Long Context Retrieval
por: Soh, Yun Joon, et al.
Publicado: (2024)
por: Soh, Yun Joon, et al.
Publicado: (2024)
Multi-Agent Memory from a Computer Architecture Perspective: Visions and Challenges Ahead
por: Yu, Zhongming, et al.
Publicado: (2026)
por: Yu, Zhongming, et al.
Publicado: (2026)
MAGE: A Multi-Agent Engine for Automated RTL Code Generation
por: Zhao, Yujie, et al.
Publicado: (2024)
por: Zhao, Yujie, et al.
Publicado: (2024)
L-MARS: Legal Multi-Agent Workflow with Orchestrated Reasoning and Agentic Search
por: Wang, Ziqi, et al.
Publicado: (2025)
por: Wang, Ziqi, et al.
Publicado: (2025)
OrcaLoca: An LLM Agent Framework for Software Issue Localization
por: Yu, Zhongming, et al.
Publicado: (2025)
por: Yu, Zhongming, et al.
Publicado: (2025)
Stronger-MAS: Multi-Agent Reinforcement Learning for Collaborative LLMs
por: Zhao, Yujie, et al.
Publicado: (2025)
por: Zhao, Yujie, et al.
Publicado: (2025)
Evidence-Guided Schema Normalization for Temporal Tabular Reasoning
por: Thanga, Ashish, et al.
Publicado: (2025)
por: Thanga, Ashish, et al.
Publicado: (2025)
GeoT: Tensor Centric Library for Graph Neural Network via Efficient Segment Reduction on GPU
por: Yu, Zhongming, et al.
Publicado: (2024)
por: Yu, Zhongming, et al.
Publicado: (2024)
SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters
por: Wang, Yiping, et al.
Publicado: (2025)
por: Wang, Yiping, et al.
Publicado: (2025)
Diagnosing Retrieval vs. Utilization Bottlenecks in LLM Agent Memory
por: Yuan, Boqin, et al.
Publicado: (2026)
por: Yuan, Boqin, et al.
Publicado: (2026)
LLM4Cov: Execution-Aware Agentic Learning for High-coverage Testbench Generation
por: Zhang, Hejia, et al.
Publicado: (2026)
por: Zhang, Hejia, et al.
Publicado: (2026)
Double-P: Hierarchical Top-P Sparse Attention for Long-Context LLMs
por: Ni, Wentao, et al.
Publicado: (2026)
por: Ni, Wentao, et al.
Publicado: (2026)
Multi-modal Learning for WebAssembly Reverse Engineering
por: Huang, Hanxian, et al.
Publicado: (2024)
por: Huang, Hanxian, et al.
Publicado: (2024)
TransientTables: Evaluating LLMs' Reasoning on Temporally Evolving Semi-structured Tables
por: Shankarampeta, Abhilash, et al.
Publicado: (2025)
por: Shankarampeta, Abhilash, et al.
Publicado: (2025)
LifeBench: A Benchmark for Long-Horizon Multi-Source Memory
por: Cheng, Zihao, et al.
Publicado: (2026)
por: Cheng, Zihao, et al.
Publicado: (2026)
Seeing, Listening, Remembering, and Reasoning: A Multimodal Agent with Long-Term Memory
por: Long, Lin, et al.
Publicado: (2025)
por: Long, Lin, et al.
Publicado: (2025)
AMA: Adaptive Memory via Multi-Agent Collaboration
por: Huang, Weiquan, et al.
Publicado: (2026)
por: Huang, Weiquan, et al.
Publicado: (2026)
MemWeaver: Weaving Hybrid Memories for Traceable Long-Horizon Agentic Reasoning
por: Ye, Juexiang, et al.
Publicado: (2026)
por: Ye, Juexiang, et al.
Publicado: (2026)
BranPO: Scalable Contrastive Branch Sampling for Long-Horizon Agentic Reinforcement Learning
por: Zhao, Yubao, et al.
Publicado: (2026)
por: Zhao, Yubao, et al.
Publicado: (2026)
Harmonizing Real-Time Constraints and Long-Horizon Reasoning: An Asynchronous Agentic Framework for Dynamic Scheduling
por: Cao, Shijie, et al.
Publicado: (2026)
por: Cao, Shijie, et al.
Publicado: (2026)
Chain-of-Thought and Compressed Looped Transformers: A Memory-Budget Separation
por: Zhang, Haozhou
Publicado: (2026)
por: Zhang, Haozhou
Publicado: (2026)
DeltaMem: Towards Agentic Memory Management via Reinforcement Learning
por: Zhang, Qi, et al.
Publicado: (2026)
por: Zhang, Qi, et al.
Publicado: (2026)
DecisionBench: A Benchmark for Emergent Delegation in Long-Horizon Agentic Workflows
por: Gao, Yuxuan, et al.
Publicado: (2026)
por: Gao, Yuxuan, et al.
Publicado: (2026)
Navigate Complex Physical Worlds via Geometrically Constrained LLM
por: Huang, Yongqiang, et al.
Publicado: (2024)
por: Huang, Yongqiang, et al.
Publicado: (2024)
Memory as Action: Autonomous Context Curation for Long-Horizon Agentic Tasks
por: Zhang, Yuxiang, et al.
Publicado: (2025)
por: Zhang, Yuxiang, et al.
Publicado: (2025)
AdaMem: Adaptive User-Centric Memory for Long-Horizon Dialogue Agents
por: Yan, Shannan, et al.
Publicado: (2026)
por: Yan, Shannan, et al.
Publicado: (2026)
RoadmapBench: Evaluating Long-Horizon Agentic Software Development Across Version Upgrades
por: Xu, Xinbo, et al.
Publicado: (2026)
por: Xu, Xinbo, et al.
Publicado: (2026)
FlowBench: Revisiting and Benchmarking Workflow-Guided Planning for LLM-based Agents
por: Xiao, Ruixuan, et al.
Publicado: (2024)
por: Xiao, Ruixuan, et al.
Publicado: (2024)
SpecBench: Measuring Reward Hacking in Long-Horizon Coding Agents
por: Zhao, Bingchen, et al.
Publicado: (2026)
por: Zhao, Bingchen, et al.
Publicado: (2026)
Table-as-Search: Formulate Long-Horizon Agentic Information Seeking as Table Completion
por: Lan, Tian, et al.
Publicado: (2026)
por: Lan, Tian, et al.
Publicado: (2026)
HorizonBench: Long-Horizon Personalization with Evolving Preferences
por: Li, Shuyue Stella, et al.
Publicado: (2026)
por: Li, Shuyue Stella, et al.
Publicado: (2026)
Fork is All You Need in Heterogeneous Systems
por: Wang, Zixuan, et al.
Publicado: (2024)
por: Wang, Zixuan, et al.
Publicado: (2024)
Grounding Large Language Models In Embodied Environment With Imperfect World Models
por: Liu, Haolan, et al.
Publicado: (2024)
por: Liu, Haolan, et al.
Publicado: (2024)
LiCoMemory: Lightweight and Cognitive Agentic Memory for Efficient Long-Term Reasoning
por: Huang, Zhengjun, et al.
Publicado: (2025)
por: Huang, Zhengjun, et al.
Publicado: (2025)
Construction of Acid and Salt Resistance Poly (Aromatic Ether Sulfone) Materials via Actively Capturing Cations Driven by Cation‐π Interactions
por: Lanxiang Huang, et al.
Publicado: (2025)
por: Lanxiang Huang, et al.
Publicado: (2025)
MementoGUI: Learning Agentic Multimodal Memory Control for Long-Horizon GUI Agents
por: Zeng, Ziyun, et al.
Publicado: (2026)
por: Zeng, Ziyun, et al.
Publicado: (2026)
Toward Agentic AI: Task-Oriented Communication for Hierarchical Planning of Long-Horizon Tasks
por: Huang, Sin-Yu, et al.
Publicado: (2026)
por: Huang, Sin-Yu, et al.
Publicado: (2026)
Ejemplares similares
-
Benchmarking Scientific Understanding and Reasoning for Video Generation using VideoScience-Bench
por: Hu, Lanxiang, et al.
Publicado: (2025) -
Towards Interpretable and Inference-Optimal COT Reasoning with Sparse Autoencoder-Guided Generation
por: Zhao, Daniel, et al.
Publicado: (2025) -
PRO-V-R1: Reasoning Enhanced Programming Agent for RTL Verification
por: Zhao, Yujie, et al.
Publicado: (2025) -
You Only Use Reactive Attention Slice For Long Context Retrieval
por: Soh, Yun Joon, et al.
Publicado: (2024) -
Multi-Agent Memory from a Computer Architecture Perspective: Visions and Challenges Ahead
por: Yu, Zhongming, et al.
Publicado: (2026)