Beyond pass@1: A Reliability Science Framework for Long-Horizon LLM Agents
Fuente:
arXiv
Salvato in:
| Autori principali: | Khanal, Aaditya, Tao, Yangyang, Zhou, Junxiu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Severe Domain Shift in Skeleton-Based Action Recognition:A Study of Uncertainty Failure in Real-World Gym Environments
di: Khanal, Aaditya, et al.
Pubblicazione: (2026)
di: Khanal, Aaditya, et al.
Pubblicazione: (2026)
A Subgoal-driven Framework for Improving Long-Horizon LLM Agents
di: Wang, Taiyi, et al.
Pubblicazione: (2026)
di: Wang, Taiyi, et al.
Pubblicazione: (2026)
AgentLAB: Benchmarking LLM Agents against Long-Horizon Attacks
di: Jiang, Tanqiu, et al.
Pubblicazione: (2026)
di: Jiang, Tanqiu, et al.
Pubblicazione: (2026)
Aligning Progress and Feasibility: A Neuro-Symbolic Dual Memory Framework for Long-Horizon LLM Agents
di: Wen, Bin, et al.
Pubblicazione: (2026)
di: Wen, Bin, et al.
Pubblicazione: (2026)
Beyond Entangled Planning: Task-Decoupled Planning for Long-Horizon Agents
di: Li, Yunfan, et al.
Pubblicazione: (2026)
di: Li, Yunfan, et al.
Pubblicazione: (2026)
Can LLM Agents Sustain Long-Horizon Organizational Dynamics?
di: Zhu, Xuancheng, et al.
Pubblicazione: (2026)
di: Zhu, Xuancheng, et al.
Pubblicazione: (2026)
Parallel Context Compaction for Long-Horizon LLM Agent Serving
di: Cim, Musa, et al.
Pubblicazione: (2026)
di: Cim, Musa, et al.
Pubblicazione: (2026)
Co-Evolving LLM Decision and Skill Bank Agents for Long-Horizon Tasks
di: Wu, Xiyang, et al.
Pubblicazione: (2026)
di: Wu, Xiyang, et al.
Pubblicazione: (2026)
HiMem: Hierarchical Long-Term Memory for LLM Long-Horizon Agents
di: Zhang, Ningning, et al.
Pubblicazione: (2026)
di: Zhang, Ningning, et al.
Pubblicazione: (2026)
Hindsight Credit Assignment for Long-Horizon LLM Agents
di: Tan, Hui-Ze, et al.
Pubblicazione: (2026)
di: Tan, Hui-Ze, et al.
Pubblicazione: (2026)
Continuum Memory Architectures for Long-Horizon LLM Agents
di: Logan, Joe
Pubblicazione: (2026)
di: Logan, Joe
Pubblicazione: (2026)
Reinforcement Learning for Long-Horizon Interactive LLM Agents
di: Chen, Kevin, et al.
Pubblicazione: (2025)
di: Chen, Kevin, et al.
Pubblicazione: (2025)
InternAgent-1.5: A Unified Agentic Framework for Long-Horizon Autonomous Scientific Discovery
di: Feng, Shiyang, et al.
Pubblicazione: (2026)
di: Feng, Shiyang, et al.
Pubblicazione: (2026)
Causal Intervention-Based Memory Selection for Long-Horizon LLM Agents
di: Srivastava, Saksham Sahai
Pubblicazione: (2026)
di: Srivastava, Saksham Sahai
Pubblicazione: (2026)
Aeon: High-Performance Neuro-Symbolic Memory Management for Long-Horizon LLM Agents
di: Arslan, Mustafa
Pubblicazione: (2026)
di: Arslan, Mustafa
Pubblicazione: (2026)
REDSearcher: A Scalable and Cost-Efficient Framework for Long-Horizon Search Agents
di: Chu, Zheng, et al.
Pubblicazione: (2026)
di: Chu, Zheng, et al.
Pubblicazione: (2026)
Beyond Reactive Safety: Risk-Aware LLM Alignment via Long-Horizon Simulation
di: Sun, Chenkai, et al.
Pubblicazione: (2025)
di: Sun, Chenkai, et al.
Pubblicazione: (2025)
Beyond Policy Optimization: A Data Curation Flywheel for Sparse-Reward Long-Horizon Planning
di: Wang, Yutong, et al.
Pubblicazione: (2025)
di: Wang, Yutong, et al.
Pubblicazione: (2025)
UltraHorizon: Benchmarking Agent Capabilities in Ultra Long-Horizon Scenarios
di: Luo, Haotian, et al.
Pubblicazione: (2025)
di: Luo, Haotian, et al.
Pubblicazione: (2025)
Can LLM Agents Be CFOs? Benchmarking Long-Horizon Resource Allocation in an Uncertain Enterprise Environment
di: Han, Yi, et al.
Pubblicazione: (2026)
di: Han, Yi, et al.
Pubblicazione: (2026)
ROMA: Recursive Open Meta-Agent Framework for Long-Horizon Multi-Agent Systems
di: Alzu'bi, Salaheddin, et al.
Pubblicazione: (2026)
di: Alzu'bi, Salaheddin, et al.
Pubblicazione: (2026)
Hera: Learning Long-Horizon Coordination for Device-Cloud Collaborative LLM Agents
di: Zhang, Yuxin, et al.
Pubblicazione: (2026)
di: Zhang, Yuxin, et al.
Pubblicazione: (2026)
HiMAC: Hierarchical Macro-Micro Learning for Long-Horizon LLM Agents
di: Jin, Hongbo, et al.
Pubblicazione: (2026)
di: Jin, Hongbo, et al.
Pubblicazione: (2026)
Refining Compositional Diffusion for Reliable Long-Horizon Planning
di: Lee, Kyowoon, et al.
Pubblicazione: (2026)
di: Lee, Kyowoon, et al.
Pubblicazione: (2026)
LongSeeker: Elastic Context Orchestration for Long-Horizon Search Agents
di: Lu, Yijun, et al.
Pubblicazione: (2026)
di: Lu, Yijun, et al.
Pubblicazione: (2026)
Blind Spots in the Guard: How Domain-Camouflaged Injection Attacks Evade Detection in Multi-Agent LLM Systems
di: Pai, Aaditya
Pubblicazione: (2026)
di: Pai, Aaditya
Pubblicazione: (2026)
CoMIC: Collaborative Memory and Insights Circulation for Long-Horizon LLM Agents in Cloud-Edge Systems
di: Wang, Yannan, et al.
Pubblicazione: (2026)
di: Wang, Yannan, et al.
Pubblicazione: (2026)
ReAcTree: Hierarchical LLM Agent Trees with Control Flow for Long-Horizon Task Planning
di: Choi, Jae-Woo, et al.
Pubblicazione: (2025)
di: Choi, Jae-Woo, et al.
Pubblicazione: (2025)
AgentFold: Long-Horizon Web Agents with Proactive Context Management
di: Ye, Rui, et al.
Pubblicazione: (2025)
di: Ye, Rui, et al.
Pubblicazione: (2025)
A Self-Healing Framework for Reliable LLM-Based Autonomous Agents
di: Jeong, Cheonsu, et al.
Pubblicazione: (2026)
di: Jeong, Cheonsu, et al.
Pubblicazione: (2026)
R&D-Agent: An LLM-Agent Framework Towards Autonomous Data Science
di: Yang, Xu, et al.
Pubblicazione: (2025)
di: Yang, Xu, et al.
Pubblicazione: (2025)
When Agents Fail to Act: A Diagnostic Framework for Tool Invocation Reliability in Multi-Agent LLM Systems
di: Huang, Donghao, et al.
Pubblicazione: (2026)
di: Huang, Donghao, et al.
Pubblicazione: (2026)
Prune-OPD: Efficient and Reliable On-Policy Distillation for Long-Horizon Reasoning
di: Yang, Zhicheng, et al.
Pubblicazione: (2026)
di: Yang, Zhicheng, et al.
Pubblicazione: (2026)
ContextBudget: Budget-Aware Context Management for Long-Horizon Search Agents
di: Wu, Yong, et al.
Pubblicazione: (2026)
di: Wu, Yong, et al.
Pubblicazione: (2026)
GTA: Generating Long-Horizon Tasks for Web Agents at Scale
di: Huang, Tenghao, et al.
Pubblicazione: (2026)
di: Huang, Tenghao, et al.
Pubblicazione: (2026)
Episodic-Semantic Memory Architecture for Long-Horizon Scientific Agents
di: Milosevic, Nikola
Pubblicazione: (2026)
di: Milosevic, Nikola
Pubblicazione: (2026)
Learning Agent-Compatible Context Management for Long-Horizon Tasks
di: Yi, Lu, et al.
Pubblicazione: (2026)
di: Yi, Lu, et al.
Pubblicazione: (2026)
SAM: State-Adaptive Memory for Long-Horizon Reasoning Agent
di: Hu, Yuyang, et al.
Pubblicazione: (2026)
di: Hu, Yuyang, et al.
Pubblicazione: (2026)
Environment Maps: Structured Environmental Representations for Long-Horizon Agents
di: Feng, Yenchia, et al.
Pubblicazione: (2026)
di: Feng, Yenchia, et al.
Pubblicazione: (2026)
MAP: A Map-then-Act Paradigm for Long-Horizon Interactive Agent Reasoning
di: Liu, Yuxin, et al.
Pubblicazione: (2026)
di: Liu, Yuxin, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Severe Domain Shift in Skeleton-Based Action Recognition:A Study of Uncertainty Failure in Real-World Gym Environments
di: Khanal, Aaditya, et al.
Pubblicazione: (2026) -
A Subgoal-driven Framework for Improving Long-Horizon LLM Agents
di: Wang, Taiyi, et al.
Pubblicazione: (2026) -
AgentLAB: Benchmarking LLM Agents against Long-Horizon Attacks
di: Jiang, Tanqiu, et al.
Pubblicazione: (2026) -
Aligning Progress and Feasibility: A Neuro-Symbolic Dual Memory Framework for Long-Horizon LLM Agents
di: Wen, Bin, et al.
Pubblicazione: (2026) -
Beyond Entangled Planning: Task-Decoupled Planning for Long-Horizon Agents
di: Li, Yunfan, et al.
Pubblicazione: (2026)