Enregistré dans:
| Auteurs principaux: | Wang, Weixuan, Han, Dongge, Diaz, Daniel Madrigal, Xu, Jin, Rühle, Victor, Rajmohan, Saravan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2508.09124 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LEGOMem: Modular Procedural Memory for Multi-agent LLM Systems for Workflow Automation
par: Han, Dongge, et autres
Publié: (2025)
par: Han, Dongge, et autres
Publié: (2025)
Cost-Aware Retrieval-Augmentation Reasoning Models with Adaptive Retrieval Depth
par: Hashemi, Helia, et autres
Publié: (2025)
par: Hashemi, Helia, et autres
Publié: (2025)
Towards Active Synthetic Data Generation for Finetuning Language Models
par: Kessler, Samuel, et autres
Publié: (2025)
par: Kessler, Samuel, et autres
Publié: (2025)
ACON: Optimizing Context Compression for Long-horizon LLM Agents
par: Kang, Minki, et autres
Publié: (2025)
par: Kang, Minki, et autres
Publié: (2025)
Semantic Caching of Contextual Summaries for Efficient Question-Answering with Language Models
par: Couturier, Camille, et autres
Publié: (2025)
par: Couturier, Camille, et autres
Publié: (2025)
Hybrid-RACA: Hybrid Retrieval-Augmented Composition Assistance for Real-time Text Prediction
par: Xia, Menglin, et autres
Publié: (2023)
par: Xia, Menglin, et autres
Publié: (2023)
Enhancing Reasoning Capabilities of Small Language Models with Blueprints and Prompt Template Search
par: Han, Dongge, et autres
Publié: (2025)
par: Han, Dongge, et autres
Publié: (2025)
Odysseys: Benchmarking Web Agents on Realistic Long Horizon Tasks
par: Jang, Lawrence Keunho, et autres
Publié: (2026)
par: Jang, Lawrence Keunho, et autres
Publié: (2026)
Revisiting Transformer Layer Parameterization Through Causal Energy Minimization
par: Xu, Jin, et autres
Publié: (2026)
par: Xu, Jin, et autres
Publié: (2026)
Budget-Aware Agentic Routing via Boundary-Guided Training
par: Zhang, Caiqi, et autres
Publié: (2026)
par: Zhang, Caiqi, et autres
Publié: (2026)
Minerva: A Programmable Memory Test Benchmark for Language Models
par: Xia, Menglin, et autres
Publié: (2025)
par: Xia, Menglin, et autres
Publié: (2025)
Exploring How LLMs Capture and Represent Domain-Specific Knowledge
par: Garcia, Mirian Hipolito, et autres
Publié: (2025)
par: Garcia, Mirian Hipolito, et autres
Publié: (2025)
A Tale of Two Graphs: Separating Knowledge Exploration from Outline Structure for Open-Ended Deep Research
par: Shi, Zhuofan, et autres
Publié: (2026)
par: Shi, Zhuofan, et autres
Publié: (2026)
Lean Attention: Hardware-Aware Scalable Attention Mechanism for the Decode-Phase of Transformers
par: Sanovar, Rya, et autres
Publié: (2024)
par: Sanovar, Rya, et autres
Publié: (2024)
OfficeBench: Benchmarking Language Agents across Multiple Applications for Office Automation
par: Wang, Zilong, et autres
Publié: (2024)
par: Wang, Zilong, et autres
Publié: (2024)
Exploring LLM-based Agents for Root Cause Analysis
par: Roy, Devjeet, et autres
Publié: (2024)
par: Roy, Devjeet, et autres
Publié: (2024)
OdysseyArena: Benchmarking Large Language Models For Long-Horizon, Active and Inductive Interactions
par: Xu, Fangzhi, et autres
Publié: (2026)
par: Xu, Fangzhi, et autres
Publié: (2026)
CI-Work: Benchmarking Contextual Integrity in Enterprise LLM Agents
par: Fu, Wenjie, et autres
Publié: (2026)
par: Fu, Wenjie, et autres
Publié: (2026)
CHI-Bench: Can AI Agents Automate End-to-End, Long-Horizon, Policy-Rich Healthcare Workflows?
par: Chen, Haolin, et autres
Publié: (2026)
par: Chen, Haolin, et autres
Publié: (2026)
TurboAttention: Efficient Attention Approximation For High Throughputs LLMs
par: Kang, Hao, et autres
Publié: (2024)
par: Kang, Hao, et autres
Publié: (2024)
From Reasoning to Answer: Empirical, Attention-Based and Mechanistic Insights into Distilled DeepSeek R1 Models
par: Zhang, Jue, et autres
Publié: (2025)
par: Zhang, Jue, et autres
Publié: (2025)
WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation
par: Ding, Shuangrui, et autres
Publié: (2026)
par: Ding, Shuangrui, et autres
Publié: (2026)
Contrastive Attribution in the Wild: An Interpretability Analysis of LLM Failures on Realistic Benchmarks
par: Tan, Rongyuan, et autres
Publié: (2026)
par: Tan, Rongyuan, et autres
Publié: (2026)
ColorBench: Benchmarking Mobile Agents with Graph-Structured Framework for Complex Long-Horizon Tasks
par: Song, Yuanyi, et autres
Publié: (2025)
par: Song, Yuanyi, et autres
Publié: (2025)
LLM Reasoning as Trajectories: Step-Specific Representation Geometry and Correctness Signals
par: Sun, Lihao, et autres
Publié: (2026)
par: Sun, Lihao, et autres
Publié: (2026)
NL2Repo-Bench: Towards Long-Horizon Repository Generation Evaluation of Coding Agents
par: Ding, Jingzhe, et autres
Publié: (2025)
par: Ding, Jingzhe, et autres
Publié: (2025)
TriBench-Ko: Evaluating LLM Risks in Judicial Workflows
par: Lee, Haesung, et autres
Publié: (2026)
par: Lee, Haesung, et autres
Publié: (2026)
DecisionBench: A Benchmark for Emergent Delegation in Long-Horizon Agentic Workflows
par: Gao, Yuxuan, et autres
Publié: (2026)
par: Gao, Yuxuan, et autres
Publié: (2026)
AgentGen: Enhancing Planning Abilities for Large Language Model based Agent via Environment and Task Generation
par: Hu, Mengkang, et autres
Publié: (2024)
par: Hu, Mengkang, et autres
Publié: (2024)
EcoAct: Economic Agent Determines When to Register What Action
par: Zhang, Shaokun, et autres
Publié: (2024)
par: Zhang, Shaokun, et autres
Publié: (2024)
HorizonBench: Long-Horizon Personalization with Evolving Preferences
par: Li, Shuyue Stella, et autres
Publié: (2026)
par: Li, Shuyue Stella, et autres
Publié: (2026)
FlowBench: Revisiting and Benchmarking Workflow-Guided Planning for LLM-based Agents
par: Xiao, Ruixuan, et autres
Publié: (2024)
par: Xiao, Ruixuan, et autres
Publié: (2024)
$π$-Bench: Evaluating Proactive Personal Assistant Agents in Long-Horizon Workflows
par: Zhang, Haoran, et autres
Publié: (2026)
par: Zhang, Haoran, et autres
Publié: (2026)
SpecBench: Measuring Reward Hacking in Long-Horizon Coding Agents
par: Zhao, Bingchen, et autres
Publié: (2026)
par: Zhao, Bingchen, et autres
Publié: (2026)
AMPO: Active Multi-Preference Optimization for Self-play Preference Selection
par: Gupta, Taneesh, et autres
Publié: (2025)
par: Gupta, Taneesh, et autres
Publié: (2025)
REFA: Reference Free Alignment for multi-preference optimization
par: Gupta, Taneesh, et autres
Publié: (2024)
par: Gupta, Taneesh, et autres
Publié: (2024)
AgentCE-Bench: Agent Configurable Evaluation with Scalable Horizons and Controllable Difficulty under Lightweight Environments
par: Yang, Wang, et autres
Publié: (2026)
par: Yang, Wang, et autres
Publié: (2026)
Agent-SafetyBench: Evaluating the Safety of LLM Agents
par: Zhang, Zhexin, et autres
Publié: (2024)
par: Zhang, Zhexin, et autres
Publié: (2024)
EpiBench: Benchmarking Multi-turn Research Workflows for Multimodal Agents
par: Dong, Xuan, et autres
Publié: (2026)
par: Dong, Xuan, et autres
Publié: (2026)
BEST-Route: Adaptive LLM Routing with Test-Time Optimal Compute
par: Ding, Dujian, et autres
Publié: (2025)
par: Ding, Dujian, et autres
Publié: (2025)
Documents similaires
-
LEGOMem: Modular Procedural Memory for Multi-agent LLM Systems for Workflow Automation
par: Han, Dongge, et autres
Publié: (2025) -
Cost-Aware Retrieval-Augmentation Reasoning Models with Adaptive Retrieval Depth
par: Hashemi, Helia, et autres
Publié: (2025) -
Towards Active Synthetic Data Generation for Finetuning Language Models
par: Kessler, Samuel, et autres
Publié: (2025) -
ACON: Optimizing Context Compression for Long-horizon LLM Agents
par: Kang, Minki, et autres
Publié: (2025) -
Semantic Caching of Contextual Summaries for Efficient Question-Answering with Language Models
par: Couturier, Camille, et autres
Publié: (2025)