REALM-Bench: A Benchmark for Evaluating Multi-Agent Systems on Real-world, Dynamic Planning and Scheduling Tasks
Fuente:
arXiv
Salvato in:
| Autori principali: | Geng, Longling, Chang, Edward Y. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Exploring Robust Multi-Agent Workflows for Environmental Data Management
di: Guan, Boyuan, et al.
Pubblicazione: (2026)
di: Guan, Boyuan, et al.
Pubblicazione: (2026)
EmbodiedGovBench: A Benchmark for Governance, Recovery, and Upgrade Safety in Embodied Agent Systems
di: Qin, Xue, et al.
Pubblicazione: (2026)
di: Qin, Xue, et al.
Pubblicazione: (2026)
Agent Capsules: Quality-Gated Granularity Control for Multi-Agent LLM Pipelines
di: Ray, Aninda
Pubblicazione: (2026)
di: Ray, Aninda
Pubblicazione: (2026)
SoccerRef-Agents: Multi-Agent System for Automated Soccer Refereeing
di: Meng, Zi, et al.
Pubblicazione: (2026)
di: Meng, Zi, et al.
Pubblicazione: (2026)
Which LLM Multi-Agent Protocol to Choose?
di: Du, Hongyi, et al.
Pubblicazione: (2025)
di: Du, Hongyi, et al.
Pubblicazione: (2025)
PRIMA: Operational Patterns for Resilient Multi-Agent Research with Verifiable Identity and Convergent Feedback
di: Annapureddy, Sasank
Pubblicazione: (2026)
di: Annapureddy, Sasank
Pubblicazione: (2026)
ScrapMem: A Bio-inspired Framework for On-device Personalized Agent Memory via Optical Forgetting
di: Chang, Jiale, et al.
Pubblicazione: (2026)
di: Chang, Jiale, et al.
Pubblicazione: (2026)
Do We Always Need Query-Level Workflows? Rethinking Agentic Workflow Generation for Multi-Agent Systems
di: Wang, Zixu, et al.
Pubblicazione: (2026)
di: Wang, Zixu, et al.
Pubblicazione: (2026)
TML-Bench: Benchmark for Data Science Agents on Tabular ML Tasks
di: Pinchuk, Mykola
Pubblicazione: (2026)
di: Pinchuk, Mykola
Pubblicazione: (2026)
TraderBench: How Robust Are AI Agents in Adversarial Capital Markets?
di: Yuan, Xiaochuang, et al.
Pubblicazione: (2026)
di: Yuan, Xiaochuang, et al.
Pubblicazione: (2026)
ChromaFlow: A Negative Ablation Study of Orchestration Overhead in Tool-Augmented Agent Evaluation
di: Mittal, Tarun
Pubblicazione: (2026)
di: Mittal, Tarun
Pubblicazione: (2026)
Robust and Diverse Multi-Agent Learning via Rational Policy Gradient
di: Lauffer, Niklas, et al.
Pubblicazione: (2025)
di: Lauffer, Niklas, et al.
Pubblicazione: (2025)
PillagerBench: Benchmarking LLM-Based Agents in Competitive Minecraft Team Environments
di: Schipper, Olivier, et al.
Pubblicazione: (2025)
di: Schipper, Olivier, et al.
Pubblicazione: (2025)
PilotBench: A Benchmark for General Aviation Agents with Safety Constraints
di: Wu, Yalun, et al.
Pubblicazione: (2026)
di: Wu, Yalun, et al.
Pubblicazione: (2026)
Requirements for Aligned, Dynamic Resolution of Conflicts in Operational Constraints
di: Jones, Steven J., et al.
Pubblicazione: (2025)
di: Jones, Steven J., et al.
Pubblicazione: (2025)
Ontology-Constrained Neural Reasoning in Enterprise Agentic Systems: A Neurosymbolic Architecture for Domain-Grounded AI Agents
di: Tuan, Thanh Luong, et al.
Pubblicazione: (2026)
di: Tuan, Thanh Luong, et al.
Pubblicazione: (2026)
Accelerating Earth Science Discovery via Multi-Agent LLM Systems
di: Pantiukhin, Dmitrii, et al.
Pubblicazione: (2025)
di: Pantiukhin, Dmitrii, et al.
Pubblicazione: (2025)
XGrammar-2: Efficient Dynamic Structured Generation Engine for Agentic LLMs
di: Li, Linzhang, et al.
Pubblicazione: (2026)
di: Li, Linzhang, et al.
Pubblicazione: (2026)
Federated Single-Agent Robotics: Multi-Robot Coordination Without Intra-Robot Multi-Agent Fragmentation
di: Qin, Xue, et al.
Pubblicazione: (2026)
di: Qin, Xue, et al.
Pubblicazione: (2026)
Toward Constraint Compliant Goal Formulation and Planning
di: Jones, Steven J., et al.
Pubblicazione: (2024)
di: Jones, Steven J., et al.
Pubblicazione: (2024)
Multi-Paradigm Agent Interaction in Practice:A Systematic Analysis of Generator-Evaluator, ReAct Loop,and Adversarial Evaluation in the buddyMe Framework
di: Wang, Xiaohua, et al.
Pubblicazione: (2026)
di: Wang, Xiaohua, et al.
Pubblicazione: (2026)
Emergent Coordination in Multi-Agent Language Models
di: Riedl, Christoph
Pubblicazione: (2025)
di: Riedl, Christoph
Pubblicazione: (2025)
Optimal Task Assignment and Path Planning using Conflict-Based Search with Precedence and Temporal Constraints
di: Chong, Yu Quan, et al.
Pubblicazione: (2024)
di: Chong, Yu Quan, et al.
Pubblicazione: (2024)
Applying Cognitive Design Patterns to General LLM Agents
di: Wray, Robert E., et al.
Pubblicazione: (2025)
di: Wray, Robert E., et al.
Pubblicazione: (2025)
How much can change in a year? Revisiting Evaluation in Multi-Agent Reinforcement Learning
di: Singh, Siddarth, et al.
Pubblicazione: (2023)
di: Singh, Siddarth, et al.
Pubblicazione: (2023)
Multi-Agent Empowerment and Emergence of Complex Behavior in Groups
di: Shah, Tristan, et al.
Pubblicazione: (2026)
di: Shah, Tristan, et al.
Pubblicazione: (2026)
MEMTIER: Tiered Memory Architecture and Retrieval Bottleneck Analysis for Long-Running Autonomous AI Agents
di: Sidik, Bronislav, et al.
Pubblicazione: (2026)
di: Sidik, Bronislav, et al.
Pubblicazione: (2026)
AgentLeak: A Full-Stack Benchmark for Privacy Leakage in Multi-Agent LLM Systems
di: Yagoubi, Faouzi El, et al.
Pubblicazione: (2026)
di: Yagoubi, Faouzi El, et al.
Pubblicazione: (2026)
SPECTra: Scalable Multi-Agent Reinforcement Learning with Permutation-Free Networks
di: Park, Hyunwoo, et al.
Pubblicazione: (2025)
di: Park, Hyunwoo, et al.
Pubblicazione: (2025)
Right-to-Act: A Pre-Execution Non-Compensatory Decision Protocol for AI Systems
di: Lavi, Gadi
Pubblicazione: (2026)
di: Lavi, Gadi
Pubblicazione: (2026)
When Agents Disagree: The Selection Bottleneck in Multi-Agent LLM Pipelines
di: Maryanskyy, Artem
Pubblicazione: (2026)
di: Maryanskyy, Artem
Pubblicazione: (2026)
Extending NGU to Multi-Agent RL: A Preliminary Study
di: Hernandez, Juan, et al.
Pubblicazione: (2025)
di: Hernandez, Juan, et al.
Pubblicazione: (2025)
Preserving Disagreement: Architectural Heterogeneity and Coherence Validation in Multi-Agent Policy Simulation
di: Sela, Ariel
Pubblicazione: (2026)
di: Sela, Ariel
Pubblicazione: (2026)
StatePlane: A Cognitive State Plane for Long-Horizon AI Systems Under Bounded Context
di: Annapureddy, Sasank, et al.
Pubblicazione: (2026)
di: Annapureddy, Sasank, et al.
Pubblicazione: (2026)
FSFM: A Biologically-Inspired Framework for Selective Forgetting of Agent Memory
di: Gu, Yingjie, et al.
Pubblicazione: (2026)
di: Gu, Yingjie, et al.
Pubblicazione: (2026)
MOSS: Self-Evolution through Source-Level Rewriting in Autonomous Agent Systems
di: Cai, Qianshu, et al.
Pubblicazione: (2026)
di: Cai, Qianshu, et al.
Pubblicazione: (2026)
Building a Stable Planner: An Extended Finite State Machine Based Planning Module for Mobile GUI Agent
di: Mo, Fanglin, et al.
Pubblicazione: (2025)
di: Mo, Fanglin, et al.
Pubblicazione: (2025)
AI Runtime Infrastructure
di: Cruz, Christopher
Pubblicazione: (2026)
di: Cruz, Christopher
Pubblicazione: (2026)
CodeCRDT: Observation-Driven Coordination for Multi-Agent LLM Code Generation
di: Pugachev, Sergey
Pubblicazione: (2025)
di: Pugachev, Sergey
Pubblicazione: (2025)
Dynamic UGV-UAV Cooperative Path Planning in Uncertain Environments
di: Nguyen, Ninh, et al.
Pubblicazione: (2026)
di: Nguyen, Ninh, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Exploring Robust Multi-Agent Workflows for Environmental Data Management
di: Guan, Boyuan, et al.
Pubblicazione: (2026) -
EmbodiedGovBench: A Benchmark for Governance, Recovery, and Upgrade Safety in Embodied Agent Systems
di: Qin, Xue, et al.
Pubblicazione: (2026) -
Agent Capsules: Quality-Gated Granularity Control for Multi-Agent LLM Pipelines
di: Ray, Aninda
Pubblicazione: (2026) -
SoccerRef-Agents: Multi-Agent System for Automated Soccer Refereeing
di: Meng, Zi, et al.
Pubblicazione: (2026) -
Which LLM Multi-Agent Protocol to Choose?
di: Du, Hongyi, et al.
Pubblicazione: (2025)