The Decrypto Benchmark for Multi-Agent Reasoning and Theory of Mind
Fuente:
arXiv
Salvato in:
| Autori principali: | Lupu, Andrei, Willi, Timon, Foerster, Jakob |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Ad-Hoc Human-AI Coordination Challenge
di: Dizdarević, Tin, et al.
Pubblicazione: (2025)
di: Dizdarević, Tin, et al.
Pubblicazione: (2025)
FURINA: A Fully Customizable Role-Playing Benchmark via Scalable Multi-Agent Collaboration Pipeline
di: Wu, Haotian, et al.
Pubblicazione: (2025)
di: Wu, Haotian, et al.
Pubblicazione: (2025)
Litmus (Re)Agent: A Benchmark and Agentic System for Predictive Evaluation of Multilingual Models
di: Mittal, Avni, et al.
Pubblicazione: (2026)
di: Mittal, Avni, et al.
Pubblicazione: (2026)
AutoMind: Adaptive Knowledgeable Agent for Automated Data Science
di: Ou, Yixin, et al.
Pubblicazione: (2025)
di: Ou, Yixin, et al.
Pubblicazione: (2025)
MA-SAPO: Multi-Agent Reasoning for Score-Aware Prompt Optimization
di: Seo, Wonduk, et al.
Pubblicazione: (2025)
di: Seo, Wonduk, et al.
Pubblicazione: (2025)
The Automated but Risky Game: Modeling and Benchmarking Agent-to-Agent Negotiations and Transactions in Consumer Markets
di: Zhu, Shenzhe, et al.
Pubblicazione: (2025)
di: Zhu, Shenzhe, et al.
Pubblicazione: (2025)
Mutual Theory of Mind in Human-AI Collaboration: An Empirical Study with LLM-driven AI Agents in a Real-time Shared Workspace Task
di: Zhang, Shao, et al.
Pubblicazione: (2024)
di: Zhang, Shao, et al.
Pubblicazione: (2024)
Agentic Lybic: Multi-Agent Execution System with Tiered Reasoning and Orchestration
di: Guo, Liangxuan, et al.
Pubblicazione: (2025)
di: Guo, Liangxuan, et al.
Pubblicazione: (2025)
LLMs Can Simulate Standardized Patients via Agent Coevolution
di: Du, Zhuoyun, et al.
Pubblicazione: (2024)
di: Du, Zhuoyun, et al.
Pubblicazione: (2024)
Prune4Web: DOM Tree Pruning Programming for Web Agent
di: Zhang, Jiayuan, et al.
Pubblicazione: (2025)
di: Zhang, Jiayuan, et al.
Pubblicazione: (2025)
CompeteAI: Understanding the Competition Dynamics in Large Language Model-based Agents
di: Zhao, Qinlin, et al.
Pubblicazione: (2023)
di: Zhao, Qinlin, et al.
Pubblicazione: (2023)
Logarithmic Scores, Power-Law Discoveries: Disentangling Measurement from Coverage in Agent-Based Evaluation
di: Jung, HyunJoon, et al.
Pubblicazione: (2026)
di: Jung, HyunJoon, et al.
Pubblicazione: (2026)
Toward the Autonomous AI Doctor: Quantitative Benchmarking of an Autonomous Agentic AI Versus Board-Certified Clinicians in a Real World Setting
di: Hayat, Hashim, et al.
Pubblicazione: (2025)
di: Hayat, Hashim, et al.
Pubblicazione: (2025)
MobileSteward: Integrating Multiple App-Oriented Agents with Self-Evolution to Automate Cross-App Instructions
di: Liu, Yuxuan, et al.
Pubblicazione: (2025)
di: Liu, Yuxuan, et al.
Pubblicazione: (2025)
It's a TRAP! Task-Redirecting Agent Persuasion Benchmark for Web Agents
di: Korgul, Karolina, et al.
Pubblicazione: (2025)
di: Korgul, Karolina, et al.
Pubblicazione: (2025)
Artificial Leviathan: Exploring Social Evolution of LLM Agents Through the Lens of Hobbesian Social Contract Theory
di: Dai, Gordon, et al.
Pubblicazione: (2024)
di: Dai, Gordon, et al.
Pubblicazione: (2024)
MADS: Multi-Agent Dialogue Simulation for Diverse Persuasion Data Generation
di: Li, Mingjin, et al.
Pubblicazione: (2025)
di: Li, Mingjin, et al.
Pubblicazione: (2025)
AgentDynEx: Nudging the Mechanics and Dynamics of Multi-Agent Simulations
di: Ma, Jenny, et al.
Pubblicazione: (2025)
di: Ma, Jenny, et al.
Pubblicazione: (2025)
Pragmatic Embodied Spoken Instruction Following in Human-Robot Collaboration with Theory of Mind
di: Ying, Lance, et al.
Pubblicazione: (2024)
di: Ying, Lance, et al.
Pubblicazione: (2024)
Leveraging Dual Process Theory in Language Agent Framework for Real-time Simultaneous Human-AI Collaboration
di: Zhang, Shao, et al.
Pubblicazione: (2025)
di: Zhang, Shao, et al.
Pubblicazione: (2025)
Herding CATs: ALARA for Agent Harness Engineering in Portable Composable Multi-Agent Teams
di: Agostino, Christopher J., et al.
Pubblicazione: (2026)
di: Agostino, Christopher J., et al.
Pubblicazione: (2026)
When Pigs Get Sick: Multi-Agent AI for Swine Disease Detection
di: Mairittha, Tittaya, et al.
Pubblicazione: (2025)
di: Mairittha, Tittaya, et al.
Pubblicazione: (2025)
Interactive Debugging and Steering of Multi-Agent AI Systems
di: Epperson, Will, et al.
Pubblicazione: (2025)
di: Epperson, Will, et al.
Pubblicazione: (2025)
Psychologically Enhanced AI Agents
di: Besta, Maciej, et al.
Pubblicazione: (2025)
di: Besta, Maciej, et al.
Pubblicazione: (2025)
Modeling AI-Human Collaboration as a Multi-Agent Adaptation
di: Sen, Prothit, et al.
Pubblicazione: (2025)
di: Sen, Prothit, et al.
Pubblicazione: (2025)
Establishing Shared Query Understanding in an Open Multi-Agent System
di: Kondylidis, Nikolaos, et al.
Pubblicazione: (2023)
di: Kondylidis, Nikolaos, et al.
Pubblicazione: (2023)
AIAP: A No-Code Workflow Builder for Non-Experts with Natural Language and Multi-Agent Collaboration
di: An, Hyunjn, et al.
Pubblicazione: (2025)
di: An, Hyunjn, et al.
Pubblicazione: (2025)
Question-to-Knowledge (Q2K): Multi-Agent Generation of Inspectable Facts for Product Mapping
di: Seo, Wonduk, et al.
Pubblicazione: (2025)
di: Seo, Wonduk, et al.
Pubblicazione: (2025)
Bel Esprit: Multi-Agent Framework for Building AI Model Pipelines
di: Kim, Yunsu, et al.
Pubblicazione: (2024)
di: Kim, Yunsu, et al.
Pubblicazione: (2024)
StorySage: Conversational Autobiography Writing Powered by a Multi-Agent Framework
di: Talaei, Shayan, et al.
Pubblicazione: (2025)
di: Talaei, Shayan, et al.
Pubblicazione: (2025)
DialogGuard: Multi-Agent Psychosocial Safety Evaluation of Sensitive LLM Responses
di: Luo, Han, et al.
Pubblicazione: (2025)
di: Luo, Han, et al.
Pubblicazione: (2025)
Algorithmic Prompt Generation for Diverse Human-like Teaming and Communication with Large Language Models
di: Srikanth, Siddharth, et al.
Pubblicazione: (2025)
di: Srikanth, Siddharth, et al.
Pubblicazione: (2025)
Agentic AI: The Era of Semantic Decoding
di: Peyrard, Maxime, et al.
Pubblicazione: (2024)
di: Peyrard, Maxime, et al.
Pubblicazione: (2024)
Exploring Plan Space through Conversation: An Agentic Framework for LLM-Mediated Explanations in Planning
di: Fouilhé, Guilhem, et al.
Pubblicazione: (2026)
di: Fouilhé, Guilhem, et al.
Pubblicazione: (2026)
MobA: Multifaceted Memory-Enhanced Adaptive Planning for Efficient Mobile Task Automation
di: Zhu, Zichen, et al.
Pubblicazione: (2024)
di: Zhu, Zichen, et al.
Pubblicazione: (2024)
Perfecting Human-AI Interaction at Clinical Scale. Turning Production Signals into Safer, More Human Conversations
di: Mukherjee, Subhabrata, et al.
Pubblicazione: (2026)
di: Mukherjee, Subhabrata, et al.
Pubblicazione: (2026)
Benchmarking Agentic Workflow Generation
di: Qiao, Shuofei, et al.
Pubblicazione: (2024)
di: Qiao, Shuofei, et al.
Pubblicazione: (2024)
KnowAgent: Knowledge-Augmented Planning for LLM-Based Agents
di: Zhu, Yuqi, et al.
Pubblicazione: (2024)
di: Zhu, Yuqi, et al.
Pubblicazione: (2024)
A Multi-agent Text2SQL Framework using Small Language Models and Execution Feedback
di: Hoang, Thanh Dat, et al.
Pubblicazione: (2025)
di: Hoang, Thanh Dat, et al.
Pubblicazione: (2025)
Intelligent Co-Design: An Interactive LLM Framework for Interior Spatial Design via Multi-Modal Agents
di: Lim, Ren Jian, et al.
Pubblicazione: (2026)
di: Lim, Ren Jian, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Ad-Hoc Human-AI Coordination Challenge
di: Dizdarević, Tin, et al.
Pubblicazione: (2025) -
FURINA: A Fully Customizable Role-Playing Benchmark via Scalable Multi-Agent Collaboration Pipeline
di: Wu, Haotian, et al.
Pubblicazione: (2025) -
Litmus (Re)Agent: A Benchmark and Agentic System for Predictive Evaluation of Multilingual Models
di: Mittal, Avni, et al.
Pubblicazione: (2026) -
AutoMind: Adaptive Knowledgeable Agent for Automated Data Science
di: Ou, Yixin, et al.
Pubblicazione: (2025) -
MA-SAPO: Multi-Agent Reasoning for Score-Aware Prompt Optimization
di: Seo, Wonduk, et al.
Pubblicazione: (2025)