On the Resilience of LLM-Based Multi-Agent Collaboration with Faulty Agents
Fuente:
arXiv
Salvato in:
| Autori principali: | Huang, Jen-tse, Zhou, Jiaxu, Jin, Tailin, Zhou, Xuhui, Chen, Zixi, Wang, Wenxuan, Yuan, Youliang, Lyu, Michael R., Sap, Maarten |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
The PIMMUR Principles: Ensuring Validity in Collective Behavior of LLM Societies
di: Zhou, Jiaxu, et al.
Pubblicazione: (2025)
di: Zhou, Jiaxu, et al.
Pubblicazione: (2025)
1-2-3 Check: Enhancing Contextual Privacy in LLM via Multi-Agent Reasoning
di: Li, Wenkai, et al.
Pubblicazione: (2025)
di: Li, Wenkai, et al.
Pubblicazione: (2025)
Learning to Ask: When LLM Agents Meet Unclear Instruction
di: Wang, Wenxuan, et al.
Pubblicazione: (2024)
di: Wang, Wenxuan, et al.
Pubblicazione: (2024)
All Languages Matter: On the Multilingual Safety of Large Language Models
di: Wang, Wenxuan, et al.
Pubblicazione: (2023)
di: Wang, Wenxuan, et al.
Pubblicazione: (2023)
How Far Are We on the Decision-Making of LLMs? Evaluating LLMs' Gaming Ability in Multi-Agent Environments
di: Huang, Jen-tse, et al.
Pubblicazione: (2024)
di: Huang, Jen-tse, et al.
Pubblicazione: (2024)
Ambig-SWE: Interactive Agents to Overcome Underspecificity in Software Engineering
di: Vijayvargiya, Sanidhya, et al.
Pubblicazione: (2025)
di: Vijayvargiya, Sanidhya, et al.
Pubblicazione: (2025)
Training Proactive and Personalized LLM Agents
di: Sun, Weiwei, et al.
Pubblicazione: (2025)
di: Sun, Weiwei, et al.
Pubblicazione: (2025)
AI-LieDar: Examine the Trade-off Between Utility and Truthfulness in LLM Agents
di: Su, Zhe, et al.
Pubblicazione: (2024)
di: Su, Zhe, et al.
Pubblicazione: (2024)
TOM-SWE: User Mental Modeling For Software Engineering Agents
di: Zhou, Xuhui, et al.
Pubblicazione: (2025)
di: Zhou, Xuhui, et al.
Pubblicazione: (2025)
SOTOPIA-TOM: Evaluating Information Management in Multi-Agent Interaction with Theory of Mind
di: YS, Yashwanth, et al.
Pubblicazione: (2026)
di: YS, Yashwanth, et al.
Pubblicazione: (2026)
VisBias: Measuring Explicit and Implicit Social Biases in Vision Language Models
di: Huang, Jen-tse, et al.
Pubblicazione: (2025)
di: Huang, Jen-tse, et al.
Pubblicazione: (2025)
LogicAsker: Evaluating and Improving the Logical Reasoning Ability of Large Language Models
di: Wan, Yuxuan, et al.
Pubblicazione: (2024)
di: Wan, Yuxuan, et al.
Pubblicazione: (2024)
New Job, New Gender? Measuring the Social Bias in Image Generation Models
di: Wang, Wenxuan, et al.
Pubblicazione: (2024)
di: Wang, Wenxuan, et al.
Pubblicazione: (2024)
SOTOPIA-S4: a user-friendly system for flexible, customizable, and large-scale social simulation
di: Zhou, Xuhui, et al.
Pubblicazione: (2025)
di: Zhou, Xuhui, et al.
Pubblicazione: (2025)
OpenAgentSafety: A Comprehensive Framework for Evaluating Real-World AI Agent Safety
di: Vijayvargiya, Sanidhya, et al.
Pubblicazione: (2025)
di: Vijayvargiya, Sanidhya, et al.
Pubblicazione: (2025)
GPT-4 Is Too Smart To Be Safe: Stealthy Chat with LLMs via Cipher
di: Yuan, Youliang, et al.
Pubblicazione: (2023)
di: Yuan, Youliang, et al.
Pubblicazione: (2023)
Insight Over Sight: Exploring the Vision-Knowledge Conflicts in Multimodal LLMs
di: Liu, Xiaoyuan, et al.
Pubblicazione: (2024)
di: Liu, Xiaoyuan, et al.
Pubblicazione: (2024)
UniDebugger: Hierarchical Multi-Agent Framework for Unified Software Debugging
di: Lee, Cheryl, et al.
Pubblicazione: (2024)
di: Lee, Cheryl, et al.
Pubblicazione: (2024)
On the Shortcut Learning in Multilingual Neural Machine Translation
di: Wang, Wenxuan, et al.
Pubblicazione: (2024)
di: Wang, Wenxuan, et al.
Pubblicazione: (2024)
SoMi-ToM: Evaluating Multi-Perspective Theory of Mind in Embodied Social Interactions
di: Fan, Xianzhe, et al.
Pubblicazione: (2025)
di: Fan, Xianzhe, et al.
Pubblicazione: (2025)
Curing Miracle Steps in LLM Mathematical Reasoning with Rubric Rewards
di: Yuan, Youliang, et al.
Pubblicazione: (2025)
di: Yuan, Youliang, et al.
Pubblicazione: (2025)
CodeCrash: Exposing LLM Fragility to Misleading Natural Language in Code Reasoning
di: Lam, Man Ho, et al.
Pubblicazione: (2025)
di: Lam, Man Ho, et al.
Pubblicazione: (2025)
BIG5-CHAT: Shaping LLM Personalities Through Training on Human-Grounded Data
di: Li, Wenkai, et al.
Pubblicazione: (2024)
di: Li, Wenkai, et al.
Pubblicazione: (2024)
Who is ChatGPT? Benchmarking LLMs' Psychological Portrayal Using PsychoBench
di: Huang, Jen-tse, et al.
Pubblicazione: (2023)
di: Huang, Jen-tse, et al.
Pubblicazione: (2023)
Multi-Agent Resilient Consensus under Intermittent Faulty and Malicious Transmissions (Extended Version)
di: Aydın, Sarper, et al.
Pubblicazione: (2024)
di: Aydın, Sarper, et al.
Pubblicazione: (2024)
Refuse Whenever You Feel Unsafe: Improving Safety in LLMs via Decoupled Refusal Training
di: Yuan, Youliang, et al.
Pubblicazione: (2024)
di: Yuan, Youliang, et al.
Pubblicazione: (2024)
Towards Evaluating Proactive Risk Awareness of Multimodal Language Models
di: Yuan, Youliang, et al.
Pubblicazione: (2025)
di: Yuan, Youliang, et al.
Pubblicazione: (2025)
Chain-of-Jailbreak Attack for Image Generation Models via Editing Step by Step
di: Wang, Wenxuan, et al.
Pubblicazione: (2024)
di: Wang, Wenxuan, et al.
Pubblicazione: (2024)
Can't See the Forest for the Trees: Benchmarking Multimodal Safety Awareness for Multimodal LLMs
di: Wang, Wenxuan, et al.
Pubblicazione: (2025)
di: Wang, Wenxuan, et al.
Pubblicazione: (2025)
BIASINSPECTOR: Detecting Bias in Structured Data through LLM Agents
di: Li, Haoxuan, et al.
Pubblicazione: (2025)
di: Li, Haoxuan, et al.
Pubblicazione: (2025)
Identifying the Achilles' Heel: An Iterative Method for Dynamically Uncovering Factual Errors in Large Language Models
di: Wang, Wenxuan, et al.
Pubblicazione: (2024)
di: Wang, Wenxuan, et al.
Pubblicazione: (2024)
Is this the real life? Is this just fantasy? The Misleading Success of Simulating Social Interactions With LLMs
di: Zhou, Xuhui, et al.
Pubblicazione: (2024)
di: Zhou, Xuhui, et al.
Pubblicazione: (2024)
Rethinking Theory of Mind Benchmarks for LLMs: Towards A User-Centered Perspective
di: Wang, Qiaosi, et al.
Pubblicazione: (2025)
di: Wang, Qiaosi, et al.
Pubblicazione: (2025)
GoodPoint: Learning Constructive Scientific Paper Feedback from Author Responses
di: Mun, Jimin, et al.
Pubblicazione: (2026)
di: Mun, Jimin, et al.
Pubblicazione: (2026)
Social World Models
di: Zhou, Xuhui, et al.
Pubblicazione: (2025)
di: Zhou, Xuhui, et al.
Pubblicazione: (2025)
LLM Collaboration With Multi-Agent Reinforcement Learning
di: Liu, Shuo, et al.
Pubblicazione: (2025)
di: Liu, Shuo, et al.
Pubblicazione: (2025)
On the Failure of Latent State Persistence in Large Language Models
di: Huang, Jen-tse, et al.
Pubblicazione: (2025)
di: Huang, Jen-tse, et al.
Pubblicazione: (2025)
AWCP: A Workspace Delegation Protocol for Deep-Engagement Collaboration across Remote Agents
di: Nie, Xiaohang, et al.
Pubblicazione: (2026)
di: Nie, Xiaohang, et al.
Pubblicazione: (2026)
Not All Countries Celebrate Thanksgiving: On the Cultural Dominance in Large Language Models
di: Wang, Wenxuan, et al.
Pubblicazione: (2023)
di: Wang, Wenxuan, et al.
Pubblicazione: (2023)
A Survey on the Safety and Security Threats of Computer-Using Agents: JARVIS or Ultron?
di: Chen, Ada, et al.
Pubblicazione: (2025)
di: Chen, Ada, et al.
Pubblicazione: (2025)
Documenti analoghi
-
The PIMMUR Principles: Ensuring Validity in Collective Behavior of LLM Societies
di: Zhou, Jiaxu, et al.
Pubblicazione: (2025) -
1-2-3 Check: Enhancing Contextual Privacy in LLM via Multi-Agent Reasoning
di: Li, Wenkai, et al.
Pubblicazione: (2025) -
Learning to Ask: When LLM Agents Meet Unclear Instruction
di: Wang, Wenxuan, et al.
Pubblicazione: (2024) -
All Languages Matter: On the Multilingual Safety of Large Language Models
di: Wang, Wenxuan, et al.
Pubblicazione: (2023) -
How Far Are We on the Decision-Making of LLMs? Evaluating LLMs' Gaming Ability in Multi-Agent Environments
di: Huang, Jen-tse, et al.
Pubblicazione: (2024)