Beyond the Strongest LLM: Multi-Turn Multi-Agent Orchestration vs. Single LLMs on Benchmarks
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tian, Aaron Xuxiang, Zhang, Ruofan, Tang, Jiayao, Cho, Young Min, Li, Xueqian, Yi, Qiang, Wang, Ji, Zhang, Zhunping, Qi, Danrui, Li, Zekun, Xiang, Xingyu, Guntuku, Sharath Chandra, Ungar, Lyle, Shi, Tianyu, Wang, Chi |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Herd Behavior: Investigating Peer Influence in LLM-based Multi-Agent Systems
par: Cho, Young-Min, et autres
Publié: (2025)
par: Cho, Young-Min, et autres
Publié: (2025)
A Concise Agent is Less Expert: Revealing Side Effects of Using Style Features on Conversational Agents
par: Cho, Young-Min, et autres
Publié: (2026)
par: Cho, Young-Min, et autres
Publié: (2026)
Voice-Based Chatbots for English Speaking Practice in Multilingual Low-Resource Indian Schools: A Multi-Stakeholder Study
par: Shashidhara, Sneha, et autres
Publié: (2026)
par: Shashidhara, Sneha, et autres
Publié: (2026)
Real-Time Deadlines Reveal Temporal Awareness Failures in LLM Strategic Dialogues
par: Sehgal, Neil K. R., et autres
Publié: (2026)
par: Sehgal, Neil K. R., et autres
Publié: (2026)
Optimized but Unowned: How AI-Authored Goals Undermine the Motivation They Are Meant to Drive
par: Chi, Vivienne Bihe, et autres
Publié: (2026)
par: Chi, Vivienne Bihe, et autres
Publié: (2026)
When Support Escalates Distress: Regulation and Escalation in LLM Responses to Venting and Advice-Seeking
par: Chi, Vivienne Bihe, et autres
Publié: (2026)
par: Chi, Vivienne Bihe, et autres
Publié: (2026)
Self-Reported Side Effects of Semaglutide and Tirzepatide in Online Communities
par: Sehgal, Neil K. R., et autres
Publié: (2026)
par: Sehgal, Neil K. R., et autres
Publié: (2026)
Language-based Valence and Arousal Expressions between the United States and China: a Cross-Cultural Examination
par: Cho, Young-Min, et autres
Publié: (2024)
par: Cho, Young-Min, et autres
Publié: (2024)
Building Knowledge-Guided Lexica to Model Cultural Variation
par: Havaldar, Shreya, et autres
Publié: (2024)
par: Havaldar, Shreya, et autres
Publié: (2024)
Social Norms in Cinema: A Cross-Cultural Analysis of Shame, Pride and Prejudice
par: Rai, Sunny, et autres
Publié: (2024)
par: Rai, Sunny, et autres
Publié: (2024)
Designing Mental-Health Chatbots for Indian Adolescents: Mixed-Methods Evidence, a Boundary-Object Lens, and a Design-Tensions Framework
par: Sehgal, Neil K. R., et autres
Publié: (2025)
par: Sehgal, Neil K. R., et autres
Publié: (2025)
Exploring Socio-Cultural Challenges and Opportunities in Designing Mental Health Chatbots for Adolescents in India
par: Sehgal, Neil K. R., et autres
Publié: (2025)
par: Sehgal, Neil K. R., et autres
Publié: (2025)
PAL: Designing Conversational Agents as Scalable, Cooperative Patient Simulators for Palliative-Care Training
par: Sehgal, Neil K. R., et autres
Publié: (2025)
par: Sehgal, Neil K. R., et autres
Publié: (2025)
Effect of Static vs. Conversational AI-Generated Messages on Colorectal Cancer Screening Intent: a Randomized Controlled Trial
par: Sehgal, Neil K. R., et autres
Publié: (2025)
par: Sehgal, Neil K. R., et autres
Publié: (2025)
Measuring Harmfulness of Computer-Using Agents
par: Tian, Aaron Xuxiang, et autres
Publié: (2025)
par: Tian, Aaron Xuxiang, et autres
Publié: (2025)
Conceptors for Semantic Steering
par: Triantafyllopoulos, Ilias, et autres
Publié: (2026)
par: Triantafyllopoulos, Ilias, et autres
Publié: (2026)
Cross-Cultural Differences in Mental Health Expressions on Social Media
par: Rai, Sunny, et autres
Publié: (2024)
par: Rai, Sunny, et autres
Publié: (2024)
Conversations with AI Chatbots Increase Short-Term Vaccine Intentions But Do Not Outperform Standard Public Health Messaging
par: Sehgal, Neil K. R., et autres
Publié: (2025)
par: Sehgal, Neil K. R., et autres
Publié: (2025)
Uncertainty-Aware Crime Prediction With Spatial Temporal Multivariate Graph Neural Networks
par: Wang, Zepu, et autres
Publié: (2024)
par: Wang, Zepu, et autres
Publié: (2024)
Efficient 3D Perception on Multi-Sweep Point Cloud with Gumbel Spatial Pruning
par: Sun, Tianyu, et autres
Publié: (2024)
par: Sun, Tianyu, et autres
Publié: (2024)
Observer‐Based Containment Control of a Class of Linear‐Varying Multi‐Agent Systems With Disturbances
par: Jiayao Zhang, et autres
Publié: (2026)
par: Jiayao Zhang, et autres
Publié: (2026)
OMR-Diffusion:Optimizing Multi-Round Enhanced Training in Diffusion Models for Improved Intent Understanding
par: Li, Kun, et autres
Publié: (2025)
par: Li, Kun, et autres
Publié: (2025)
IMAGAgent: Orchestrating Multi-Turn Image Editing via Constraint-Aware Planning and Reflection
par: Shen, Fei, et autres
Publié: (2026)
par: Shen, Fei, et autres
Publié: (2026)
OrchDAG: Complex Tool Orchestration in Multi-Turn Interactions with Plan DAGs
par: Lu, Yifu, et autres
Publié: (2025)
par: Lu, Yifu, et autres
Publié: (2025)
MM-Nav: Multi-View VLA Model for Robust Visual Navigation via Multi-Expert Learning
par: Xu, Tianyu, et autres
Publié: (2025)
par: Xu, Tianyu, et autres
Publié: (2025)
Developing Lightweight Silanized Cellulose Ultramaterials as the Strongest Engineered Aerogel
par: Kangkang Zhang, et autres
Publié: (2024)
par: Kangkang Zhang, et autres
Publié: (2024)
DuConTE: Dual-Granularity Text Encoder with Topology-Constrained Attention for Text-attributed Graphs
par: Liang, Lexuan, et autres
Publié: (2026)
par: Liang, Lexuan, et autres
Publié: (2026)
DeepContext: Stateful Real-Time Detection of Multi-Turn Adversarial Intent Drift in LLMs
par: Albrethsen, Justin, et autres
Publié: (2026)
par: Albrethsen, Justin, et autres
Publié: (2026)
TurnBench-MS: A Benchmark for Evaluating Multi-Turn, Multi-Step Reasoning in Large Language Models
par: Zhang, Yiran, et autres
Publié: (2025)
par: Zhang, Yiran, et autres
Publié: (2025)
Correctness-Optimized Residual Activation Lens (CORAL): Transferrable and Calibration-Aware Inference-Time Steering
par: Miao, Miranda Muqing, et autres
Publié: (2026)
par: Miao, Miranda Muqing, et autres
Publié: (2026)
MUSIC: MUlti-Step Instruction Contrast for Multi-Turn Reward Models
par: Li, Wenzhe, et autres
Publié: (2025)
par: Li, Wenzhe, et autres
Publié: (2025)
Gradientsys: A Multi-Agent LLM Scheduler with ReAct Orchestration
par: Song, Xinyuan, et autres
Publié: (2025)
par: Song, Xinyuan, et autres
Publié: (2025)
VAGEN: Reinforcing World Model Reasoning for Multi-Turn VLM Agents
par: Wang, Kangrui, et autres
Publié: (2025)
par: Wang, Kangrui, et autres
Publié: (2025)
Optimizing Multi-Round Enhanced Training in Diffusion Models for Improved Preference Understanding
par: Li, Kun, et autres
Publié: (2025)
par: Li, Kun, et autres
Publié: (2025)
Proactive Guidance of Multi-Turn Conversation in Industrial Search
par: Li, Xiaoyu, et autres
Publié: (2025)
par: Li, Xiaoyu, et autres
Publié: (2025)
Culturally-Aware Conversations: A Framework & Benchmark for LLMs
par: Havaldar, Shreya, et autres
Publié: (2025)
par: Havaldar, Shreya, et autres
Publié: (2025)
Strongest nonlocal sets with minimum cardinality in tripartite systems
par: Zhen, Xiao-Fan, et autres
Publié: (2024)
par: Zhen, Xiao-Fan, et autres
Publié: (2024)
ClinicalAgents: Multi-Agent Orchestration for Clinical Decision Making with Dual-Memory
par: Ge, Zhuohan, et autres
Publié: (2026)
par: Ge, Zhuohan, et autres
Publié: (2026)
Strongest nonlocal sets with minimum cardinality in multipartite systems
par: Li, Hong-Run, et autres
Publié: (2024)
par: Li, Hong-Run, et autres
Publié: (2024)
From Words to Worlds: Transforming One-line Prompt into Immersive Multi-modal Digital Stories with Communicative LLM Agent
par: Sohn, Samuel S., et autres
Publié: (2024)
par: Sohn, Samuel S., et autres
Publié: (2024)
Documents similaires
-
Herd Behavior: Investigating Peer Influence in LLM-based Multi-Agent Systems
par: Cho, Young-Min, et autres
Publié: (2025) -
A Concise Agent is Less Expert: Revealing Side Effects of Using Style Features on Conversational Agents
par: Cho, Young-Min, et autres
Publié: (2026) -
Voice-Based Chatbots for English Speaking Practice in Multilingual Low-Resource Indian Schools: A Multi-Stakeholder Study
par: Shashidhara, Sneha, et autres
Publié: (2026) -
Real-Time Deadlines Reveal Temporal Awareness Failures in LLM Strategic Dialogues
par: Sehgal, Neil K. R., et autres
Publié: (2026) -
Optimized but Unowned: How AI-Authored Goals Undermine the Motivation They Are Meant to Drive
par: Chi, Vivienne Bihe, et autres
Publié: (2026)