MultiChallenge: A Realistic Multi-Turn Conversation Evaluation Benchmark Challenging to Frontier LLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Sirdeshmukh, Ved, Deshpande, Kaustubh, Mols, Johannes, Jin, Lifeng, Cardona, Ed-Yeremai, Lee, Dean, Kritz, Jeremy, Primack, Willow, Yue, Summer, Xing, Chen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Audio MultiChallenge: A Multi-Turn Evaluation of Spoken Dialogue Systems on Natural Human Interaction
di: Gosai, Advait, et al.
Pubblicazione: (2025)
di: Gosai, Advait, et al.
Pubblicazione: (2025)
FORTRESS: Frontier Risk Evaluation for National Security and Public Safety
di: Knight, Christina Q., et al.
Pubblicazione: (2025)
di: Knight, Christina Q., et al.
Pubblicazione: (2025)
Implicit Intelligence -- Evaluating Agents on What Users Don't Say
di: Sirdeshmukh, Ved, et al.
Pubblicazione: (2026)
di: Sirdeshmukh, Ved, et al.
Pubblicazione: (2026)
A Red Teaming Roadmap Towards System-Level Safety
di: Wang, Zifan, et al.
Pubblicazione: (2025)
di: Wang, Zifan, et al.
Pubblicazione: (2025)
LLM Defenses Are Not Robust to Multi-Turn Human Jailbreaks Yet
di: Li, Nathaniel, et al.
Pubblicazione: (2024)
di: Li, Nathaniel, et al.
Pubblicazione: (2024)
Jailbreaking to Jailbreak
di: Kritz, Jeremy, et al.
Pubblicazione: (2025)
di: Kritz, Jeremy, et al.
Pubblicazione: (2025)
EnigmaEval: A Benchmark of Long Multimodal Reasoning Challenges
di: Wang, Clinton J., et al.
Pubblicazione: (2025)
di: Wang, Clinton J., et al.
Pubblicazione: (2025)
Beyond Continuity: Challenges of Context Switching in Multi-Turn Dialogue with LLMs
di: Sinha, Aditya, et al.
Pubblicazione: (2026)
di: Sinha, Aditya, et al.
Pubblicazione: (2026)
MTRAG-UN: A Benchmark for Open Challenges in Multi-Turn RAG Conversations
di: Rosenthal, Sara, et al.
Pubblicazione: (2026)
di: Rosenthal, Sara, et al.
Pubblicazione: (2026)
Mobile Forensics: Challenges and Implications in the Digital Age
di: Pakhare, Ved
Pubblicazione: (2025)
di: Pakhare, Ved
Pubblicazione: (2025)
LLMs Get Lost In Multi-Turn Conversation
di: Laban, Philippe, et al.
Pubblicazione: (2025)
di: Laban, Philippe, et al.
Pubblicazione: (2025)
RSATalker: Realistic Socially-Aware Talking Head Generation for Multi-Turn Conversation
di: Chen, Peng, et al.
Pubblicazione: (2026)
di: Chen, Peng, et al.
Pubblicazione: (2026)
Electronic Frontiers: Management Challenges for the New Millennium.
di: Machovec, George S., Ed.
Pubblicazione: (1999)
di: Machovec, George S., Ed.
Pubblicazione: (1999)
MultiNRC: A Challenging and Native Multilingual Reasoning Evaluation Benchmark for LLMs
di: Fabbri, Alexander R., et al.
Pubblicazione: (2025)
di: Fabbri, Alexander R., et al.
Pubblicazione: (2025)
Found in Conversation: LLMs Teach Themselves to Close the Multi-Turn Gap
di: Chen, Tianlang, et al.
Pubblicazione: (2026)
di: Chen, Tianlang, et al.
Pubblicazione: (2026)
MT-OSC: Path for LLMs that Get Lost in Multi-Turn Conversation
di: Singh, Jyotika, et al.
Pubblicazione: (2026)
di: Singh, Jyotika, et al.
Pubblicazione: (2026)
Intent Mismatch Causes LLMs to Get Lost in Multi-Turn Conversation
di: Liu, Geng, et al.
Pubblicazione: (2026)
di: Liu, Geng, et al.
Pubblicazione: (2026)
Realistic Handwritten Multi-Digit Writer (MDW) Number Recognition Challenges
di: Wagstaff, Kiri L.
Pubblicazione: (2025)
di: Wagstaff, Kiri L.
Pubblicazione: (2025)
Posibilidades de México para mejorar su sistema político / Manfred Mols
di: Mols, Manfred
Pubblicazione: (1940)
di: Mols, Manfred
Pubblicazione: (1940)
The Asian Crisis and the Roles and Future of APEC and ASEAN as Instruments of Crisis Management
di: Manfred Mols
Pubblicazione: (2000)
di: Manfred Mols
Pubblicazione: (2000)
Análisis. ¿Del siglo norteamericano al siglo del Pacífico asiático?
di: Manfred Mols
Pubblicazione: (2010)
di: Manfred Mols
Pubblicazione: (2010)
ICPO: Illocution-Calibrated Policy Optimization for Multi-Turn Conversation
di: Wang, Zhebo, et al.
Pubblicazione: (2026)
di: Wang, Zhebo, et al.
Pubblicazione: (2026)
Aligning LLMs Toward Multi-Turn Conversational Outcomes Using Iterative PPO
di: Jiang, Daniel R., et al.
Pubblicazione: (2025)
di: Jiang, Daniel R., et al.
Pubblicazione: (2025)
Eliciting Behaviors in Multi-Turn Conversations
di: Huang, Jing, et al.
Pubblicazione: (2025)
di: Huang, Jing, et al.
Pubblicazione: (2025)
SEQUOR: A Multi-Turn Benchmark for Realistic Constraint Following
di: Canaverde, Beatriz, et al.
Pubblicazione: (2026)
di: Canaverde, Beatriz, et al.
Pubblicazione: (2026)
MMMT-IF: A Challenging Multimodal Multi-Turn Instruction Following Benchmark
di: Epstein, Elliot L., et al.
Pubblicazione: (2024)
di: Epstein, Elliot L., et al.
Pubblicazione: (2024)
Rethinking Stateful Tool Use in Multi-Turn Dialogues: Benchmarks and Challenges
di: Wang, Hongru, et al.
Pubblicazione: (2025)
di: Wang, Hongru, et al.
Pubblicazione: (2025)
Challenges Faced by Large Language Models in Solving Multi-Agent Flocking
di: Li, Peihan, et al.
Pubblicazione: (2024)
di: Li, Peihan, et al.
Pubblicazione: (2024)
Emerging Vulnerabilities in Frontier Models: Multi-Turn Jailbreak Attacks
di: Gibbs, Tom, et al.
Pubblicazione: (2024)
di: Gibbs, Tom, et al.
Pubblicazione: (2024)
Reasoning Is Not All You Need: Examining LLMs for Multi-Turn Mental Health Conversations
di: Chandra, Mohit, et al.
Pubblicazione: (2025)
di: Chandra, Mohit, et al.
Pubblicazione: (2025)
Mitigating Conversational Inertia in Multi-Turn Agents
di: Wan, Yang, et al.
Pubblicazione: (2026)
di: Wan, Yang, et al.
Pubblicazione: (2026)
Multi-Turn Multi-Modal Question Clarification for Enhanced Conversational Understanding
di: Ramezan, Kimia, et al.
Pubblicazione: (2025)
di: Ramezan, Kimia, et al.
Pubblicazione: (2025)
DIAL: Direct Iterative Adversarial Learning for Realistic Multi-Turn Dialogue Simulation
di: Zhu, Ziyi, et al.
Pubblicazione: (2025)
di: Zhu, Ziyi, et al.
Pubblicazione: (2025)
LLM-Driven Multi-Turn Task-Oriented Dialogue Synthesis for Realistic Reasoning
di: Zhu, Yu, et al.
Pubblicazione: (2026)
di: Zhu, Yu, et al.
Pubblicazione: (2026)
Multi-IF: Benchmarking LLMs on Multi-Turn and Multilingual Instructions Following
di: He, Yun, et al.
Pubblicazione: (2024)
di: He, Yun, et al.
Pubblicazione: (2024)
Visual Memory Injection Attacks for Multi-Turn Conversations
di: Schlarmann, Christian, et al.
Pubblicazione: (2026)
di: Schlarmann, Christian, et al.
Pubblicazione: (2026)
Proactive Guidance of Multi-Turn Conversation in Industrial Search
di: Li, Xiaoyu, et al.
Pubblicazione: (2025)
di: Li, Xiaoyu, et al.
Pubblicazione: (2025)
Chemical Weapons Use in the Syrian Civil War: Challenges for International Law and Peacebuilding
di: Dr. Ved Prakash Upadhyay, Pankaj Kumar Yadav
Pubblicazione: (2025)
di: Dr. Ved Prakash Upadhyay, Pankaj Kumar Yadav
Pubblicazione: (2025)
Scaling Lifelong Multi-Agent Path Finding to More Realistic Settings: Research Challenges and Opportunities
di: Jiang, He, et al.
Pubblicazione: (2024)
di: Jiang, He, et al.
Pubblicazione: (2024)
From Guessing to Asking: An Approach to Resolving the Persona Knowledge Gap in LLMs during Multi-Turn Conversations
di: Baskar, Sarvesh, et al.
Pubblicazione: (2025)
di: Baskar, Sarvesh, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Audio MultiChallenge: A Multi-Turn Evaluation of Spoken Dialogue Systems on Natural Human Interaction
di: Gosai, Advait, et al.
Pubblicazione: (2025) -
FORTRESS: Frontier Risk Evaluation for National Security and Public Safety
di: Knight, Christina Q., et al.
Pubblicazione: (2025) -
Implicit Intelligence -- Evaluating Agents on What Users Don't Say
di: Sirdeshmukh, Ved, et al.
Pubblicazione: (2026) -
A Red Teaming Roadmap Towards System-Level Safety
di: Wang, Zifan, et al.
Pubblicazione: (2025) -
LLM Defenses Are Not Robust to Multi-Turn Human Jailbreaks Yet
di: Li, Nathaniel, et al.
Pubblicazione: (2024)