Multi-IF: Benchmarking LLMs on Multi-Turn and Multilingual Instructions Following
Fuente:
arXiv
Guardado en:
| Autores principales: | He, Yun, Jin, Di, Wang, Chaoqi, Bi, Chloe, Mandyam, Karishma, Zhang, Hejia, Zhu, Chen, Li, Ning, Xu, Tengyu, Lv, Hongjiang, Bhosale, Shruti, Zhu, Chenguang, Sankararaman, Karthik Abinav, Helenowski, Eryk, Kambadur, Melanie, Tayade, Aditya, Ma, Hao, Fang, Han, Wang, Sinong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Learning Auxiliary Tasks Improves Reference-Free Hallucination Detection in Open-Domain Long-Form Generation
por: Qin, Chengwei, et al.
Publicado: (2025)
por: Qin, Chengwei, et al.
Publicado: (2025)
Reinforcement Learning from User Feedback
por: Han, Eric, et al.
Publicado: (2025)
por: Han, Eric, et al.
Publicado: (2025)
Think Smarter not Harder: Adaptive Reasoning with Inference Aware Optimization
por: Yu, Zishun, et al.
Publicado: (2025)
por: Yu, Zishun, et al.
Publicado: (2025)
The Perfect Blend: Redefining RLHF with Mixture of Judges
por: Xu, Tengyu, et al.
Publicado: (2024)
por: Xu, Tengyu, et al.
Publicado: (2024)
Preference Optimization with Multi-Sample Comparisons
por: Wang, Chaoqi, et al.
Publicado: (2024)
por: Wang, Chaoqi, et al.
Publicado: (2024)
Generalized Parallel Scaling with Interdependent Generations
por: Dong, Harry, et al.
Publicado: (2025)
por: Dong, Harry, et al.
Publicado: (2025)
Bradley-Terry Policy Optimization for Generative Preference Modeling
por: Feng, Shengyu, et al.
Publicado: (2025)
por: Feng, Shengyu, et al.
Publicado: (2025)
Contextual Bandits with Packing and Covering Constraints: A Modular Lagrangian Approach via Regression
por: Slivkins, Aleksandrs, et al.
Publicado: (2022)
por: Slivkins, Aleksandrs, et al.
Publicado: (2022)
WILT: A Multi-Turn, Memorization-Robust Inductive Logic Benchmark for LLMs
por: Banatt, Eryk, et al.
Publicado: (2024)
por: Banatt, Eryk, et al.
Publicado: (2024)
LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training
por: Wu, Bo, et al.
Publicado: (2025)
por: Wu, Bo, et al.
Publicado: (2025)
Phenytoin Intoxication Masquerading as Generalized Chorea
por: Kamalesh Tayade
Publicado: (2026)
por: Kamalesh Tayade
Publicado: (2026)
Cooperative Task Execution in Multi-Agent Systems
por: Karishma, et al.
Publicado: (2024)
por: Karishma, et al.
Publicado: (2024)
TurnBench-MS: A Benchmark for Evaluating Multi-Turn, Multi-Step Reasoning in Large Language Models
por: Zhang, Yiran, et al.
Publicado: (2025)
por: Zhang, Yiran, et al.
Publicado: (2025)
Parallel-SFT: Improving Zero-Shot Cross-Programming-Language Transfer for Code RL
por: Wu, Zhaofeng, et al.
Publicado: (2026)
por: Wu, Zhaofeng, et al.
Publicado: (2026)
An Adaptive Distributed Stencil Abstraction for GPUs
por: Bhosale, Aditya, et al.
Publicado: (2025)
por: Bhosale, Aditya, et al.
Publicado: (2025)
StAyaL | Multilingual Style Transfer
por: Thakrar, Karishma, et al.
Publicado: (2025)
por: Thakrar, Karishma, et al.
Publicado: (2025)
ALIGN: Aligned Delegation with Performance Guarantees for Multi-Agent LLM Reasoning
por: Zhu, Tong, et al.
Publicado: (2026)
por: Zhu, Tong, et al.
Publicado: (2026)
CACTI: Leveraging Copy Masking and Contextual Information to Improve Tabular Data Imputation
por: Gorla, Aditya, et al.
Publicado: (2025)
por: Gorla, Aditya, et al.
Publicado: (2025)
Multi-Level Damage-Aware Graph Learning for Resilient UAV Swarm Networks
por: Lin, Huan, et al.
Publicado: (2025)
por: Lin, Huan, et al.
Publicado: (2025)
Ciprofloxacin‐Associated Posterior Reversible Encephalopathy Syndrome ( PRES )
por: Kamalesh Tayade, et al.
Publicado: (2025)
por: Kamalesh Tayade, et al.
Publicado: (2025)
On the Equivalence of Graph Convolution and Mixup
por: Han, Xiaotian, et al.
Publicado: (2023)
por: Han, Xiaotian, et al.
Publicado: (2023)
The Gossiping Insert-Eliminate Algorithm for Multi-Agent Bandits
por: Chawla, Ronshee, et al.
Publicado: (2020)
por: Chawla, Ronshee, et al.
Publicado: (2020)
Do Understanding and Generation Fight? A Diagnostic Study of DPO for Unified Multimodal Models
por: Rao, Abinav, et al.
Publicado: (2026)
por: Rao, Abinav, et al.
Publicado: (2026)
Intent Mismatch Causes LLMs to Get Lost in Multi-Turn Conversation
por: Liu, Geng, et al.
Publicado: (2026)
por: Liu, Geng, et al.
Publicado: (2026)
SweRank+: Multilingual, Multi-Turn Code Ranking for Software Issue Localization
por: Reddy, Revanth Gangi, et al.
Publicado: (2025)
por: Reddy, Revanth Gangi, et al.
Publicado: (2025)
Simulating, Visualizing and Playing with de Sitter and anti de Sitter spacetime
por: Kopczynski, Eryk
Publicado: (2023)
por: Kopczynski, Eryk
Publicado: (2023)
Evaluating LLM-based Agents for Multi-Turn Conversations: A Survey
por: Guan, Shengyue, et al.
Publicado: (2025)
por: Guan, Shengyue, et al.
Publicado: (2025)
Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment
por: Wang, Chaoqi, et al.
Publicado: (2025)
por: Wang, Chaoqi, et al.
Publicado: (2025)
LLM-Driven Multi-Turn Task-Oriented Dialogue Synthesis for Realistic Reasoning
por: Zhu, Yu, et al.
Publicado: (2026)
por: Zhu, Yu, et al.
Publicado: (2026)
Towards Principled Task Grouping for Multi-Task Learning
por: Wang, Chenguang, et al.
Publicado: (2024)
por: Wang, Chenguang, et al.
Publicado: (2024)
HGMP:Heterogeneous Graph Multi-Task Prompt Learning
por: Jiao, Pengfei, et al.
Publicado: (2025)
por: Jiao, Pengfei, et al.
Publicado: (2025)
Beyond Continuity: Challenges of Context Switching in Multi-Turn Dialogue with LLMs
por: Sinha, Aditya, et al.
Publicado: (2026)
por: Sinha, Aditya, et al.
Publicado: (2026)
Architecting Clinical Collaboration: Multi-Agent Reasoning Systems for Multimodal Medical VQA
por: Thakrar, Karishma, et al.
Publicado: (2025)
por: Thakrar, Karishma, et al.
Publicado: (2025)
MAPRO: Recasting Multi-Agent Prompt Optimization as Maximum a Posteriori Inference
por: Zhang, Zheyuan, et al.
Publicado: (2025)
por: Zhang, Zheyuan, et al.
Publicado: (2025)
Mitigating Conversational Inertia in Multi-Turn Agents
por: Wan, Yang, et al.
Publicado: (2026)
por: Wan, Yang, et al.
Publicado: (2026)
A Static and Dynamic Attention Framework for Multi Turn Dialogue Generation
por: Zhang, Wei-Nan, et al.
Publicado: (2024)
por: Zhang, Wei-Nan, et al.
Publicado: (2024)
Helpful to a Fault: Measuring Illicit Assistance in Multi-Turn, Multilingual LLM Agents
por: Talokar, Nivya, et al.
Publicado: (2026)
por: Talokar, Nivya, et al.
Publicado: (2026)
DaPT: A Dual-Path Framework for Multilingual Multi-hop Question Answering
por: Wang, Yilin, et al.
Publicado: (2026)
por: Wang, Yilin, et al.
Publicado: (2026)
Compact Multi-Service Antenna for Sensing and Communication Using Reconfigurable Complementary Spiral Resonator
por: Raza, Ali, et al.
Publicado: (2024)
por: Raza, Ali, et al.
Publicado: (2024)
Rank-Aware Quantile Activation for Motion-Robust Crop Segmentation in UAV Imagery
por: Kiran, Abinav, et al.
Publicado: (2026)
por: Kiran, Abinav, et al.
Publicado: (2026)
Ejemplares similares
-
Learning Auxiliary Tasks Improves Reference-Free Hallucination Detection in Open-Domain Long-Form Generation
por: Qin, Chengwei, et al.
Publicado: (2025) -
Reinforcement Learning from User Feedback
por: Han, Eric, et al.
Publicado: (2025) -
Think Smarter not Harder: Adaptive Reasoning with Inference Aware Optimization
por: Yu, Zishun, et al.
Publicado: (2025) -
The Perfect Blend: Redefining RLHF with Mixture of Judges
por: Xu, Tengyu, et al.
Publicado: (2024) -
Preference Optimization with Multi-Sample Comparisons
por: Wang, Chaoqi, et al.
Publicado: (2024)