MTR-Suite: A Framework for Evaluating and Synthesizing Conversational Retrieval Benchmarks
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ruan, Junhao, Abudula, Abudukeyumu, Li, Bei, Yin, Yongjing, Liu, Xinyu, Jiao, Kechen, Chen, Xin, Wang, Jingang, Cai, Xunliang, Xiao, Tong, Zhu, Jingbo |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
NDP: Next Distribution Prediction as a More Broad Target
par: Ruan, Junhao, et autres
Publié: (2024)
par: Ruan, Junhao, et autres
Publié: (2024)
Causal Autoregressive Diffusion Language Model
par: Ruan, Junhao, et autres
Publié: (2026)
par: Ruan, Junhao, et autres
Publié: (2026)
IIET: Efficient Numerical Transformer via Implicit Iterative Euler Method
par: Liu, Xinyu, et autres
Publié: (2025)
par: Liu, Xinyu, et autres
Publié: (2025)
BAPO: Boundary-Aware Policy Optimization for Reliable Agentic Search
par: Liu, Shiyu, et autres
Publié: (2026)
par: Liu, Shiyu, et autres
Publié: (2026)
Forgetting Curve: A Reliable Method for Evaluating Memorization Capability for Long-context Models
par: Liu, Xinyu, et autres
Publié: (2024)
par: Liu, Xinyu, et autres
Publié: (2024)
TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making
par: Jiao, Kechen, et autres
Publié: (2025)
par: Jiao, Kechen, et autres
Publié: (2025)
Predictor-Corrector Enhanced Transformers with Exponential Moving Average Coefficient Learning
par: Li, Bei, et autres
Publié: (2024)
par: Li, Bei, et autres
Publié: (2024)
SpanNorm: Reconciling Training Stability and Performance in Deep Transformers
par: Wang, Chao, et autres
Publié: (2026)
par: Wang, Chao, et autres
Publié: (2026)
LANG: Reinforcement Learning for Multilingual Reasoning with Language-Adaptive Hint Guidance
par: Fan, Yuchun, et autres
Publié: (2026)
par: Fan, Yuchun, et autres
Publié: (2026)
MTR-Bench: A Comprehensive Benchmark for Multi-Turn Reasoning Evaluation
par: Li, Xiaoyuan, et autres
Publié: (2025)
par: Li, Xiaoyuan, et autres
Publié: (2025)
Unlocking Implicit Experience: Synthesizing Tool-Use Trajectories from Text
par: Xu, Zhihao, et autres
Publié: (2026)
par: Xu, Zhihao, et autres
Publié: (2026)
MemoSight: Unifying Context Compression and Multi Token Prediction for Reasoning Acceleration
par: Liu, Xinyu, et autres
Publié: (2026)
par: Liu, Xinyu, et autres
Publié: (2026)
LinkQA: Synthesizing Diverse QA from Multiple Seeds Strongly Linked by Knowledge Points
par: Zhang, Xuemiao, et autres
Publié: (2025)
par: Zhang, Xuemiao, et autres
Publié: (2025)
Speculative Decoding via Early-exiting for Faster LLM Inference with Thompson Sampling Control Mechanism
par: Liu, Jiahao, et autres
Publié: (2024)
par: Liu, Jiahao, et autres
Publié: (2024)
ReMamba: Equip Mamba with Effective Long-Sequence Modeling
par: Yuan, Danlong, et autres
Publié: (2024)
par: Yuan, Danlong, et autres
Publié: (2024)
SuiteEval: Simplifying Retrieval Benchmarks
par: Parry, Andrew, et autres
Publié: (2026)
par: Parry, Andrew, et autres
Publié: (2026)
MTR-DuplexBench: Towards a Comprehensive Evaluation of Multi-Round Conversations for Full-Duplex Speech Language Models
par: Zhang, He, et autres
Publié: (2025)
par: Zhang, He, et autres
Publié: (2025)
Libra: Assessing and Improving Reward Model by Learning to Think
par: Zhou, Meng, et autres
Publié: (2025)
par: Zhou, Meng, et autres
Publié: (2025)
Earlier Tokens Contribute More: Learning Direct Preference Optimization From Temporal Decay Perspective
par: Shao, Ruichen, et autres
Publié: (2025)
par: Shao, Ruichen, et autres
Publié: (2025)
EIT: Enhanced Interactive Transformer
par: Zheng, Tong, et autres
Publié: (2022)
par: Zheng, Tong, et autres
Publié: (2022)
SLAM: Towards Efficient Multilingual Reasoning via Selective Language Alignment
par: Fan, Yuchun, et autres
Publié: (2025)
par: Fan, Yuchun, et autres
Publié: (2025)
CARE: a Benchmark Suite for the Classification and Retrieval of Enzymes
par: Yang, Jason, et autres
Publié: (2024)
par: Yang, Jason, et autres
Publié: (2024)
On the Emotion Understanding of Synthesized Speech
par: Ge, Yuan, et autres
Publié: (2026)
par: Ge, Yuan, et autres
Publié: (2026)
StyleBench: Evaluating Speech Language Models on Conversational Speaking Style Control
par: Zhao, Haishu, et autres
Publié: (2026)
par: Zhao, Haishu, et autres
Publié: (2026)
LLMsPark: A Benchmark for Evaluating Large Language Models in Strategic Gaming Contexts
par: Chen, Junhao, et autres
Publié: (2025)
par: Chen, Junhao, et autres
Publié: (2025)
AMemGym: Interactive Memory Benchmarking for Assistants in Long-Horizon Conversations
par: Jiayang, Cheng, et autres
Publié: (2026)
par: Jiayang, Cheng, et autres
Publié: (2026)
Evaluation and Benchmarking Suite for Financial Large Language Models and Agents
par: Lin, Shengyuan, et autres
Publié: (2026)
par: Lin, Shengyuan, et autres
Publié: (2026)
Dynamic Fisher-weighted Model Merging via Bayesian Optimization
par: Lee, Sanwoo, et autres
Publié: (2025)
par: Lee, Sanwoo, et autres
Publié: (2025)
What Makes Quantization for Large Language Models Hard? An Empirical Study from the Lens of Perturbation
par: Gong, Zhuocheng, et autres
Publié: (2024)
par: Gong, Zhuocheng, et autres
Publié: (2024)
Ltri-LLM: Streaming Long Context Inference for LLMs with Training-Free Dynamic Triangular Attention Pattern
par: Tang, Hongyin, et autres
Publié: (2024)
par: Tang, Hongyin, et autres
Publié: (2024)
OneCAT: Decoder-Only Auto-Regressive Model for Unified Understanding and Generation
par: Li, Han, et autres
Publié: (2025)
par: Li, Han, et autres
Publié: (2025)
TEAM-SimHRA: A Team-Based Simulation Framework for Human Reliability Analysis Using Multi-Agent Large Language Models
par: Xiao, Xingyu, et autres
Publié: (2026)
par: Xiao, Xingyu, et autres
Publié: (2026)
EfficientGraph-RAG: Structured Retrieval-State Management for Cross-Task Retrieval-Augmented Generation
par: Niu, Miaohe, et autres
Publié: (2026)
par: Niu, Miaohe, et autres
Publié: (2026)
LLMs Know What They Need: Leveraging a Missing Information Guided Framework to Empower Retrieval-Augmented Generation
par: Wang, Keheng, et autres
Publié: (2024)
par: Wang, Keheng, et autres
Publié: (2024)
SUBQRAG: Sub-Question Driven Dynamic Graph RAG
par: Li, Jiaoyang, et autres
Publié: (2025)
par: Li, Jiaoyang, et autres
Publié: (2025)
When Transformers Meet Recommenders: Integrating Self-Attentive Sequential Recommendation with Fine-Tuned LLMs
par: Liu, Kechen
Publié: (2025)
par: Liu, Kechen
Publié: (2025)
MAIR: A Massive Benchmark for Evaluating Instructed Retrieval
par: Sun, Weiwei, et autres
Publié: (2024)
par: Sun, Weiwei, et autres
Publié: (2024)
Multi-Objective and Mixed-Reward Reinforcement Learning via Reward-Decorrelated Policy Optimization
par: Bai, Yang, et autres
Publié: (2026)
par: Bai, Yang, et autres
Publié: (2026)
Foundations of Large Language Models
par: Xiao, Tong, et autres
Publié: (2025)
par: Xiao, Tong, et autres
Publié: (2025)
Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs
par: Chen, Zhengyu, et autres
Publié: (2025)
par: Chen, Zhengyu, et autres
Publié: (2025)
Documents similaires
-
NDP: Next Distribution Prediction as a More Broad Target
par: Ruan, Junhao, et autres
Publié: (2024) -
Causal Autoregressive Diffusion Language Model
par: Ruan, Junhao, et autres
Publié: (2026) -
IIET: Efficient Numerical Transformer via Implicit Iterative Euler Method
par: Liu, Xinyu, et autres
Publié: (2025) -
BAPO: Boundary-Aware Policy Optimization for Reliable Agentic Search
par: Liu, Shiyu, et autres
Publié: (2026) -
Forgetting Curve: A Reliable Method for Evaluating Memorization Capability for Long-context Models
par: Liu, Xinyu, et autres
Publié: (2024)