RankArena: A Unified Platform for Evaluating Retrieval, Reranking and RAG with Human and LLM Feedback
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Abdallah, Abdelrahman, Abdalla, Mahmoud, Piryani, Bhawna, Mozafari, Jamshid, Ali, Mohammed, Jatowt, Adam |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
How Good are LLM-based Rerankers? An Empirical Analysis of State-of-the-Art Reranking Models
par: Abdallah, Abdelrahman, et autres
Publié: (2025)
par: Abdallah, Abdelrahman, et autres
Publié: (2025)
DeAR: Dual-Stage Document Reranking with Reasoning Agents via LLM Distillation
par: Abdallah, Abdelrahman, et autres
Publié: (2025)
par: Abdallah, Abdelrahman, et autres
Publié: (2025)
Rankify: A Comprehensive Python Toolkit for Retrieval, Re-Ranking, and Retrieval-Augmented Generation
par: Abdallah, Abdelrahman, et autres
Publié: (2025)
par: Abdallah, Abdelrahman, et autres
Publié: (2025)
HintEval: A Comprehensive Framework for Hint Generation and Evaluation for Questions
par: Mozafari, Jamshid, et autres
Publié: (2025)
par: Mozafari, Jamshid, et autres
Publié: (2025)
Wrong Answers Can Also Be Useful: PlausibleQA -- A Large-Scale QA Dataset with Answer Plausibility Scores
par: Mozafari, Jamshid, et autres
Publié: (2025)
par: Mozafari, Jamshid, et autres
Publié: (2025)
Exploring Hint Generation Approaches in Open-Domain Question Answering
par: Mozafari, Jamshid, et autres
Publié: (2024)
par: Mozafari, Jamshid, et autres
Publié: (2024)
BracketRank: Large Language Model Document Ranking via Reasoning-based Competitive Elimination
par: Abdallah, Abdelrahman, et autres
Publié: (2026)
par: Abdallah, Abdelrahman, et autres
Publié: (2026)
It's High Time: A Survey of Temporal Question Answering
par: Piryani, Bhawna, et autres
Publié: (2025)
par: Piryani, Bhawna, et autres
Publié: (2025)
Context Convergence Improves Answering Inferential Questions
par: Mozafari, Jamshid, et autres
Publié: (2026)
par: Mozafari, Jamshid, et autres
Publié: (2026)
Question Difficulty Estimation for Large Language Models via Answer Plausibility Scoring
par: Mozafari, Jamshid, et autres
Publié: (2026)
par: Mozafari, Jamshid, et autres
Publié: (2026)
ASRank: Zero-Shot Re-Ranking with Answer Scent for Document Retrieval
par: Abdallah, Abdelrahman, et autres
Publié: (2025)
par: Abdallah, Abdelrahman, et autres
Publié: (2025)
From Retrieval to Generation: Comparing Different Approaches
par: Abdallah, Abdelrahman, et autres
Publié: (2025)
par: Abdallah, Abdelrahman, et autres
Publié: (2025)
DynRank: Improving Passage Retrieval with Dynamic Zero-Shot Prompting Based on Question Classification
par: Abdallah, Abdelrahman, et autres
Publié: (2024)
par: Abdallah, Abdelrahman, et autres
Publié: (2024)
Evaluating Answer Reranking Strategies in Time-sensitive Question Answering
par: Kardan, Mehmet, et autres
Publié: (2025)
par: Kardan, Mehmet, et autres
Publié: (2025)
Detecting Temporal Ambiguity in Questions
par: Piryani, Bhawna, et autres
Publié: (2024)
par: Piryani, Bhawna, et autres
Publié: (2024)
TempRetriever: Fusion-based Temporal Dense Passage Retrieval for Time-Sensitive Questions
par: Abdallah, Abdelrahman, et autres
Publié: (2025)
par: Abdallah, Abdelrahman, et autres
Publié: (2025)
Evaluating Robustness of LLMs in Question Answering on Multilingual Noisy OCR Data
par: Piryani, Bhawna, et autres
Publié: (2025)
par: Piryani, Bhawna, et autres
Publié: (2025)
WikiHint: A Human-Annotated Dataset for Hint Ranking and Generation
par: Mozafari, Jamshid, et autres
Publié: (2024)
par: Mozafari, Jamshid, et autres
Publié: (2024)
Pretraining Exposure Explains Popularity Judgments in Large Language Models
par: Mozafari, Jamshid, et autres
Publié: (2026)
par: Mozafari, Jamshid, et autres
Publié: (2026)
ChroniclingAmericaQA: A Large-scale Question Answering Dataset based on Historical American Newspaper Pages
par: Piryani, Bhawna, et autres
Publié: (2024)
par: Piryani, Bhawna, et autres
Publié: (2024)
Are LLM-Based Retrievers Worth Their Cost? An Empirical Study of Efficiency, Robustness, and Reasoning Overhead
par: Abdallah, Abdelrahman, et autres
Publié: (2026)
par: Abdallah, Abdelrahman, et autres
Publié: (2026)
SustainableQA: A Comprehensive Question Answering Dataset for Corporate Sustainability and EU Taxonomy Reporting
par: Ali, Mohammed, et autres
Publié: (2025)
par: Ali, Mohammed, et autres
Publié: (2025)
TEMPO: A Realistic Multi-Domain Benchmark for Temporal Reasoning-Intensive Retrieval
par: Abdallah, Abdelrahman, et autres
Publié: (2026)
par: Abdallah, Abdelrahman, et autres
Publié: (2026)
Negative Sampling Techniques in Information Retrieval: A Survey
par: Wischounig, Laurin, et autres
Publié: (2026)
par: Wischounig, Laurin, et autres
Publié: (2026)
PARSE: An Open-Domain Reasoning Question Answering Benchmark for Persian
par: Mozafari, Jamshid, et autres
Publié: (2026)
par: Mozafari, Jamshid, et autres
Publié: (2026)
RECOR: Reasoning-focused Multi-turn Conversational Retrieval Benchmark
par: Ali, Mohammed, et autres
Publié: (2026)
par: Ali, Mohammed, et autres
Publié: (2026)
MM-BRIGHT: A Multi-Task Multimodal Benchmark for Reasoning-Intensive Retrieval
par: Abdallah, Abdelrahman, et autres
Publié: (2026)
par: Abdallah, Abdelrahman, et autres
Publié: (2026)
Inferential Question Answering
par: Mozafari, Jamshid, et autres
Publié: (2026)
par: Mozafari, Jamshid, et autres
Publié: (2026)
ArabicaQA: A Comprehensive Dataset for Arabic Question Answering
par: Abdallah, Abdelrahman, et autres
Publié: (2024)
par: Abdallah, Abdelrahman, et autres
Publié: (2024)
HIVE: Query, Hypothesize, Verify An LLM Framework for Multimodal Reasoning-Intensive Retrieval
par: Abdalla, Mahmoud, et autres
Publié: (2026)
par: Abdalla, Mahmoud, et autres
Publié: (2026)
A Study into Investigating Temporal Robustness of LLMs
par: Wallat, Jonas, et autres
Publié: (2025)
par: Wallat, Jonas, et autres
Publié: (2025)
Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning
par: Wu, Yuhang, et autres
Publié: (2026)
par: Wu, Yuhang, et autres
Publié: (2026)
How often do Answers Change? Estimating Recency Requirements in Question Answering
par: Piryani, Bhawna, et autres
Publié: (2026)
par: Piryani, Bhawna, et autres
Publié: (2026)
BRIDGE: Multimodal-to-Text Retrieval via Reinforcement-Learned Query Alignment
par: Mounis, Mohamed Darwish, et autres
Publié: (2026)
par: Mounis, Mohamed Darwish, et autres
Publié: (2026)
MARVEL: Multimodal Adaptive Reasoning-intensiVe Expand-rerank and retrievaL
par: Kasem, Mahmoud SalahEldin, et autres
Publié: (2026)
par: Kasem, Mahmoud SalahEldin, et autres
Publié: (2026)
Generator-Retriever-Generator Approach for Open-Domain Question Answering
par: Abdallah, Abdelrahman, et autres
Publié: (2023)
par: Abdallah, Abdelrahman, et autres
Publié: (2023)
CoRank: LLM-Based Compact Reranking with Document Features for Scientific Retrieval
par: Tian, Runchu, et autres
Publié: (2025)
par: Tian, Runchu, et autres
Publié: (2025)
RankLLM: A Python Package for Reranking with LLMs
par: Sharifymoghaddam, Sahel, et autres
Publié: (2025)
par: Sharifymoghaddam, Sahel, et autres
Publié: (2025)
REGREACT: Self-Correcting Multi-Agent Pipelines for Structured Regulatory Information Extraction
par: Ali, Mohammed, et autres
Publié: (2026)
par: Ali, Mohammed, et autres
Publié: (2026)
Enhancing Q&A Text Retrieval with Ranking Models: Benchmarking, fine-tuning and deploying Rerankers for RAG
par: Moreira, Gabriel de Souza P., et autres
Publié: (2024)
par: Moreira, Gabriel de Souza P., et autres
Publié: (2024)
Documents similaires
-
How Good are LLM-based Rerankers? An Empirical Analysis of State-of-the-Art Reranking Models
par: Abdallah, Abdelrahman, et autres
Publié: (2025) -
DeAR: Dual-Stage Document Reranking with Reasoning Agents via LLM Distillation
par: Abdallah, Abdelrahman, et autres
Publié: (2025) -
Rankify: A Comprehensive Python Toolkit for Retrieval, Re-Ranking, and Retrieval-Augmented Generation
par: Abdallah, Abdelrahman, et autres
Publié: (2025) -
HintEval: A Comprehensive Framework for Hint Generation and Evaluation for Questions
par: Mozafari, Jamshid, et autres
Publié: (2025) -
Wrong Answers Can Also Be Useful: PlausibleQA -- A Large-Scale QA Dataset with Answer Plausibility Scores
par: Mozafari, Jamshid, et autres
Publié: (2025)