Benchmarking LLM-based Relevance Judgment Methods
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Arabzadeh, Negar, Clarke, Charles L. A. |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A Human-AI Comparative Analysis of Prompt Sensitivity in LLM-Based Relevance Judgment
par: Arabzadeh, Negar, et autres
Publié: (2025)
par: Arabzadeh, Negar, et autres
Publié: (2025)
Adversarial Attacks against Neural Ranking Models via In-Context Learning
par: Bigdeli, Amin, et autres
Publié: (2025)
par: Bigdeli, Amin, et autres
Publié: (2025)
QueryGym: A Toolkit for Reproducible LLM-Based Query Reformulation
par: Bigdeli, Amin, et autres
Publié: (2025)
par: Bigdeli, Amin, et autres
Publié: (2025)
A Comparison of Methods for Evaluating Generative IR
par: Arabzadeh, Negar, et autres
Publié: (2024)
par: Arabzadeh, Negar, et autres
Publié: (2024)
ReFormeR: Learning and Applying Explicit Query Reformulation Patterns
par: Bigdeli, Amin, et autres
Publié: (2026)
par: Bigdeli, Amin, et autres
Publié: (2026)
A Reproducibility Study of LLM-Based Query Reformulation
par: Bigdeli, Amin, et autres
Publié: (2026)
par: Bigdeli, Amin, et autres
Publié: (2026)
Adapting Standard Retrieval Benchmarks to Evaluate Generated Answers
par: Arabzadeh, Negar, et autres
Publié: (2024)
par: Arabzadeh, Negar, et autres
Publié: (2024)
Query Performance Prediction using Relevance Judgments Generated by Large Language Models
par: Meng, Chuan, et autres
Publié: (2024)
par: Meng, Chuan, et autres
Publié: (2024)
Fréchet Distance for Offline Evaluation of Information Retrieval Systems with Sparse Labels
par: Arabzadeh, Negar, et autres
Publié: (2024)
par: Arabzadeh, Negar, et autres
Publié: (2024)
exHarmony: Authorship and Citations for Benchmarking the Reviewer Assignment Problem
par: Ebrahimi, Sajad, et autres
Publié: (2025)
par: Ebrahimi, Sajad, et autres
Publié: (2025)
Can QPP Choose the Right Query Variant? Evaluating Query Variant Selection for RAG Pipelines
par: Arabzadeh, Negar, et autres
Publié: (2026)
par: Arabzadeh, Negar, et autres
Publié: (2026)
Benchmarking Prompt Sensitivity in Large Language Models
par: Razavi, Amirhossein, et autres
Publié: (2025)
par: Razavi, Amirhossein, et autres
Publié: (2025)
The Effect of Document Summarization on LLM-Based Relevance Judgments
par: Mohtadi, Samaneh, et autres
Publié: (2025)
par: Mohtadi, Samaneh, et autres
Publié: (2025)
RAG over Thinking Traces Can Improve Reasoning Tasks
par: Arabzadeh, Negar, et autres
Publié: (2026)
par: Arabzadeh, Negar, et autres
Publié: (2026)
Query-driven Relevant Paragraph Extraction from Legal Judgments
par: Santosh, T. Y. S. S, et autres
Publié: (2024)
par: Santosh, T. Y. S. S, et autres
Publié: (2024)
Query-Document Dense Vectors for LLM Relevance Judgment Bias Analysis
par: Mohtadi, Samaneh, et autres
Publié: (2026)
par: Mohtadi, Samaneh, et autres
Publié: (2026)
EMPRA: Embedding Perturbation Rank Attack against Neural Ranking Models
par: Bigdeli, Amin, et autres
Publié: (2024)
par: Bigdeli, Amin, et autres
Publié: (2024)
Generative Information Retrieval Evaluation
par: Alaofi, Marwah, et autres
Publié: (2024)
par: Alaofi, Marwah, et autres
Publié: (2024)
Aligning Query Representation with Rewritten Query and Relevance Judgments in Conversational Search
par: Mo, Fengran, et autres
Publié: (2024)
par: Mo, Fengran, et autres
Publié: (2024)
Can We Use Large Language Models to Fill Relevance Judgment Holes?
par: Abbasiantaeb, Zahra, et autres
Publié: (2024)
par: Abbasiantaeb, Zahra, et autres
Publié: (2024)
Peerispect: Claim Verification in Scientific Peer Reviews
par: Ghorbanpour, Ali, et autres
Publié: (2026)
par: Ghorbanpour, Ali, et autres
Publié: (2026)
JurisTCU: A Brazilian Portuguese Information Retrieval Dataset with Query Relevance Judgments
par: Fernandes, Leandro Carísio, et autres
Publié: (2025)
par: Fernandes, Leandro Carísio, et autres
Publié: (2025)
LLMJudge: LLMs for Relevance Judgments
par: Rahmani, Hossein A., et autres
Publié: (2024)
par: Rahmani, Hossein A., et autres
Publié: (2024)
Mitigating the Threshold Priming Effect in Large Language Model-Based Relevance Judgments via Personality Infusing
par: Chen, Nuo, et autres
Publié: (2025)
par: Chen, Nuo, et autres
Publié: (2025)
Improving Topic Relevance Model by Mix-structured Summarization and LLM-based Data Augmentation
par: Liu, Yizhu, et autres
Publié: (2024)
par: Liu, Yizhu, et autres
Publié: (2024)
Evaluating the Robustness of Retrieval-Augmented Generation to Adversarial Evidence in the Health Domain
par: Amirshahi, Shakiba, et autres
Publié: (2025)
par: Amirshahi, Shakiba, et autres
Publié: (2025)
Ranked List Truncation for Large Language Model-based Re-Ranking
par: Meng, Chuan, et autres
Publié: (2024)
par: Meng, Chuan, et autres
Publié: (2024)
Offline Evaluation of Set-Based Text-to-Image Generation
par: Arabzadeh, Negar, et autres
Publié: (2024)
par: Arabzadeh, Negar, et autres
Publié: (2024)
Judging with Personality and Confidence: A Study on Personality-Conditioned LLM Relevance Assessment
par: Chen, Nuo, et autres
Publié: (2026)
par: Chen, Nuo, et autres
Publié: (2026)
An Iterative Utility Judgment Framework Inspired by Philosophical Relevance via LLMs
par: Zhang, Hengran, et autres
Publié: (2024)
par: Zhang, Hengran, et autres
Publié: (2024)
JuDGE: Benchmarking Judgment Document Generation for Chinese Legal System
par: Su, Weihang, et autres
Publié: (2025)
par: Su, Weihang, et autres
Publié: (2025)
AR-Med: Automated Relevance Enhancement in Medical Search via LLM-Driven Information Augmentation
par: Wang, Chuyue, et autres
Publié: (2025)
par: Wang, Chuyue, et autres
Publié: (2025)
LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods
par: Li, Haitao, et autres
Publié: (2024)
par: Li, Haitao, et autres
Publié: (2024)
CSRM-LLM: Embracing Multilingual LLMs for Cold-Start Relevance Matching in Emerging E-commerce Markets
par: Wang, Yujing, et autres
Publié: (2025)
par: Wang, Yujing, et autres
Publié: (2025)
Led to Mislead: Adversarial Content Injection for Attacks on Neural Ranking Models
par: Bigdeli, Amin, et autres
Publié: (2026)
par: Bigdeli, Amin, et autres
Publié: (2026)
Toward Automatic Relevance Judgment using Vision--Language Models for Image--Text Retrieval Evaluation
par: Yang, Jheng-Hong, et autres
Publié: (2024)
par: Yang, Jheng-Hong, et autres
Publié: (2024)
A Systematic Study of Pseudo-Relevance Feedback with LLMs
par: Jedidi, Nour, et autres
Publié: (2026)
par: Jedidi, Nour, et autres
Publié: (2026)
Beyond Relevance: Evaluate and Improve Retrievers on Perspective Awareness
par: Zhao, Xinran, et autres
Publié: (2024)
par: Zhao, Xinran, et autres
Publié: (2024)
PairDistill: Pairwise Relevance Distillation for Dense Retrieval
par: Huang, Chao-Wei, et autres
Publié: (2024)
par: Huang, Chao-Wei, et autres
Publié: (2024)
DIRAS: Efficient LLM Annotation of Document Relevance in Retrieval Augmented Generation
par: Ni, Jingwei, et autres
Publié: (2024)
par: Ni, Jingwei, et autres
Publié: (2024)
Documents similaires
-
A Human-AI Comparative Analysis of Prompt Sensitivity in LLM-Based Relevance Judgment
par: Arabzadeh, Negar, et autres
Publié: (2025) -
Adversarial Attacks against Neural Ranking Models via In-Context Learning
par: Bigdeli, Amin, et autres
Publié: (2025) -
QueryGym: A Toolkit for Reproducible LLM-Based Query Reformulation
par: Bigdeli, Amin, et autres
Publié: (2025) -
A Comparison of Methods for Evaluating Generative IR
par: Arabzadeh, Negar, et autres
Publié: (2024) -
ReFormeR: Learning and Applying Explicit Query Reformulation Patterns
par: Bigdeli, Amin, et autres
Publié: (2026)