PARAPHRASUS : A Comprehensive Benchmark for Evaluating Paraphrase Detection Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Michail, Andrianos, Clematide, Simon, Opitz, Juri |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Neural Machine Translation for Malayalam Paraphrase Generation
par: Varghese, Christeena, et autres
Publié: (2024)
par: Varghese, Christeena, et autres
Publié: (2024)
Accurate and Energy Efficient: Local Retrieval-Augmented Generation Models Outperform Commercial Large Language Models in Medical Tasks
par: Vrettos, Konstantinos, et autres
Publié: (2025)
par: Vrettos, Konstantinos, et autres
Publié: (2025)
Text-Based Approaches to Item Difficulty Modeling in Large-Scale Assessments: A Systematic Review
par: Peters, Sydney, et autres
Publié: (2025)
par: Peters, Sydney, et autres
Publié: (2025)
UA-Legal-Bench: A Benchmark for Evaluating Large Language Models on Ukrainian Legal Reasoning
par: Ovcharov, Volodymyr
Publié: (2026)
par: Ovcharov, Volodymyr
Publié: (2026)
FIN-bench-v2: A Unified and Robust Benchmark Suite for Evaluating Finnish Large Language Models
par: Kytöniemi, Joona, et autres
Publié: (2025)
par: Kytöniemi, Joona, et autres
Publié: (2025)
PrivacyBench: A Conversational Benchmark for Evaluating Privacy in Personalized AI
par: Mukhopadhyay, Srija, et autres
Publié: (2025)
par: Mukhopadhyay, Srija, et autres
Publié: (2025)
Evaluating the Efficacy of Hybrid Deep Learning Models in Distinguishing AI-Generated Text
par: Oketunji, Abiodun Finbarrs
Publié: (2023)
par: Oketunji, Abiodun Finbarrs
Publié: (2023)
Beyond the Mean: Within-Model Reliable Change Detection for LLM Evaluation
par: Cacioli, Jon-Paul
Publié: (2026)
par: Cacioli, Jon-Paul
Publié: (2026)
PSST: A Benchmark for Evaluation-driven Text Public-Speaking Style Transfer
par: Sun, Huashan, et autres
Publié: (2023)
par: Sun, Huashan, et autres
Publié: (2023)
LeCoDe: A Benchmark Dataset for Interactive Legal Consultation Dialogue Evaluation
par: Yuan, Weikang, et autres
Publié: (2025)
par: Yuan, Weikang, et autres
Publié: (2025)
RomanLens: The Role Of Latent Romanization In Multilinguality In LLMs
par: Saji, Alan, et autres
Publié: (2025)
par: Saji, Alan, et autres
Publié: (2025)
EduAdapt: A Question Answer Benchmark Dataset for Evaluating Grade-Level Adaptability in LLMs
par: Naeem, Numaan, et autres
Publié: (2025)
par: Naeem, Numaan, et autres
Publié: (2025)
Cetvel: A Unified Benchmark for Evaluating Language Understanding, Generation and Cultural Capacity of LLMs for Turkish
par: Er, Yakup Abrek, et autres
Publié: (2025)
par: Er, Yakup Abrek, et autres
Publié: (2025)
Separating Constraint Compliance from Semantic Accuracy: A Novel Benchmark for Evaluating Instruction-Following Under Compression
par: Baxi, Rahul
Publié: (2025)
par: Baxi, Rahul
Publié: (2025)
Spotlights and Blindspots: Evaluating Machine-Generated Text Detection
par: Stowe, Kevin, et autres
Publié: (2026)
par: Stowe, Kevin, et autres
Publié: (2026)
MedHal: An Evaluation Dataset for Medical Hallucination Detection
par: Mehenni, Gaya, et autres
Publié: (2025)
par: Mehenni, Gaya, et autres
Publié: (2025)
EQ-Bench: An Emotional Intelligence Benchmark for Large Language Models
par: Paech, Samuel J.
Publié: (2023)
par: Paech, Samuel J.
Publié: (2023)
Neural Multimodal Topic Modeling: A Comprehensive Evaluation
par: González-Pizarro, Felipe, et autres
Publié: (2024)
par: González-Pizarro, Felipe, et autres
Publié: (2024)
Automated MCQA Benchmarking at Scale: Evaluating Reasoning Traces as Retrieval Sources for Domain Adaptation of Small Language Models
par: Gokdemir, Ozan, et autres
Publié: (2025)
par: Gokdemir, Ozan, et autres
Publié: (2025)
IntentGrasp: A Comprehensive Benchmark for Intent Understanding
par: Yin, Yuwei, et autres
Publié: (2026)
par: Yin, Yuwei, et autres
Publié: (2026)
UNO-Bench: A Unified Benchmark for Exploring the Compositional Law Between Uni-modal and Omni-modal in Omni Models
par: Chen, Chen, et autres
Publié: (2025)
par: Chen, Chen, et autres
Publié: (2025)
From Benchmarking to Reasoning: A Dual-Aspect, Large-Scale Evaluation of LLMs on Vietnamese Legal Text
par: Le, Van-Truong
Publié: (2026)
par: Le, Van-Truong
Publié: (2026)
TALE: A Tool-Augmented Framework for Reference-Free Evaluation of Large Language Models
par: Badshah, Sher, et autres
Publié: (2025)
par: Badshah, Sher, et autres
Publié: (2025)
Enigme: Generative Text Puzzles for Evaluating Reasoning in Language Models
par: Hawkins, John
Publié: (2025)
par: Hawkins, John
Publié: (2025)
Information Representation Fairness in Long-Document Embeddings: The Peculiar Interaction of Positional and Language Bias
par: Schuhmacher, Elias, et autres
Publié: (2026)
par: Schuhmacher, Elias, et autres
Publié: (2026)
University of Indonesia at SemEval-2025 Task 11: Evaluating State-of-the-Art Encoders for Multi-Label Emotion Detection
par: Hanif, Ikhlasul Akmal, et autres
Publié: (2025)
par: Hanif, Ikhlasul Akmal, et autres
Publié: (2025)
Bielik 7B v0.1: A Polish Language Model -- Development, Insights, and Evaluation
par: Ociepa, Krzysztof, et autres
Publié: (2024)
par: Ociepa, Krzysztof, et autres
Publié: (2024)
RMGAP: Benchmarking the Generalization of Reward Models across Diverse Preferences
par: Zhou, Yangyang, et autres
Publié: (2026)
par: Zhou, Yangyang, et autres
Publié: (2026)
Hierarchical Prompting Taxonomy: A Universal Evaluation Framework for Large Language Models Aligned with Human Cognitive Principles
par: Budagam, Devichand, et autres
Publié: (2024)
par: Budagam, Devichand, et autres
Publié: (2024)
Benchmarking Cognitive Biases in Large Language Models as Evaluators
par: Koo, Ryan, et autres
Publié: (2023)
par: Koo, Ryan, et autres
Publié: (2023)
Is this Idea Novel? An Automated Benchmark for Judgment of Research Ideas
par: Schopf, Tim, et autres
Publié: (2026)
par: Schopf, Tim, et autres
Publié: (2026)
Cultural Benchmarking of LLMs in Standard and Dialectal Arabic Dialogues
par: Kautsar, Muhammad Dehan Al, et autres
Publié: (2026)
par: Kautsar, Muhammad Dehan Al, et autres
Publié: (2026)
Enhancing Hate Speech Detection on Social Media: A Comparative Analysis of Machine Learning Models and Text Transformation Approaches
par: Mishra, Saurabh, et autres
Publié: (2026)
par: Mishra, Saurabh, et autres
Publié: (2026)
DeEscalWild: A Real-World Benchmark for Automated De-Escalation Training with SLMs
par: Hasan, Md Hasebul, et autres
Publié: (2026)
par: Hasan, Md Hasebul, et autres
Publié: (2026)
Detecting Subtle Differences between Human and Model Languages Using Spectrum of Relative Likelihood
par: Xu, Yang, et autres
Publié: (2024)
par: Xu, Yang, et autres
Publié: (2024)
Evaluating the efficacy of LLM Safety Solutions : The Palit Benchmark Dataset
par: Palit, Sayon, et autres
Publié: (2025)
par: Palit, Sayon, et autres
Publié: (2025)
CausalGym: Benchmarking causal interpretability methods on linguistic tasks
par: Arora, Aryaman, et autres
Publié: (2024)
par: Arora, Aryaman, et autres
Publié: (2024)
Knockout LLM Assessment: Using Large Language Models for Evaluations through Iterative Pairwise Comparisons
par: Sandan, Isik Baran, et autres
Publié: (2025)
par: Sandan, Isik Baran, et autres
Publié: (2025)
Machine Translation Hallucination Detection for Low and High Resource Languages using Large Language Models
par: Benkirane, Kenza, et autres
Publié: (2024)
par: Benkirane, Kenza, et autres
Publié: (2024)
Benchmarking the Performance of Pre-trained LLMs across Urdu NLP Tasks
par: Tahir, Munief Hassan, et autres
Publié: (2024)
par: Tahir, Munief Hassan, et autres
Publié: (2024)
Documents similaires
-
Neural Machine Translation for Malayalam Paraphrase Generation
par: Varghese, Christeena, et autres
Publié: (2024) -
Accurate and Energy Efficient: Local Retrieval-Augmented Generation Models Outperform Commercial Large Language Models in Medical Tasks
par: Vrettos, Konstantinos, et autres
Publié: (2025) -
Text-Based Approaches to Item Difficulty Modeling in Large-Scale Assessments: A Systematic Review
par: Peters, Sydney, et autres
Publié: (2025) -
UA-Legal-Bench: A Benchmark for Evaluating Large Language Models on Ukrainian Legal Reasoning
par: Ovcharov, Volodymyr
Publié: (2026) -
FIN-bench-v2: A Unified and Robust Benchmark Suite for Evaluating Finnish Large Language Models
par: Kytöniemi, Joona, et autres
Publié: (2025)