Estimating the Error of Large Language Models at Pairwise Text Comparison
Fuente:
arXiv
Saved in:
| Main Author: | Li, Tianyi |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Automated Review Generation Method Based on Large Language Models
by: Wu, Shican, et al.
Published: (2024)
by: Wu, Shican, et al.
Published: (2024)
LCES: Zero-shot Automated Essay Scoring via Pairwise Comparisons Using Large Language Models
by: Shibata, Takumi, et al.
Published: (2025)
by: Shibata, Takumi, et al.
Published: (2025)
Knockout LLM Assessment: Using Large Language Models for Evaluations through Iterative Pairwise Comparisons
by: Sandan, Isik Baran, et al.
Published: (2025)
by: Sandan, Isik Baran, et al.
Published: (2025)
Uncertainty Quantification for Transformer Models for Dark-Pattern Detection
by: Muñoz, Javier, et al.
Published: (2024)
by: Muñoz, Javier, et al.
Published: (2024)
Attention-Aligned Reasoning for Large Language Models
by: Zhang, Hongxiang, et al.
Published: (2025)
by: Zhang, Hongxiang, et al.
Published: (2025)
NAIPv2: Debiased Pairwise Learning for Efficient Paper Quality Estimation
by: Zhao, Penghai, et al.
Published: (2025)
by: Zhao, Penghai, et al.
Published: (2025)
Online Rubrics Elicitation from Pairwise Comparisons
by: Rezaei, MohammadHossein, et al.
Published: (2025)
by: Rezaei, MohammadHossein, et al.
Published: (2025)
Can LLMs Detect Their Confabulations? Estimating Reliability in Uncertainty-Aware Language Models
by: Zhou, Tianyi, et al.
Published: (2025)
by: Zhou, Tianyi, et al.
Published: (2025)
ErrorMap and ErrorAtlas: Charting the Failure Landscape of Large Language Models
by: Ashury-Tahan, Shir, et al.
Published: (2026)
by: Ashury-Tahan, Shir, et al.
Published: (2026)
Aligning with Human Judgement: The Role of Pairwise Preference in Large Language Model Evaluators
by: Liu, Yinhong, et al.
Published: (2024)
by: Liu, Yinhong, et al.
Published: (2024)
Credence Calibration Game? Calibrating Large Language Models through Structured Play
by: Fang, Ke, et al.
Published: (2025)
by: Fang, Ke, et al.
Published: (2025)
Large Language Models for Biomedical Text Simplification: Promising But Not There Yet
by: Li, Zihao, et al.
Published: (2024)
by: Li, Zihao, et al.
Published: (2024)
An Empirical Comparison of Text Summarization: A Multi-Dimensional Evaluation of Large Language Models
by: Janakiraman, Anantharaman, et al.
Published: (2025)
by: Janakiraman, Anantharaman, et al.
Published: (2025)
Generative Large Language Models Trained for Detecting Errors in Radiology Reports
by: Sun, Cong, et al.
Published: (2025)
by: Sun, Cong, et al.
Published: (2025)
Mis-prompt: Benchmarking Large Language Models for Proactive Error Handling
by: Zeng, Jiayi, et al.
Published: (2025)
by: Zeng, Jiayi, et al.
Published: (2025)
ERC-SVD: Error-Controlled SVD for Large Language Model Compression
by: Bai, Haolei, et al.
Published: (2025)
by: Bai, Haolei, et al.
Published: (2025)
AgentStealth: Reinforcing Large Language Model for Anonymizing User-generated Text
by: Shao, Chenyang, et al.
Published: (2025)
by: Shao, Chenyang, et al.
Published: (2025)
DSGram: Dynamic Weighting Sub-Metrics for Grammatical Error Correction in the Era of Large Language Models
by: Xie, Jinxiang, et al.
Published: (2024)
by: Xie, Jinxiang, et al.
Published: (2024)
The Impact of Negated Text on Hallucination with Large Language Models
by: Seo, Jaehyung, et al.
Published: (2025)
by: Seo, Jaehyung, et al.
Published: (2025)
Ghostbuster: Detecting Text Ghostwritten by Large Language Models
by: Verma, Vivek, et al.
Published: (2023)
by: Verma, Vivek, et al.
Published: (2023)
A Practical Examination of AI-Generated Text Detectors for Large Language Models
by: Tufts, Brian, et al.
Published: (2024)
by: Tufts, Brian, et al.
Published: (2024)
MPCI-Bench: A Benchmark for Multimodal Pairwise Contextual Integrity Evaluation of Language Model Agents
by: Wang, Shouju, et al.
Published: (2026)
by: Wang, Shouju, et al.
Published: (2026)
Correlated Errors in Large Language Models
by: Kim, Elliot, et al.
Published: (2025)
by: Kim, Elliot, et al.
Published: (2025)
Guiding Large Language Models to Post-Edit Machine Translation with Error Annotations
by: Ki, Dayeon, et al.
Published: (2024)
by: Ki, Dayeon, et al.
Published: (2024)
Direct-Scoring NLG Evaluators Can Use Pairwise Comparisons Too
by: Lawrence, Logan, et al.
Published: (2025)
by: Lawrence, Logan, et al.
Published: (2025)
SQLBench: A Comprehensive Evaluation for Text-to-SQL Capabilities of Large Language Models
by: Zhang, Bin, et al.
Published: (2024)
by: Zhang, Bin, et al.
Published: (2024)
Fairness or Fluency? An Investigation into Language Bias of Pairwise LLM-as-a-Judge
by: Zhou, Xiaolin, et al.
Published: (2026)
by: Zhou, Xiaolin, et al.
Published: (2026)
When Audio and Text Disagree: Revealing Text Bias in Large Audio-Language Models
by: Wang, Cheng, et al.
Published: (2025)
by: Wang, Cheng, et al.
Published: (2025)
Text2World: Benchmarking Large Language Models for Symbolic World Model Generation
by: Hu, Mengkang, et al.
Published: (2025)
by: Hu, Mengkang, et al.
Published: (2025)
Improving Attributed Text Generation of Large Language Models via Preference Learning
by: Li, Dongfang, et al.
Published: (2024)
by: Li, Dongfang, et al.
Published: (2024)
Investigating Large Language Models' Linguistic Abilities for Text Preprocessing
by: Braga, Marco, et al.
Published: (2025)
by: Braga, Marco, et al.
Published: (2025)
Bengali Text Classification: An Evaluation of Large Language Model Approaches
by: Hoque, Md Mahmudul, et al.
Published: (2026)
by: Hoque, Md Mahmudul, et al.
Published: (2026)
Research on Predicting Public Opinion Event Heat Levels Based on Large Language Models
by: Ren, Yi, et al.
Published: (2024)
by: Ren, Yi, et al.
Published: (2024)
When Language Overrules: Revealing Text Dominance in Multimodal Large Language Models
by: Wu, Huyu, et al.
Published: (2025)
by: Wu, Huyu, et al.
Published: (2025)
Boosting of Thoughts: Trial-and-Error Problem Solving with Large Language Models
by: Chen, Sijia, et al.
Published: (2024)
by: Chen, Sijia, et al.
Published: (2024)
FairPy: A Toolkit for Evaluation of Prediction Biases and their Mitigation in Large Language Models
by: Viswanath, Hrishikesh, et al.
Published: (2023)
by: Viswanath, Hrishikesh, et al.
Published: (2023)
Towards Visual Text Grounding of Multimodal Large Language Model
by: Li, Ming, et al.
Published: (2025)
by: Li, Ming, et al.
Published: (2025)
An In-depth Evaluation of Large Language Models in Sentence Simplification with Error-based Human Assessment
by: Wu, Xuanxin, et al.
Published: (2024)
by: Wu, Xuanxin, et al.
Published: (2024)
Data Generation Using Large Language Models for Text Classification: An Empirical Case Study
by: Li, Yinheng, et al.
Published: (2024)
by: Li, Yinheng, et al.
Published: (2024)
Large Language Models for Planning: A Comprehensive and Systematic Survey
by: Cao, Pengfei, et al.
Published: (2025)
by: Cao, Pengfei, et al.
Published: (2025)
Similar Items
-
Automated Review Generation Method Based on Large Language Models
by: Wu, Shican, et al.
Published: (2024) -
LCES: Zero-shot Automated Essay Scoring via Pairwise Comparisons Using Large Language Models
by: Shibata, Takumi, et al.
Published: (2025) -
Knockout LLM Assessment: Using Large Language Models for Evaluations through Iterative Pairwise Comparisons
by: Sandan, Isik Baran, et al.
Published: (2025) -
Uncertainty Quantification for Transformer Models for Dark-Pattern Detection
by: Muñoz, Javier, et al.
Published: (2024) -
Attention-Aligned Reasoning for Large Language Models
by: Zhang, Hongxiang, et al.
Published: (2025)