Do LLMs Judge Distantly Supervised Named Entity Labels Well? Constructing the JudgeWEL Dataset
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Plum, Alistair, Bernardy, Laura, Ranasinghe, Tharindu |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Guided Distant Supervision for Multilingual Relation Extraction Data: Adapting to a New Language
par: Plum, Alistair, et autres
Publié: (2024)
par: Plum, Alistair, et autres
Publié: (2024)
Text Generation Models for Luxembourgish with Limited Data: A Balanced Multilingual Strategy
par: Plum, Alistair, et autres
Publié: (2024)
par: Plum, Alistair, et autres
Publié: (2024)
SANTA: Separate Strategies for Inaccurate and Incomplete Annotation Noise in Distantly-Supervised Named Entity Recognition
par: Si, Shuzheng, et autres
Publié: (2023)
par: Si, Shuzheng, et autres
Publié: (2023)
Judging the Judges: Evaluating Alignment and Vulnerabilities in LLMs-as-Judges
par: Thakur, Aman Singh, et autres
Publié: (2024)
par: Thakur, Aman Singh, et autres
Publié: (2024)
Can LLMs be Good Graph Judge for Knowledge Graph Construction?
par: Huang, Haoyu, et autres
Publié: (2024)
par: Huang, Haoyu, et autres
Publié: (2024)
Improving the Robustness of Distantly-Supervised Named Entity Recognition via Uncertainty-Aware Teacher Learning and Student-Student Collaborative Learning
par: Si, Shuzheng, et autres
Publié: (2023)
par: Si, Shuzheng, et autres
Publié: (2023)
SelfJudge: Faster Speculative Decoding via Self-Supervised Judge Verification
par: Yoon, Kanghoon, et autres
Publié: (2025)
par: Yoon, Kanghoon, et autres
Publié: (2025)
ALEXSIS-PT: A New Resource for Portuguese Lexical Simplification
par: North, Kai, et autres
Publié: (2022)
par: North, Kai, et autres
Publié: (2022)
Towards Simulating Social Media Users with LLMs: Evaluating the Operational Validity of Conditioned Comment Prediction
par: Schwager, Nils, et autres
Publié: (2026)
par: Schwager, Nils, et autres
Publié: (2026)
Judging the Judges: A Systematic Study of Position Bias in LLM-as-a-Judge
par: Shi, Lin, et autres
Publié: (2024)
par: Shi, Lin, et autres
Publié: (2024)
Towards Generalized Offensive Language Identification
par: Dmonte, Alphaeus, et autres
Publié: (2024)
par: Dmonte, Alphaeus, et autres
Publié: (2024)
MultiLS: A Multi-task Lexical Simplification Framework
par: North, Kai, et autres
Publié: (2024)
par: North, Kai, et autres
Publié: (2024)
JudgeLRM: Large Reasoning Models as a Judge
par: Chen, Nuo, et autres
Publié: (2025)
par: Chen, Nuo, et autres
Publié: (2025)
JudgeLM: Fine-tuned Large Language Models are Scalable Judges
par: Zhu, Lianghui, et autres
Publié: (2023)
par: Zhu, Lianghui, et autres
Publié: (2023)
TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate Them
par: Wang, Yidong, et autres
Publié: (2025)
par: Wang, Yidong, et autres
Publié: (2025)
LuxInstruct: A Cross-Lingual Instruction Tuning Dataset For Luxembourgish
par: Philippy, Fred, et autres
Publié: (2025)
par: Philippy, Fred, et autres
Publié: (2025)
Language-Independent Sentiment Labelling with Distant Supervision: A Case Study for English, Sepedi and Setswana
par: Mabokela, Koena Ronny, et autres
Publié: (2025)
par: Mabokela, Koena Ronny, et autres
Publié: (2025)
On Evaluating LLM Alignment by Evaluating LLMs as Judges
par: Liu, Yixin, et autres
Publié: (2025)
par: Liu, Yixin, et autres
Publié: (2025)
Agent-as-a-Judge
par: You, Runyang, et autres
Publié: (2026)
par: You, Runyang, et autres
Publié: (2026)
Improving Pseudo Labels with Global-Local Denoising Framework for Cross-lingual Named Entity Recognition
par: Ding, Zhuojun, et autres
Publié: (2024)
par: Ding, Zhuojun, et autres
Publié: (2024)
EasyJudge: an Easy-to-use Tool for Comprehensive Response Evaluation of LLMs
par: Li, Yijie, et autres
Publié: (2024)
par: Li, Yijie, et autres
Publié: (2024)
Named Entity Recognition in Historical Italian: The Case of Giacomo Leopardi's Zibaldone
par: Santini, Cristian, et autres
Publié: (2025)
par: Santini, Cristian, et autres
Publié: (2025)
Label Effects: Shared Heuristic Reliance in Trust Assessment by Humans and LLM-as-a-Judge
par: Sun, Xin, et autres
Publié: (2026)
par: Sun, Xin, et autres
Publié: (2026)
Exploring the Performance of Large Language Models on Subjective Span Identification Tasks
par: Dmonte, Alphaeus, et autres
Publié: (2026)
par: Dmonte, Alphaeus, et autres
Publié: (2026)
Judge's Verdict: A Comprehensive Analysis of LLM Judge Capability Through Human Agreement
par: Han, Steve, et autres
Publié: (2025)
par: Han, Steve, et autres
Publié: (2025)
ELLEN: Extremely Lightly Supervised Learning For Efficient Named Entity Recognition
par: Riaz, Haris, et autres
Publié: (2024)
par: Riaz, Haris, et autres
Publié: (2024)
Named Clinical Entity Recognition Benchmark
par: Abdul, Wadood M, et autres
Publié: (2024)
par: Abdul, Wadood M, et autres
Publié: (2024)
NSINA: A News Corpus for Sinhala
par: Hettiarachchi, Hansi, et autres
Publié: (2024)
par: Hettiarachchi, Hansi, et autres
Publié: (2024)
BadJudge: Backdoor Vulnerabilities of LLM-as-a-Judge
par: Tong, Terry, et autres
Publié: (2025)
par: Tong, Terry, et autres
Publié: (2025)
LLMs Judge Themselves: A Game-Theoretic Framework for Human-Aligned Evaluation
par: Yang, Gao, et autres
Publié: (2025)
par: Yang, Gao, et autres
Publié: (2025)
NoiseBench: Benchmarking the Impact of Real Label Noise on Named Entity Recognition
par: Merdjanovska, Elena, et autres
Publié: (2024)
par: Merdjanovska, Elena, et autres
Publié: (2024)
Named Entity Recognition in COVID-19 tweets with Entity Knowledge Augmentation
par: Zhang, Xuankang, et autres
Publié: (2025)
par: Zhang, Xuankang, et autres
Publié: (2025)
Summarization Metrics for Spanish and Basque: Do Automatic Scores and LLM-Judges Correlate with Humans?
par: Barnes, Jeremy, et autres
Publié: (2025)
par: Barnes, Jeremy, et autres
Publié: (2025)
Do Before You Judge: Self-Reference as a Pathway to Better LLM Evaluation
par: Lin, Wei-Hsiang, et autres
Publié: (2025)
par: Lin, Wei-Hsiang, et autres
Publié: (2025)
JudgeRLVR: Judge First, Generate Second for Efficient Reasoning
par: Duo, Jiangshan, et autres
Publié: (2026)
par: Duo, Jiangshan, et autres
Publié: (2026)
JudgeBench: A Benchmark for Evaluating LLM-based Judges
par: Tan, Sijun, et autres
Publié: (2024)
par: Tan, Sijun, et autres
Publié: (2024)
Generative Annotation for ASR Named Entity Correction
par: Luo, Yuanchang, et autres
Publié: (2025)
par: Luo, Yuanchang, et autres
Publié: (2025)
DynClean: Training Dynamics-based Label Cleaning for Distantly-Supervised Named Entity Recognition
par: Zhang, Qi, et autres
Publié: (2025)
par: Zhang, Qi, et autres
Publié: (2025)
BANER: Boundary-Aware LLMs for Few-Shot Named Entity Recognition
par: Guo, Quanjiang, et autres
Publié: (2024)
par: Guo, Quanjiang, et autres
Publié: (2024)
Is LLM an Overconfident Judge? Unveiling the Capabilities of LLMs in Detecting Offensive Language with Annotation Disagreement
par: Lu, Junyu, et autres
Publié: (2025)
par: Lu, Junyu, et autres
Publié: (2025)
Documents similaires
-
Guided Distant Supervision for Multilingual Relation Extraction Data: Adapting to a New Language
par: Plum, Alistair, et autres
Publié: (2024) -
Text Generation Models for Luxembourgish with Limited Data: A Balanced Multilingual Strategy
par: Plum, Alistair, et autres
Publié: (2024) -
SANTA: Separate Strategies for Inaccurate and Incomplete Annotation Noise in Distantly-Supervised Named Entity Recognition
par: Si, Shuzheng, et autres
Publié: (2023) -
Judging the Judges: Evaluating Alignment and Vulnerabilities in LLMs-as-Judges
par: Thakur, Aman Singh, et autres
Publié: (2024) -
Can LLMs be Good Graph Judge for Knowledge Graph Construction?
par: Huang, Haoyu, et autres
Publié: (2024)