Salvato in:
| Autori principali: | Eigler, Lukáš, Libovický, Jindřich, Hurych, David |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2603.09403 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
On the Credibility of Evaluating LLMs using Survey Questions
di: Libovický, Jindřich
Pubblicazione: (2026)
di: Libovický, Jindřich
Pubblicazione: (2026)
Lexically Grounded Subword Segmentation
di: Libovický, Jindřich, et al.
Pubblicazione: (2024)
di: Libovický, Jindřich, et al.
Pubblicazione: (2024)
Evaluating Morphological Plausibility of Subword Tokenization via Statistical Alignment with Morpho-Syntactic Features
di: Stephen, Abishek, et al.
Pubblicazione: (2026)
di: Stephen, Abishek, et al.
Pubblicazione: (2026)
Investigating the Effect of Parallel Data in the Cross-Lingual Transfer for Vision-Language Encoders
di: Manea, Andrei-Alexandru, et al.
Pubblicazione: (2025)
di: Manea, Andrei-Alexandru, et al.
Pubblicazione: (2025)
Crowdsourcing Piedmontese to Test LLMs on Non-Standard Orthography
di: Vico, Gianluca, et al.
Pubblicazione: (2026)
di: Vico, Gianluca, et al.
Pubblicazione: (2026)
Different Time, Different Language: Revisiting the Bias Against Non-Native Speakers in GPT Detectors
di: Ali, Adnan Al, et al.
Pubblicazione: (2026)
di: Ali, Adnan Al, et al.
Pubblicazione: (2026)
How Gender Interacts with Political Values: A Case Study on Czech BERT Models
di: Ali, Adnan Al, et al.
Pubblicazione: (2024)
di: Ali, Adnan Al, et al.
Pubblicazione: (2024)
Multilingual Vision-Language Models, A Survey
di: Manea, Andrei-Alexandru, et al.
Pubblicazione: (2025)
di: Manea, Andrei-Alexandru, et al.
Pubblicazione: (2025)
CUS-QA: Local-Knowledge-Oriented Open-Ended Question Answering Dataset
di: Libovický, Jindřich, et al.
Pubblicazione: (2025)
di: Libovický, Jindřich, et al.
Pubblicazione: (2025)
Understanding Cross-Lingual Alignment -- A Survey
di: Hämmerl, Katharina, et al.
Pubblicazione: (2024)
di: Hämmerl, Katharina, et al.
Pubblicazione: (2024)
Beyond Literal Token Overlap: Token Alignability for Multilinguality
di: Hämmerl, Katharina, et al.
Pubblicazione: (2025)
di: Hämmerl, Katharina, et al.
Pubblicazione: (2025)
Teaching LLMs at Charles University: Assignments and Activities
di: Helcl, Jindřich, et al.
Pubblicazione: (2024)
di: Helcl, Jindřich, et al.
Pubblicazione: (2024)
Enhancing Conceptual Understanding in Multimodal Contrastive Learning through Hard Negative Samples
di: Rösch, Philipp J., et al.
Pubblicazione: (2024)
di: Rösch, Philipp J., et al.
Pubblicazione: (2024)
Conditional Unigram Tokenization with Parallel Data
di: Vico, Gianluca, et al.
Pubblicazione: (2025)
di: Vico, Gianluca, et al.
Pubblicazione: (2025)
Evaluating Metrics for Safety with LLM-as-Judges
di: Clegg, Kester, et al.
Pubblicazione: (2025)
di: Clegg, Kester, et al.
Pubblicazione: (2025)
Evaluation Metrics for Text Data Augmentation in NLP
di: Amadeus, Marcellus, et al.
Pubblicazione: (2024)
di: Amadeus, Marcellus, et al.
Pubblicazione: (2024)
Charles Translator: A Machine Translation System between Ukrainian and Czech
di: Popel, Martin, et al.
Pubblicazione: (2024)
di: Popel, Martin, et al.
Pubblicazione: (2024)
Multilingual Text-to-Image Generation Magnifies Gender Stereotypes and Prompt Engineering May Not Help You
di: Friedrich, Felix, et al.
Pubblicazione: (2024)
di: Friedrich, Felix, et al.
Pubblicazione: (2024)
An LLM-as-Judge Metric for Bridging the Gap with Human Evaluation in SE Tasks
di: Zhou, Xin, et al.
Pubblicazione: (2025)
di: Zhou, Xin, et al.
Pubblicazione: (2025)
Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates
di: Wei, Hui, et al.
Pubblicazione: (2024)
di: Wei, Hui, et al.
Pubblicazione: (2024)
Agreement Metrics for LLM-as-Judge Evaluation: What to Report and Why
di: Rao, Delip, et al.
Pubblicazione: (2026)
di: Rao, Delip, et al.
Pubblicazione: (2026)
RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator
di: Tang, Zhenwei, et al.
Pubblicazione: (2026)
di: Tang, Zhenwei, et al.
Pubblicazione: (2026)
NagaNLP: Bootstrapping NLP for Low-Resource Nagamese Creole with Human-in-the-Loop Synthetic Data
di: Maiti, Agniva, et al.
Pubblicazione: (2025)
di: Maiti, Agniva, et al.
Pubblicazione: (2025)
Beyond LLM-as-a-Judge: Deterministic Metrics for Multilingual Generative Text Evaluation
di: Alam, Firoj, et al.
Pubblicazione: (2026)
di: Alam, Firoj, et al.
Pubblicazione: (2026)
HarmMetric Eval: Benchmarking Metrics and Judges for LLM Harmfulness Assessment
di: Yang, Langqi, et al.
Pubblicazione: (2025)
di: Yang, Langqi, et al.
Pubblicazione: (2025)
MM-Eval: A Multilingual Meta-Evaluation Benchmark for LLM-as-a-Judge and Reward Models
di: Son, Guijin, et al.
Pubblicazione: (2024)
di: Son, Guijin, et al.
Pubblicazione: (2024)
When Metrics Disagree: Automatic Similarity vs. LLM-as-a-Judge for Clinical Dialogue Evaluation
di: Sun, Bian, et al.
Pubblicazione: (2026)
di: Sun, Bian, et al.
Pubblicazione: (2026)
We Need to Talk About Classification Evaluation Metrics in NLP
di: Vickers, Peter, et al.
Pubblicazione: (2024)
di: Vickers, Peter, et al.
Pubblicazione: (2024)
Who Judges the Judge? Evaluating LLM-as-a-Judge for French Medical open-ended QA
di: Belmadani, Ikram, et al.
Pubblicazione: (2026)
di: Belmadani, Ikram, et al.
Pubblicazione: (2026)
Evaluating Scoring Bias in LLM-as-a-Judge
di: Li, Qingquan, et al.
Pubblicazione: (2025)
di: Li, Qingquan, et al.
Pubblicazione: (2025)
SEAL: Can Saturated Benchmarks Be Revived by LLM-as-a-Meta-Judge?
di: Chen, Jiamin, et al.
Pubblicazione: (2026)
di: Chen, Jiamin, et al.
Pubblicazione: (2026)
LLMs instead of Human Judges? A Large Scale Empirical Study across 20 NLP Evaluation Tasks
di: Bavaresco, Anna, et al.
Pubblicazione: (2024)
di: Bavaresco, Anna, et al.
Pubblicazione: (2024)
CyclicJudge: Mitigating Judge Bias Efficiently in LLM-based Evaluation
di: Zhu, Ziyi, et al.
Pubblicazione: (2026)
di: Zhu, Ziyi, et al.
Pubblicazione: (2026)
LLM-as-a-Judge for Privacy Evaluation? Exploring the Alignment of Human and LLM Perceptions of Privacy in Textual Data
di: Meisenbacher, Stephen, et al.
Pubblicazione: (2025)
di: Meisenbacher, Stephen, et al.
Pubblicazione: (2025)
Contextual Metric Meta-Evaluation by Measuring Local Metric Accuracy
di: Deviyani, Athiya, et al.
Pubblicazione: (2025)
di: Deviyani, Athiya, et al.
Pubblicazione: (2025)
Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge
di: Wu, Tianhao, et al.
Pubblicazione: (2024)
di: Wu, Tianhao, et al.
Pubblicazione: (2024)
Counting on Consensus: Selecting the Right Inter-annotator Agreement Metric for NLP Annotation and Evaluation
di: James, Joseph
Pubblicazione: (2026)
di: James, Joseph
Pubblicazione: (2026)
Evaluating Judges as Evaluators: The JETTS Benchmark of LLM-as-Judges as Test-Time Scaling Evaluators
di: Zhou, Yilun, et al.
Pubblicazione: (2025)
di: Zhou, Yilun, et al.
Pubblicazione: (2025)
Balanced Accuracy: The Right Metric for Evaluating LLM Judges -- Explained through Youden's J statistic
di: Collot, Stephane, et al.
Pubblicazione: (2025)
di: Collot, Stephane, et al.
Pubblicazione: (2025)
Criterion Validity of LLM-as-Judge for Business Outcomes in Conversational Commerce
di: Chen, Liang, et al.
Pubblicazione: (2026)
di: Chen, Liang, et al.
Pubblicazione: (2026)
Documenti analoghi
-
On the Credibility of Evaluating LLMs using Survey Questions
di: Libovický, Jindřich
Pubblicazione: (2026) -
Lexically Grounded Subword Segmentation
di: Libovický, Jindřich, et al.
Pubblicazione: (2024) -
Evaluating Morphological Plausibility of Subword Tokenization via Statistical Alignment with Morpho-Syntactic Features
di: Stephen, Abishek, et al.
Pubblicazione: (2026) -
Investigating the Effect of Parallel Data in the Cross-Lingual Transfer for Vision-Language Encoders
di: Manea, Andrei-Alexandru, et al.
Pubblicazione: (2025) -
Crowdsourcing Piedmontese to Test LLMs on Non-Standard Orthography
di: Vico, Gianluca, et al.
Pubblicazione: (2026)