OpeNLGauge: An Explainable Metric for NLG Evaluation with Open-Weights LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kartáč, Ivan, Lango, Mateusz, Dušek, Ondřej |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Reasoning Gets Harder for LLMs Inside A Dialogue
par: Kartáč, Ivan, et autres
Publié: (2026)
par: Kartáč, Ivan, et autres
Publié: (2026)
LLM Agents Implement an NLG System from Scratch: Building Interpretable Rule-Based RDF-to-Text Generators
par: Lango, Mateusz, et autres
Publié: (2025)
par: Lango, Mateusz, et autres
Publié: (2025)
UFAL-CUNI at SemEval-2026 Task 11: An Efficient Modular Neuro-symbolic Method for Syllogistic Reasoning
par: Kartáč, Ivan, et autres
Publié: (2026)
par: Kartáč, Ivan, et autres
Publié: (2026)
Leak, Cheat, Repeat: Data Contamination and Evaluation Malpractices in Closed-Source LLMs
par: Balloccu, Simone, et autres
Publié: (2024)
par: Balloccu, Simone, et autres
Publié: (2024)
SRS-Stories: Vocabulary-constrained multilingual story generation for language learning
par: Kamzela, Wiktor, et autres
Publié: (2025)
par: Kamzela, Wiktor, et autres
Publié: (2025)
Leveraging Large Language Models for Building Interpretable Rule-Based Data-to-Text Systems
par: Warczyński, Jędrzej, et autres
Publié: (2025)
par: Warczyński, Jędrzej, et autres
Publié: (2025)
Faithful and Plausible Natural Language Explanations for Image Classification: A Pipeline Approach
par: Wojciechowski, Adam, et autres
Publié: (2024)
par: Wojciechowski, Adam, et autres
Publié: (2024)
A Survey of Text Style Transfer: Applications and Ethical Implications
par: Mukherjee, Sourabrata, et autres
Publié: (2024)
par: Mukherjee, Sourabrata, et autres
Publié: (2024)
LLMs as Span Annotators: A Comparative Study of LLMs and Humans
par: Kasner, Zdeněk, et autres
Publié: (2025)
par: Kasner, Zdeněk, et autres
Publié: (2025)
Beyond Traditional Benchmarks: Analyzing Behaviors of Open LLMs on Data-to-Text Generation
par: Kasner, Zdeněk, et autres
Publié: (2024)
par: Kasner, Zdeněk, et autres
Publié: (2024)
AnimatedLLM: Explaining LLMs with Interactive Visualizations
par: Kasner, Zdeněk, et autres
Publié: (2025)
par: Kasner, Zdeněk, et autres
Publié: (2025)
Evaluating Text Style Transfer Evaluation: Are There Any Reliable Metrics?
par: Mukherjee, Sourabrata, et autres
Publié: (2025)
par: Mukherjee, Sourabrata, et autres
Publié: (2025)
Generating clickbait spoilers with an ensemble of large language models
par: Woźny, Mateusz, et autres
Publié: (2024)
par: Woźny, Mateusz, et autres
Publié: (2024)
FreshTab: Sourcing Fresh Data for Table-to-Text Generation Evaluation
par: Onderková, Kristýna, et autres
Publié: (2025)
par: Onderková, Kristýna, et autres
Publié: (2025)
Real-World Summarization: When Evaluation Reaches Its Limits
par: Schmidtová, Patrícia, et autres
Publié: (2025)
par: Schmidtová, Patrícia, et autres
Publié: (2025)
Not All Metrics Are Guilty: Improving NLG Evaluation by Diversifying References
par: Tang, Tianyi, et autres
Publié: (2023)
par: Tang, Tianyi, et autres
Publié: (2023)
Text Style Transfer: An Introductory Overview
par: Mukherjee, Sourabrata, et autres
Publié: (2024)
par: Mukherjee, Sourabrata, et autres
Publié: (2024)
LEEETs-Dial: Linguistic Entrainment in End-to-End Task-oriented Dialogue systems
par: Kumar, Nalin, et autres
Publié: (2023)
par: Kumar, Nalin, et autres
Publié: (2023)
DHP Benchmark: Are LLMs Good NLG Evaluators?
par: Wang, Yicheng, et autres
Publié: (2024)
par: Wang, Yicheng, et autres
Publié: (2024)
factgenie: A Framework for Span-based Evaluation of Generated Texts
par: Kasner, Zdeněk, et autres
Publié: (2024)
par: Kasner, Zdeněk, et autres
Publié: (2024)
Polish-ASTE: Aspect-Sentiment Triplet Extraction Datasets for Polish
par: Lango, Marta, et autres
Publié: (2025)
par: Lango, Marta, et autres
Publié: (2025)
Automatic Metrics in Natural Language Generation: A Survey of Current Evaluation Practices
par: Schmidtová, Patrícia, et autres
Publié: (2024)
par: Schmidtová, Patrícia, et autres
Publié: (2024)
ASTE Transformer Modelling Dependencies in Aspect-Sentiment Triplet Extraction
par: Naglik, Iwo, et autres
Publié: (2024)
par: Naglik, Iwo, et autres
Publié: (2024)
Strategies for Span Labeling with Large Language Models
par: Semin, Danil, et autres
Publié: (2026)
par: Semin, Danil, et autres
Publié: (2026)
NLG Evaluation: Past, Present, Future
par: Reiter, Ehud
Publié: (2026)
par: Reiter, Ehud
Publié: (2026)
AmbigNLG: Addressing Task Ambiguity in Instruction for NLG
par: Niwa, Ayana, et autres
Publié: (2024)
par: Niwa, Ayana, et autres
Publié: (2024)
Analyzing and Evaluating Correlation Measures in NLG Meta-Evaluation
par: Gao, Mingqi, et autres
Publié: (2024)
par: Gao, Mingqi, et autres
Publié: (2024)
Are Large Language Models Actually Good at Text Style Transfer?
par: Mukherjee, Sourabrata, et autres
Publié: (2024)
par: Mukherjee, Sourabrata, et autres
Publié: (2024)
Exploring the Multilingual NLG Evaluation Abilities of LLM-Based Evaluators
par: Chang, Jiayi, et autres
Publié: (2025)
par: Chang, Jiayi, et autres
Publié: (2025)
Teaching LLMs at Charles University: Assignments and Activities
par: Helcl, Jindřich, et autres
Publié: (2024)
par: Helcl, Jindřich, et autres
Publié: (2024)
Are LLM-based Evaluators Confusing NLG Quality Criteria?
par: Hu, Xinyu, et autres
Publié: (2024)
par: Hu, Xinyu, et autres
Publié: (2024)
Large Language Models Are Active Critics in NLG Evaluation
par: Xu, Shuying, et autres
Publié: (2024)
par: Xu, Shuying, et autres
Publié: (2024)
LLM-based NLG Evaluation: Current Status and Challenges
par: Gao, Mingqi, et autres
Publié: (2024)
par: Gao, Mingqi, et autres
Publié: (2024)
Is Reference Necessary in the Evaluation of NLG Systems? When and Where?
par: Sheng, Shuqian, et autres
Publié: (2024)
par: Sheng, Shuqian, et autres
Publié: (2024)
The Problem of Coherence in Natural Language Explanations of Recommendations
par: Raczyński, Jakub, et autres
Publié: (2023)
par: Raczyński, Jakub, et autres
Publié: (2023)
How to Select Datapoints for Efficient Human Evaluation of NLG Models?
par: Zouhar, Vilém, et autres
Publié: (2025)
par: Zouhar, Vilém, et autres
Publié: (2025)
Leveraging Large Language Models for NLG Evaluation: Advances and Challenges
par: Li, Zhen, et autres
Publié: (2024)
par: Li, Zhen, et autres
Publié: (2024)
Themis: A Reference-free NLG Evaluation Language Model with Flexibility and Interpretability
par: Hu, Xinyu, et autres
Publié: (2024)
par: Hu, Xinyu, et autres
Publié: (2024)
Integration of LLM Quality Assurance into an NLG System
par: Chen, Ching-Yi, et autres
Publié: (2025)
par: Chen, Ching-Yi, et autres
Publié: (2025)
A Dual-Perspective NLG Meta-Evaluation Framework with Automatic Benchmark and Better Interpretability
par: Hu, Xinyu, et autres
Publié: (2025)
par: Hu, Xinyu, et autres
Publié: (2025)
Documents similaires
-
Reasoning Gets Harder for LLMs Inside A Dialogue
par: Kartáč, Ivan, et autres
Publié: (2026) -
LLM Agents Implement an NLG System from Scratch: Building Interpretable Rule-Based RDF-to-Text Generators
par: Lango, Mateusz, et autres
Publié: (2025) -
UFAL-CUNI at SemEval-2026 Task 11: An Efficient Modular Neuro-symbolic Method for Syllogistic Reasoning
par: Kartáč, Ivan, et autres
Publié: (2026) -
Leak, Cheat, Repeat: Data Contamination and Evaluation Malpractices in Closed-Source LLMs
par: Balloccu, Simone, et autres
Publié: (2024) -
SRS-Stories: Vocabulary-constrained multilingual story generation for language learning
par: Kamzela, Wiktor, et autres
Publié: (2025)