Is Reference Necessary in the Evaluation of NLG Systems? When and Where?
Fuente:
arXiv
Saved in:
| Main Authors: | Sheng, Shuqian, Xu, Yi, Fu, Luoyi, Ding, Jiaxin, Zhou, Lei, Wang, Xinbing, Zhou, Chenghu |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
RepEval: Effective Text Evaluation with LLM Representation
by: Sheng, Shuqian, et al.
Published: (2024)
by: Sheng, Shuqian, et al.
Published: (2024)
Good Idea or Not, Representation of LLM Could Tell
by: Xu, Yi, et al.
Published: (2024)
by: Xu, Yi, et al.
Published: (2024)
RADAR: Reasoning as Discrimination with Aligned Representations for LLM-based Knowledge Graph Reasoning
by: Xue, Bo, et al.
Published: (2026)
by: Xue, Bo, et al.
Published: (2026)
AceParse: A Comprehensive Dataset with Diverse Structured Texts for Academic Literature Parsing
by: Ji, Huawei, et al.
Published: (2024)
by: Ji, Huawei, et al.
Published: (2024)
FLAME: Empowering Frozen LLMs for Knowledge Graph Completion
by: Xue, Bo, et al.
Published: (2024)
by: Xue, Bo, et al.
Published: (2024)
Exterior Penalty Policy Optimization with Penalty Metric Network under Constraints
by: Gao, Shiqing, et al.
Published: (2024)
by: Gao, Shiqing, et al.
Published: (2024)
<SOG_k>: One LLM Token for Explicit Graph Structural Understanding
by: Wu, Jingyao, et al.
Published: (2026)
by: Wu, Jingyao, et al.
Published: (2026)
Not All Metrics Are Guilty: Improving NLG Evaluation by Diversifying References
by: Tang, Tianyi, et al.
Published: (2023)
by: Tang, Tianyi, et al.
Published: (2023)
Characterizing the Influence of Topology on Graph Learning Tasks
by: Wu, Kailong, et al.
Published: (2024)
by: Wu, Kailong, et al.
Published: (2024)
Structured In-context Environment Scaling for Large Language Model Reasoning
by: Yu, Peng, et al.
Published: (2025)
by: Yu, Peng, et al.
Published: (2025)
HuRef: HUman-REadable Fingerprint for Large Language Models
by: Zeng, Boyi, et al.
Published: (2023)
by: Zeng, Boyi, et al.
Published: (2023)
AutoFAIR : Automatic Data FAIRification via Machine Reading
by: Ma, Tingyan, et al.
Published: (2024)
by: Ma, Tingyan, et al.
Published: (2024)
Themis: A Reference-free NLG Evaluation Language Model with Flexibility and Interpretability
by: Hu, Xinyu, et al.
Published: (2024)
by: Hu, Xinyu, et al.
Published: (2024)
Integration of LLM Quality Assurance into an NLG System
by: Chen, Ching-Yi, et al.
Published: (2025)
by: Chen, Ching-Yi, et al.
Published: (2025)
Improving LLM Reasoning with Homophily-aware Structural and Semantic Text-Attributed Graph Compression
by: Di, Zijun, et al.
Published: (2026)
by: Di, Zijun, et al.
Published: (2026)
Large Language Models Are Active Critics in NLG Evaluation
by: Xu, Shuying, et al.
Published: (2024)
by: Xu, Shuying, et al.
Published: (2024)
NLG Evaluation: Past, Present, Future
by: Reiter, Ehud
Published: (2026)
by: Reiter, Ehud
Published: (2026)
AmbigNLG: Addressing Task Ambiguity in Instruction for NLG
by: Niwa, Ayana, et al.
Published: (2024)
by: Niwa, Ayana, et al.
Published: (2024)
Are LLM-based Evaluators Confusing NLG Quality Criteria?
by: Hu, Xinyu, et al.
Published: (2024)
by: Hu, Xinyu, et al.
Published: (2024)
Controlling Underestimation Bias in Constrained Reinforcement Learning for Safe Exploration
by: Gao, Shiqing, et al.
Published: (2026)
by: Gao, Shiqing, et al.
Published: (2026)
Scientific and technological knowledge grows linearly over time
by: Kang, Huquan, et al.
Published: (2024)
by: Kang, Huquan, et al.
Published: (2024)
Leveraging Large Language Models for NLG Evaluation: Advances and Challenges
by: Li, Zhen, et al.
Published: (2024)
by: Li, Zhen, et al.
Published: (2024)
Analyzing and Evaluating Correlation Measures in NLG Meta-Evaluation
by: Gao, Mingqi, et al.
Published: (2024)
by: Gao, Mingqi, et al.
Published: (2024)
Towards Controlled Table-to-Text Generation with Scientific Reasoning
by: Guo, Zhixin, et al.
Published: (2023)
by: Guo, Zhixin, et al.
Published: (2023)
Lambda: Learning Matchable Prior For Entity Alignment with Unlabeled Dangling Cases
by: Yin, Hang, et al.
Published: (2024)
by: Yin, Hang, et al.
Published: (2024)
DHP Benchmark: Are LLMs Good NLG Evaluators?
by: Wang, Yicheng, et al.
Published: (2024)
by: Wang, Yicheng, et al.
Published: (2024)
Exploring the Multilingual NLG Evaluation Abilities of LLM-Based Evaluators
by: Chang, Jiayi, et al.
Published: (2025)
by: Chang, Jiayi, et al.
Published: (2025)
LLM-based NLG Evaluation: Current Status and Challenges
by: Gao, Mingqi, et al.
Published: (2024)
by: Gao, Mingqi, et al.
Published: (2024)
How to Select Datapoints for Efficient Human Evaluation of NLG Models?
by: Zouhar, Vilém, et al.
Published: (2025)
by: Zouhar, Vilém, et al.
Published: (2025)
IFDID: Information Filter upon Diversity-Improved Decoding for Diversity-Faithfulness Tradeoff in NLG
by: Meng, Han, et al.
Published: (2022)
by: Meng, Han, et al.
Published: (2022)
OpeNLGauge: An Explainable Metric for NLG Evaluation with Open-Weights LLMs
by: Kartáč, Ivan, et al.
Published: (2025)
by: Kartáč, Ivan, et al.
Published: (2025)
What Are We Measuring in NLG? A Meta-Analysis of Evaluation Trends 2020-2025
by: Yang, Jing, et al.
Published: (2026)
by: Yang, Jing, et al.
Published: (2026)
Steering When Necessary: Flexible Steering Large Language Models with Backtracking
by: Cheng, Zifeng, et al.
Published: (2025)
by: Cheng, Zifeng, et al.
Published: (2025)
Beyond One-Size-Fits-All: Inversion Learning for Highly Effective NLG Evaluation Prompts
by: Hong, Hanhua, et al.
Published: (2025)
by: Hong, Hanhua, et al.
Published: (2025)
VisPCO: Visual Token Pruning Configuration Optimization via Budget-Aware Pareto-Frontier Learning for Vision-Language Models
by: Ji, Huawei, et al.
Published: (2026)
by: Ji, Huawei, et al.
Published: (2026)
Bayesian Cross-Modal Alignment Learning for Few-Shot Out-of-Distribution Generalization
by: Zhu, Lin, et al.
Published: (2025)
by: Zhu, Lin, et al.
Published: (2025)
Defining and Detecting Vulnerability in Human Evaluation Guidelines: A Preliminary Study Towards Reliable NLG Evaluation
by: Ruan, Jie, et al.
Published: (2024)
by: Ruan, Jie, et al.
Published: (2024)
A Dual-Perspective NLG Meta-Evaluation Framework with Automatic Benchmark and Better Interpretability
by: Hu, Xinyu, et al.
Published: (2025)
by: Hu, Xinyu, et al.
Published: (2025)
GeoGalactica: A Scientific Large Language Model in Geoscience
by: Lin, Zhouhan, et al.
Published: (2023)
by: Lin, Zhouhan, et al.
Published: (2023)
The statistical advantage of automatic NLG metrics at the system level
by: Wei, Johnny Tian-Zheng, et al.
Published: (2021)
by: Wei, Johnny Tian-Zheng, et al.
Published: (2021)
Similar Items
-
RepEval: Effective Text Evaluation with LLM Representation
by: Sheng, Shuqian, et al.
Published: (2024) -
Good Idea or Not, Representation of LLM Could Tell
by: Xu, Yi, et al.
Published: (2024) -
RADAR: Reasoning as Discrimination with Aligned Representations for LLM-based Knowledge Graph Reasoning
by: Xue, Bo, et al.
Published: (2026) -
AceParse: A Comprehensive Dataset with Diverse Structured Texts for Academic Literature Parsing
by: Ji, Huawei, et al.
Published: (2024) -
FLAME: Empowering Frozen LLMs for Knowledge Graph Completion
by: Xue, Bo, et al.
Published: (2024)