Leveraging Large Language Models for NLG Evaluation: Advances and Challenges
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Li, Zhen, Xu, Xiaohan, Shen, Tao, Xu, Can, Gu, Jia-Chen, Lai, Yuxuan, Tao, Chongyang, Ma, Shuai |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Re-Reading Improves Reasoning in Large Language Models
von: Xu, Xiaohan, et al.
Veröffentlicht: (2023)
von: Xu, Xiaohan, et al.
Veröffentlicht: (2023)
A Survey on Knowledge Distillation of Large Language Models
von: Xu, Xiaohan, et al.
Veröffentlicht: (2024)
von: Xu, Xiaohan, et al.
Veröffentlicht: (2024)
Large Language Models Are Active Critics in NLG Evaluation
von: Xu, Shuying, et al.
Veröffentlicht: (2024)
von: Xu, Shuying, et al.
Veröffentlicht: (2024)
LLMs are Also Effective Embedding Models: An In-depth Overview
von: Tao, Chongyang, et al.
Veröffentlicht: (2024)
von: Tao, Chongyang, et al.
Veröffentlicht: (2024)
Unveiling the Achilles' Heel of NLG Evaluators: A Unified Adversarial Framework Driven by Large Language Models
von: Chen, Yiming, et al.
Veröffentlicht: (2024)
von: Chen, Yiming, et al.
Veröffentlicht: (2024)
A Comprehensive Evaluation on Event Reasoning of Large Language Models
von: Tao, Zhengwei, et al.
Veröffentlicht: (2024)
von: Tao, Zhengwei, et al.
Veröffentlicht: (2024)
LLM-based NLG Evaluation: Current Status and Challenges
von: Gao, Mingqi, et al.
Veröffentlicht: (2024)
von: Gao, Mingqi, et al.
Veröffentlicht: (2024)
Meta-Task Prompting Elicits Embeddings from Large Language Models
von: Lei, Yibin, et al.
Veröffentlicht: (2024)
von: Lei, Yibin, et al.
Veröffentlicht: (2024)
Are LLM-based Evaluators Confusing NLG Quality Criteria?
von: Hu, Xinyu, et al.
Veröffentlicht: (2024)
von: Hu, Xinyu, et al.
Veröffentlicht: (2024)
Adam: Dense Retrieval Distillation with Adaptive Dark Examples
von: Tao, Chongyang, et al.
Veröffentlicht: (2022)
von: Tao, Chongyang, et al.
Veröffentlicht: (2022)
OOP: Object-Oriented Programming Evaluation Benchmark for Large Language Models
von: Wang, Shuai, et al.
Veröffentlicht: (2024)
von: Wang, Shuai, et al.
Veröffentlicht: (2024)
WizardCoder: Empowering Code Large Language Models with Evol-Instruct
von: Luo, Ziyang, et al.
Veröffentlicht: (2023)
von: Luo, Ziyang, et al.
Veröffentlicht: (2023)
Themis: A Reference-free NLG Evaluation Language Model with Flexibility and Interpretability
von: Hu, Xinyu, et al.
Veröffentlicht: (2024)
von: Hu, Xinyu, et al.
Veröffentlicht: (2024)
Is Reference Necessary in the Evaluation of NLG Systems? When and Where?
von: Sheng, Shuqian, et al.
Veröffentlicht: (2024)
von: Sheng, Shuqian, et al.
Veröffentlicht: (2024)
CCPrefix: Counterfactual Contrastive Prefix-Tuning for Many-Class Classification
von: Li, Yang, et al.
Veröffentlicht: (2022)
von: Li, Yang, et al.
Veröffentlicht: (2022)
Analyzing and Evaluating Correlation Measures in NLG Meta-Evaluation
von: Gao, Mingqi, et al.
Veröffentlicht: (2024)
von: Gao, Mingqi, et al.
Veröffentlicht: (2024)
Unveiling Large Language Models Generated Texts: A Multi-Level Fine-Grained Detection Framework
von: Tao, Zhen, et al.
Veröffentlicht: (2024)
von: Tao, Zhen, et al.
Veröffentlicht: (2024)
NLG Evaluation: Past, Present, Future
von: Reiter, Ehud
Veröffentlicht: (2026)
von: Reiter, Ehud
Veröffentlicht: (2026)
LLM Comparative Assessment: Zero-shot NLG Evaluation through Pairwise Comparisons using Large Language Models
von: Liusie, Adian, et al.
Veröffentlicht: (2023)
von: Liusie, Adian, et al.
Veröffentlicht: (2023)
AmbigNLG: Addressing Task Ambiguity in Instruction for NLG
von: Niwa, Ayana, et al.
Veröffentlicht: (2024)
von: Niwa, Ayana, et al.
Veröffentlicht: (2024)
Neighboring Perturbations of Knowledge Editing on Large Language Models
von: Ma, Jun-Yu, et al.
Veröffentlicht: (2024)
von: Ma, Jun-Yu, et al.
Veröffentlicht: (2024)
Leveraging Open Knowledge for Advancing Task Expertise in Large Language Models
von: Yang, Yuncheng, et al.
Veröffentlicht: (2024)
von: Yang, Yuncheng, et al.
Veröffentlicht: (2024)
Leveraging Group Relative Policy Optimization to Advance Large Language Models in Traditional Chinese Medicine
von: Xie, Jiacheng, et al.
Veröffentlicht: (2025)
von: Xie, Jiacheng, et al.
Veröffentlicht: (2025)
How to Select Datapoints for Efficient Human Evaluation of NLG Models?
von: Zouhar, Vilém, et al.
Veröffentlicht: (2025)
von: Zouhar, Vilém, et al.
Veröffentlicht: (2025)
MCQA-Eval: Efficient Confidence Evaluation in NLG with Gold-Standard Correctness Labels
von: Liu, Xiaoou, et al.
Veröffentlicht: (2025)
von: Liu, Xiaoou, et al.
Veröffentlicht: (2025)
CAT-LLM: Style-enhanced Large Language Models with Text Style Definition for Chinese Article-style Transfer
von: Tao, Zhen, et al.
Veröffentlicht: (2024)
von: Tao, Zhen, et al.
Veröffentlicht: (2024)
Breaking Block Boundaries: Anchor-based History-stable Decoding for Diffusion Large Language Models
von: Zou, Shun, et al.
Veröffentlicht: (2026)
von: Zou, Shun, et al.
Veröffentlicht: (2026)
Exploring the Multilingual NLG Evaluation Abilities of LLM-Based Evaluators
von: Chang, Jiayi, et al.
Veröffentlicht: (2025)
von: Chang, Jiayi, et al.
Veröffentlicht: (2025)
The statistical advantage of automatic NLG metrics at the system level
von: Wei, Johnny Tian-Zheng, et al.
Veröffentlicht: (2021)
von: Wei, Johnny Tian-Zheng, et al.
Veröffentlicht: (2021)
Model Editing Harms General Abilities of Large Language Models: Regularization to the Rescue
von: Gu, Jia-Chen, et al.
Veröffentlicht: (2024)
von: Gu, Jia-Chen, et al.
Veröffentlicht: (2024)
WizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-Instruct
von: Luo, Haipeng, et al.
Veröffentlicht: (2023)
von: Luo, Haipeng, et al.
Veröffentlicht: (2023)
Evaluating Large Language Models for Evidence-Based Clinical Question Answering
von: Wang, Can, et al.
Veröffentlicht: (2025)
von: Wang, Can, et al.
Veröffentlicht: (2025)
DHP Benchmark: Are LLMs Good NLG Evaluators?
von: Wang, Yicheng, et al.
Veröffentlicht: (2024)
von: Wang, Yicheng, et al.
Veröffentlicht: (2024)
AutoWebGLM: A Large Language Model-based Web Navigating Agent
von: Lai, Hanyu, et al.
Veröffentlicht: (2024)
von: Lai, Hanyu, et al.
Veröffentlicht: (2024)
Evaluating the Reversal Curse in Model Editing
von: Xu, Hao-Xiang, et al.
Veröffentlicht: (2023)
von: Xu, Hao-Xiang, et al.
Veröffentlicht: (2023)
AIR: Post-training Data Selection for Reasoning via Attention Head Influence
von: Liu, Jinrui, et al.
Veröffentlicht: (2025)
von: Liu, Jinrui, et al.
Veröffentlicht: (2025)
Not All Metrics Are Guilty: Improving NLG Evaluation by Diversifying References
von: Tang, Tianyi, et al.
Veröffentlicht: (2023)
von: Tang, Tianyi, et al.
Veröffentlicht: (2023)
Playing 20 Question Game with Policy-Based Reinforcement Learning
von: Hu, Huang, et al.
Veröffentlicht: (2018)
von: Hu, Huang, et al.
Veröffentlicht: (2018)
EvolSQL: Structure-Aware Evolution for Scalable Text-to-SQL Data Synthesis
von: Pan, Xuanguang, et al.
Veröffentlicht: (2026)
von: Pan, Xuanguang, et al.
Veröffentlicht: (2026)
Are Large Language Models Possible to Conduct Cognitive Behavioral Therapy?
von: Shen, Hao, et al.
Veröffentlicht: (2024)
von: Shen, Hao, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Re-Reading Improves Reasoning in Large Language Models
von: Xu, Xiaohan, et al.
Veröffentlicht: (2023) -
A Survey on Knowledge Distillation of Large Language Models
von: Xu, Xiaohan, et al.
Veröffentlicht: (2024) -
Large Language Models Are Active Critics in NLG Evaluation
von: Xu, Shuying, et al.
Veröffentlicht: (2024) -
LLMs are Also Effective Embedding Models: An In-depth Overview
von: Tao, Chongyang, et al.
Veröffentlicht: (2024) -
Unveiling the Achilles' Heel of NLG Evaluators: A Unified Adversarial Framework Driven by Large Language Models
von: Chen, Yiming, et al.
Veröffentlicht: (2024)