Unveiling the Achilles' Heel of NLG Evaluators: A Unified Adversarial Framework Driven by Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Chen, Yiming, Zhang, Chen, Luo, Danqing, D'Haro, Luis Fernando, Tan, Robby T., Li, Haizhou |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
A Comprehensive Analysis of the Effectiveness of Large Language Models as Automatic Dialogue Evaluators
by: Zhang, Chen, et al.
Published: (2023)
by: Zhang, Chen, et al.
Published: (2023)
Beyond Single-Audio: Advancing Multi-Audio Processing in Audio Large Language Models
by: Chen, Yiming, et al.
Published: (2024)
by: Chen, Yiming, et al.
Published: (2024)
Commonsense Generation and Evaluation for Dialogue Systems using Large Language Models
by: Estecha-Garitagoitia, Marcos, et al.
Published: (2025)
by: Estecha-Garitagoitia, Marcos, et al.
Published: (2025)
Unsupervised Mutual Learning of Discourse Parsing and Topic Segmentation in Dialogue
by: Xu, Jiahui, et al.
Published: (2024)
by: Xu, Jiahui, et al.
Published: (2024)
[WIP] Jailbreak Paradox: The Achilles' Heel of LLMs
by: Rao, Abhinav, et al.
Published: (2024)
by: Rao, Abhinav, et al.
Published: (2024)
Audio Is the Achilles' Heel: Red Teaming Audio Large Multimodal Models
by: Yang, Hao, et al.
Published: (2024)
by: Yang, Hao, et al.
Published: (2024)
Images are Achilles' Heel of Alignment: Exploiting Visual Vulnerabilities for Jailbreaking Multimodal Large Language Models
by: Li, Yifan, et al.
Published: (2024)
by: Li, Yifan, et al.
Published: (2024)
Identifying the Achilles' Heel: An Iterative Method for Dynamically Uncovering Factual Errors in Large Language Models
by: Wang, Wenxuan, et al.
Published: (2024)
by: Wang, Wenxuan, et al.
Published: (2024)
The Sword, Shield, and Achilles' Heel: Characterizing the Linguistic Inductive Bias of Large Language Models for Spatial Reasoning in Navigation Planning
by: Zhang, Xudong, et al.
Published: (2026)
by: Zhang, Xudong, et al.
Published: (2026)
Leveraging Large Language Models for NLG Evaluation: Advances and Challenges
by: Li, Zhen, et al.
Published: (2024)
by: Li, Zhen, et al.
Published: (2024)
Against The Achilles' Heel: A Survey on Red Teaming for Generative Models
by: Lin, Lizhi, et al.
Published: (2024)
by: Lin, Lizhi, et al.
Published: (2024)
Large Language Models Are Active Critics in NLG Evaluation
by: Xu, Shuying, et al.
Published: (2024)
by: Xu, Shuying, et al.
Published: (2024)
Overview of Dialog System Evaluation Track: Dimensionality, Language, Culture and Safety at DSTC 12
by: Mendonça, John, et al.
Published: (2025)
by: Mendonça, John, et al.
Published: (2025)
Exposing the Achilles' Heel: Evaluating LLMs Ability to Handle Mistakes in Mathematical Reasoning
by: Singh, Joykirat, et al.
Published: (2024)
by: Singh, Joykirat, et al.
Published: (2024)
VoiceBench: Benchmarking LLM-Based Voice Assistants
by: Chen, Yiming, et al.
Published: (2024)
by: Chen, Yiming, et al.
Published: (2024)
CrossTune: Black-Box Few-Shot Classification with Label Enhancement
by: Luo, Danqing, et al.
Published: (2024)
by: Luo, Danqing, et al.
Published: (2024)
Are LLM-based Evaluators Confusing NLG Quality Criteria?
by: Hu, Xinyu, et al.
Published: (2024)
by: Hu, Xinyu, et al.
Published: (2024)
Themis: A Reference-free NLG Evaluation Language Model with Flexibility and Interpretability
by: Hu, Xinyu, et al.
Published: (2024)
by: Hu, Xinyu, et al.
Published: (2024)
NLG Evaluation: Past, Present, Future
by: Reiter, Ehud
Published: (2026)
by: Reiter, Ehud
Published: (2026)
LLM Comparative Assessment: Zero-shot NLG Evaluation through Pairwise Comparisons using Large Language Models
by: Liusie, Adian, et al.
Published: (2023)
by: Liusie, Adian, et al.
Published: (2023)
AmbigNLG: Addressing Task Ambiguity in Instruction for NLG
by: Niwa, Ayana, et al.
Published: (2024)
by: Niwa, Ayana, et al.
Published: (2024)
How to Select Datapoints for Efficient Human Evaluation of NLG Models?
by: Zouhar, Vilém, et al.
Published: (2025)
by: Zouhar, Vilém, et al.
Published: (2025)
Analyzing and Evaluating Correlation Measures in NLG Meta-Evaluation
by: Gao, Mingqi, et al.
Published: (2024)
by: Gao, Mingqi, et al.
Published: (2024)
ReMedi: Reasoner for Medical Clinical Prediction
by: Cao, Yushi, et al.
Published: (2026)
by: Cao, Yushi, et al.
Published: (2026)
Extramedullary Disease—Achilles Heel in Myeloma?
by: Shaji Kumar, et al.
Published: (2025)
by: Shaji Kumar, et al.
Published: (2025)
Exploring the Multilingual NLG Evaluation Abilities of LLM-Based Evaluators
by: Chang, Jiayi, et al.
Published: (2025)
by: Chang, Jiayi, et al.
Published: (2025)
A Dual-Perspective NLG Meta-Evaluation Framework with Automatic Benchmark and Better Interpretability
by: Hu, Xinyu, et al.
Published: (2025)
by: Hu, Xinyu, et al.
Published: (2025)
DHP Benchmark: Are LLMs Good NLG Evaluators?
by: Wang, Yicheng, et al.
Published: (2024)
by: Wang, Yicheng, et al.
Published: (2024)
LLM-based NLG Evaluation: Current Status and Challenges
by: Gao, Mingqi, et al.
Published: (2024)
by: Gao, Mingqi, et al.
Published: (2024)
Is Reference Necessary in the Evaluation of NLG Systems? When and Where?
by: Sheng, Shuqian, et al.
Published: (2024)
by: Sheng, Shuqian, et al.
Published: (2024)
DynaThink: Fast or Slow? A Dynamic Decision-Making Framework for Large Language Models
by: Pan, Jiabao, et al.
Published: (2024)
by: Pan, Jiabao, et al.
Published: (2024)
Integration of LLM Quality Assurance into an NLG System
by: Chen, Ching-Yi, et al.
Published: (2025)
by: Chen, Ching-Yi, et al.
Published: (2025)
MCQA-Eval: Efficient Confidence Evaluation in NLG with Gold-Standard Correctness Labels
by: Liu, Xiaoou, et al.
Published: (2025)
by: Liu, Xiaoou, et al.
Published: (2025)
Not All Metrics Are Guilty: Improving NLG Evaluation by Diversifying References
by: Tang, Tianyi, et al.
Published: (2023)
by: Tang, Tianyi, et al.
Published: (2023)
Achilles Heel of Distributed Multi-Agent Systems
by: Zhang, Yiting, et al.
Published: (2025)
by: Zhang, Yiting, et al.
Published: (2025)
User Profiles: The Achilles' Heel of Web Browsers
by: Somé, Dolière Francis, et al.
Published: (2025)
by: Somé, Dolière Francis, et al.
Published: (2025)
CodeJudgeBench: Benchmarking LLM-as-a-Judge for Coding Tasks
by: Jiang, Hongchao, et al.
Published: (2025)
by: Jiang, Hongchao, et al.
Published: (2025)
TS-Align: A Teacher-Student Collaborative Framework for Scalable Iterative Finetuning of Large Language Models
by: Zhang, Chen, et al.
Published: (2024)
by: Zhang, Chen, et al.
Published: (2024)
SAGEval: The frontiers of Satisfactory Agent based NLG Evaluation for reference-free open-ended text
by: Ghosh, Reshmi, et al.
Published: (2024)
by: Ghosh, Reshmi, et al.
Published: (2024)
Unifying Large Language Models and Knowledge Graphs: A Roadmap
by: Pan, Shirui, et al.
Published: (2023)
by: Pan, Shirui, et al.
Published: (2023)
Similar Items
-
A Comprehensive Analysis of the Effectiveness of Large Language Models as Automatic Dialogue Evaluators
by: Zhang, Chen, et al.
Published: (2023) -
Beyond Single-Audio: Advancing Multi-Audio Processing in Audio Large Language Models
by: Chen, Yiming, et al.
Published: (2024) -
Commonsense Generation and Evaluation for Dialogue Systems using Large Language Models
by: Estecha-Garitagoitia, Marcos, et al.
Published: (2025) -
Unsupervised Mutual Learning of Discourse Parsing and Topic Segmentation in Dialogue
by: Xu, Jiahui, et al.
Published: (2024) -
[WIP] Jailbreak Paradox: The Achilles' Heel of LLMs
by: Rao, Abhinav, et al.
Published: (2024)