Enregistré dans:
| Auteurs principaux: | Hu, Taojun, Zhou, Xiao-Hua |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2404.09135 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LLM-based NLG Evaluation: Current Status and Challenges
par: Gao, Mingqi, et autres
Publié: (2024)
par: Gao, Mingqi, et autres
Publié: (2024)
Evaluating the Utility of Grounding Documents with Reference-Free LLM-based Metrics
par: Hua, Yilun, et autres
Publié: (2026)
par: Hua, Yilun, et autres
Publié: (2026)
Evaluating Metrics for Safety with LLM-as-Judges
par: Clegg, Kester, et autres
Publié: (2025)
par: Clegg, Kester, et autres
Publié: (2025)
Focus-dLLM: Accelerating Long-Context Diffusion LLM Inference via Confidence-Guided Context Focusing
par: Long, Lingkun, et autres
Publié: (2026)
par: Long, Lingkun, et autres
Publié: (2026)
LLM-as-a-tutor in EFL Writing Education: Focusing on Evaluation of Student-LLM Interaction
par: Han, Jieun, et autres
Publié: (2023)
par: Han, Jieun, et autres
Publié: (2023)
Faithful Model Evaluation for Model-Based Metrics
par: Goyal, Palash, et autres
Publié: (2023)
par: Goyal, Palash, et autres
Publié: (2023)
Mind the Blind Spots: A Focus-Level Evaluation Framework for LLM Reviews
par: Shin, Hyungyu, et autres
Publié: (2025)
par: Shin, Hyungyu, et autres
Publié: (2025)
Unveiling Knowledge Utilization Mechanisms in LLM-based Retrieval-Augmented Generation
par: Wang, Yuhao, et autres
Publié: (2025)
par: Wang, Yuhao, et autres
Publié: (2025)
Automatic Evaluation Metrics for Document-level Translation: Overview, Challenges and Trends
par: GUO, Jiaxin, et autres
Publié: (2025)
par: GUO, Jiaxin, et autres
Publié: (2025)
An LLM-as-Judge Metric for Bridging the Gap with Human Evaluation in SE Tasks
par: Zhou, Xin, et autres
Publié: (2025)
par: Zhou, Xin, et autres
Publié: (2025)
PsycoLLM: Enhancing LLM for Psychological Understanding and Evaluation
par: Hu, Jinpeng, et autres
Publié: (2024)
par: Hu, Jinpeng, et autres
Publié: (2024)
Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates
par: Wei, Hui, et autres
Publié: (2024)
par: Wei, Hui, et autres
Publié: (2024)
LLM as a Meta-Judge: Synthetic Data for NLP Evaluation Metric Validation
par: Eigler, Lukáš, et autres
Publié: (2026)
par: Eigler, Lukáš, et autres
Publié: (2026)
HarmMetric Eval: Benchmarking Metrics and Judges for LLM Harmfulness Assessment
par: Yang, Langqi, et autres
Publié: (2025)
par: Yang, Langqi, et autres
Publié: (2025)
Challenging the Evaluator: LLM Sycophancy Under User Rebuttal
par: Kim, Sungwon, et autres
Publié: (2025)
par: Kim, Sungwon, et autres
Publié: (2025)
A Study on Question-Answer Dataset for LLM Safety Evaluation with a Focus on Illegal Activities
par: Imamura, Kenji, et autres
Publié: (2026)
par: Imamura, Kenji, et autres
Publié: (2026)
GAMBIT+: A Challenge Set for Evaluating Gender Bias in Machine Translation Quality Estimation Metrics
par: Filandrianos, Giorgos, et autres
Publié: (2025)
par: Filandrianos, Giorgos, et autres
Publié: (2025)
A Survey of LLM-based Deep Search Agents: Paradigm, Optimization, Evaluation, and Challenges
par: Xi, Yunjia, et autres
Publié: (2025)
par: Xi, Yunjia, et autres
Publié: (2025)
How to Get Your LLM to Generate Challenging Problems for Evaluation
par: Patel, Arkil, et autres
Publié: (2025)
par: Patel, Arkil, et autres
Publié: (2025)
IDGen: Item Discrimination Induced Prompt Generation for LLM Evaluation
par: Lin, Fan, et autres
Publié: (2024)
par: Lin, Fan, et autres
Publié: (2024)
Agreement Metrics for LLM-as-Judge Evaluation: What to Report and Why
par: Rao, Delip, et autres
Publié: (2026)
par: Rao, Delip, et autres
Publié: (2026)
LLM Inference Unveiled: Survey and Roofline Model Insights
par: Yuan, Zhihang, et autres
Publié: (2024)
par: Yuan, Zhihang, et autres
Publié: (2024)
Contextual Metric Meta-Evaluation by Measuring Local Metric Accuracy
par: Deviyani, Athiya, et autres
Publié: (2025)
par: Deviyani, Athiya, et autres
Publié: (2025)
PromptOptMe: Error-Aware Prompt Compression for LLM-based MT Evaluation Metrics
par: Larionov, Daniil, et autres
Publié: (2024)
par: Larionov, Daniil, et autres
Publié: (2024)
Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions
par: Tang, Bangsheng, et autres
Publié: (2025)
par: Tang, Bangsheng, et autres
Publié: (2025)
Evaluating Causal Explanation in Medical Reports with LLM-Based and Human-Aligned Metrics
par: Cho, Yousang, et autres
Publié: (2025)
par: Cho, Yousang, et autres
Publié: (2025)
NLP for Local Governance Meeting Records: A Focus Article on Tasks, Datasets, Metrics and Benchmark
par: Campos, Ricardo, et autres
Publié: (2026)
par: Campos, Ricardo, et autres
Publié: (2026)
Developing a Multilingual Dataset and Evaluation Metrics for Code-Switching: A Focus on Hong Kong's Polylingual Dynamics
par: Xie, Peng, et autres
Publié: (2023)
par: Xie, Peng, et autres
Publié: (2023)
Shadow in the Cache: Unveiling and Mitigating Privacy Risks of KV-cache in LLM Inference
par: Luo, Zhifan, et autres
Publié: (2025)
par: Luo, Zhifan, et autres
Publié: (2025)
The Challenges of Evaluating LLM Applications: An Analysis of Automated, Human, and LLM-Based Approaches
par: Abeysinghe, Bhashithe, et autres
Publié: (2024)
par: Abeysinghe, Bhashithe, et autres
Publié: (2024)
Evaluating Compositional Approaches for Focus and Sentiment Analysis
par: Kellert, Olga, et autres
Publié: (2025)
par: Kellert, Olga, et autres
Publié: (2025)
ContrastScore: Towards Higher Quality, Less Biased, More Efficient Evaluation Metrics with Contrastive Evaluation
par: Wang, Xiao, et autres
Publié: (2025)
par: Wang, Xiao, et autres
Publié: (2025)
Unveiling Language Competence Neurons: A Psycholinguistic Approach to Model Interpretability
par: Duan, Xufeng, et autres
Publié: (2024)
par: Duan, Xufeng, et autres
Publié: (2024)
Visualizing Uncertainty in Translation Tasks: An Evaluation of LLM Performance and Confidence Metrics
par: Park, Jin Hyun, et autres
Publié: (2025)
par: Park, Jin Hyun, et autres
Publié: (2025)
APPLS: Evaluating Evaluation Metrics for Plain Language Summarization
par: Guo, Yue, et autres
Publié: (2023)
par: Guo, Yue, et autres
Publié: (2023)
A Comparison of LLM Finetuning Methods & Evaluation Metrics with Travel Chatbot Use Case
par: Meyer, Sonia, et autres
Publié: (2024)
par: Meyer, Sonia, et autres
Publié: (2024)
Exploring the Multilingual NLG Evaluation Abilities of LLM-Based Evaluators
par: Chang, Jiayi, et autres
Publié: (2025)
par: Chang, Jiayi, et autres
Publié: (2025)
Evaluating Metrics for Bias in Word Embeddings
par: Schröder, Sarah, et autres
Publié: (2021)
par: Schröder, Sarah, et autres
Publié: (2021)
ProverbEval: Exploring LLM Evaluation Challenges for Low-resource Language Understanding
par: Azime, Israel Abebe, et autres
Publié: (2024)
par: Azime, Israel Abebe, et autres
Publié: (2024)
A likelihood-based sensitivity analysis for addressing publication bias in meta-analysis of diagnostic studies using exact likelihood
par: Hu, Taojun, et autres
Publié: (2024)
par: Hu, Taojun, et autres
Publié: (2024)
Documents similaires
-
LLM-based NLG Evaluation: Current Status and Challenges
par: Gao, Mingqi, et autres
Publié: (2024) -
Evaluating the Utility of Grounding Documents with Reference-Free LLM-based Metrics
par: Hua, Yilun, et autres
Publié: (2026) -
Evaluating Metrics for Safety with LLM-as-Judges
par: Clegg, Kester, et autres
Publié: (2025) -
Focus-dLLM: Accelerating Long-Context Diffusion LLM Inference via Confidence-Guided Context Focusing
par: Long, Lingkun, et autres
Publié: (2026) -
LLM-as-a-tutor in EFL Writing Education: Focusing on Evaluation of Student-LLM Interaction
par: Han, Jieun, et autres
Publié: (2023)