PEEM: Prompt Engineering Evaluation Metrics for Interpretable Joint Evaluation of Prompts and Responses
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hong, Minki, Lee, Eunsoo, Park, Sohyun, Kim, Jihie |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VisDoT : Enhancing Visual Reasoning through Human-Like Interpretation Grounding and Decomposition of Thought
par: Lee, Eunsoo, et autres
Publié: (2026)
par: Lee, Eunsoo, et autres
Publié: (2026)
NormGenesis: Multicultural Dialogue Generation via Exemplar-Guided Social Norm Modeling and Violation Recovery
par: Hong, Minki, et autres
Publié: (2025)
par: Hong, Minki, et autres
Publié: (2025)
Evaluating Consistencies in LLM responses through a Semantic Clustering of Question Answering
par: Lee, Yanggyu, et autres
Publié: (2024)
par: Lee, Yanggyu, et autres
Publié: (2024)
Improving LLM Classification of Logical Errors by Integrating Error Relationship into Prompts
par: Lee, Yanggyu, et autres
Publié: (2024)
par: Lee, Yanggyu, et autres
Publié: (2024)
PromptOptMe: Error-Aware Prompt Compression for LLM-based MT Evaluation Metrics
par: Larionov, Daniil, et autres
Publié: (2024)
par: Larionov, Daniil, et autres
Publié: (2024)
Evaluating Demographic Misrepresentation in Image-to-Image Portrait Editing
par: Seo, Huichan, et autres
Publié: (2026)
par: Seo, Huichan, et autres
Publié: (2026)
Efficient Prompt Optimisation for Legal Text Classification with Proxy Prompt Evaluator
par: Lee, Hyunji, et autres
Publié: (2025)
par: Lee, Hyunji, et autres
Publié: (2025)
Reflexive Prompt Engineering: A Framework for Responsible Prompt Engineering and Interaction Design
par: Djeffal, Christian
Publié: (2025)
par: Djeffal, Christian
Publié: (2025)
Evaluating Prompt Engineering Strategies for Sentiment Control in AI-Generated Texts
par: Sahler, Kerstin, et autres
Publié: (2026)
par: Sahler, Kerstin, et autres
Publié: (2026)
Improving Probability-based Prompt Selection Through Unified Evaluation and Analysis
par: Yang, Sohee, et autres
Publié: (2023)
par: Yang, Sohee, et autres
Publié: (2023)
One Prompt is not Enough: Automated Construction of a Mixture-of-Expert Prompts
par: Wang, Ruochen, et autres
Publié: (2024)
par: Wang, Ruochen, et autres
Publié: (2024)
SDS KoPub VDR: A Benchmark Dataset for Visual Document Retrieval in Korean Public Documents
par: Lee, Jaehoon, et autres
Publié: (2025)
par: Lee, Jaehoon, et autres
Publié: (2025)
Evaluating Prompting Strategies for Grammatical Error Correction Based on Language Proficiency
par: Zeng, Min, et autres
Publié: (2024)
par: Zeng, Min, et autres
Publié: (2024)
Submodular Evaluation Subset Selection in Automatic Prompt Optimization
par: Nian, Jinming, et autres
Publié: (2026)
par: Nian, Jinming, et autres
Publié: (2026)
MCS-SQL: Leveraging Multiple Prompts and Multiple-Choice Selection For Text-to-SQL Generation
par: Lee, Dongjun, et autres
Publié: (2024)
par: Lee, Dongjun, et autres
Publié: (2024)
EvalLM: Interactive Evaluation of Large Language Model Prompts on User-Defined Criteria
par: Kim, Tae Soo, et autres
Publié: (2023)
par: Kim, Tae Soo, et autres
Publié: (2023)
An Automatic Quality Metric for Evaluating Simultaneous Interpretation
par: Makinae, Mana, et autres
Publié: (2024)
par: Makinae, Mana, et autres
Publié: (2024)
Prompt Engineering a Prompt Engineer
par: Ye, Qinyuan, et autres
Publié: (2023)
par: Ye, Qinyuan, et autres
Publié: (2023)
StablePrompt: Automatic Prompt Tuning using Reinforcement Learning for Large Language Models
par: Kwon, Minchan, et autres
Publié: (2024)
par: Kwon, Minchan, et autres
Publié: (2024)
Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates
par: Wei, Hui, et autres
Publié: (2024)
par: Wei, Hui, et autres
Publié: (2024)
KIEval: Evaluation Metric for Document Key Information Extraction
par: Khang, Minsoo, et autres
Publié: (2025)
par: Khang, Minsoo, et autres
Publié: (2025)
Reverse Prompt Engineering
par: Li, Hanqing, et autres
Publié: (2024)
par: Li, Hanqing, et autres
Publié: (2024)
Conversational Prompt Engineering
par: Ein-Dor, Liat, et autres
Publié: (2024)
par: Ein-Dor, Liat, et autres
Publié: (2024)
Systematic Integration of Attention Modules into CNNs for Accurate and Generalizable Medical Image Diagnosis
par: Ullah, Zahid, et autres
Publié: (2025)
par: Ullah, Zahid, et autres
Publié: (2025)
A Dual-Prompting for Interpretable Mental Health Language Models
par: Jeon, Hyolim, et autres
Publié: (2024)
par: Jeon, Hyolim, et autres
Publié: (2024)
CIC: A Framework for Culturally-Aware Image Captioning
par: Yun, Youngsik, et autres
Publié: (2024)
par: Yun, Youngsik, et autres
Publié: (2024)
BatchGEMBA: Token-Efficient Machine Translation Evaluation with Batched Prompting and Prompt Compression
par: Larionov, Daniil, et autres
Publié: (2025)
par: Larionov, Daniil, et autres
Publié: (2025)
Evaluating Prompt Engineering Techniques for Accuracy and Confidence Elicitation in Medical LLMs
par: Naderi, Nariman, et autres
Publié: (2025)
par: Naderi, Nariman, et autres
Publié: (2025)
Incorporating Token Usage into Prompting Strategy Evaluation
par: Sypherd, Chris, et autres
Publié: (2025)
par: Sypherd, Chris, et autres
Publié: (2025)
Role-playing Prompt Framework: Generation and Evaluation
par: Liu, Xun, et autres
Publié: (2024)
par: Liu, Xun, et autres
Publié: (2024)
Prompt Engineering: How Prompt Vocabulary affects Domain Knowledge
par: Schreiter, Dimitri
Publié: (2025)
par: Schreiter, Dimitri
Publié: (2025)
The Future of MLLM Prompting is Adaptive: A Comprehensive Experimental Evaluation of Prompt Engineering Methods for Robust Multimodal Performance
par: Mohanty, Anwesha, et autres
Publié: (2025)
par: Mohanty, Anwesha, et autres
Publié: (2025)
A Chain-of-Thought Prompting Approach with LLMs for Evaluating Students' Formative Assessment Responses in Science
par: Cohn, Clayton, et autres
Publié: (2024)
par: Cohn, Clayton, et autres
Publié: (2024)
KZ-SafetyPrompts: A Kazakh Safety Evaluation Prompt Dataset for Large Language Models
par: Zaghouani, Wajdi, et autres
Publié: (2026)
par: Zaghouani, Wajdi, et autres
Publié: (2026)
LLM Prompt Evaluation for Educational Applications
par: Holmes, Langdon, et autres
Publié: (2026)
par: Holmes, Langdon, et autres
Publié: (2026)
Who Evaluates the Evaluations? Objectively Scoring Text-to-Image Prompt Coherence Metrics with T2IScoreScore (TS2)
par: Saxon, Michael, et autres
Publié: (2024)
par: Saxon, Michael, et autres
Publié: (2024)
Can Prompts Rewind Time for LLMs? Evaluating the Effectiveness of Prompted Knowledge Cutoffs
par: Gao, Xin, et autres
Publié: (2025)
par: Gao, Xin, et autres
Publié: (2025)
Prompt Injection Detection is Regime-Dependent: A Deployment-Aware Evaluation with Interpretable Structural Signals
par: Akinrele, Akindoyin, et autres
Publié: (2026)
par: Akinrele, Akindoyin, et autres
Publié: (2026)
An Evaluation of Large Language Models on Text Summarization Tasks Using Prompt Engineering Techniques
par: Aly, Walid Mohamed, et autres
Publié: (2025)
par: Aly, Walid Mohamed, et autres
Publié: (2025)
Evaluating Prompt Engineering Techniques for RAG in Small Language Models: A Multi-Hop QA Approach
par: Mohammadi, Amir Hossein, et autres
Publié: (2026)
par: Mohammadi, Amir Hossein, et autres
Publié: (2026)
Documents similaires
-
VisDoT : Enhancing Visual Reasoning through Human-Like Interpretation Grounding and Decomposition of Thought
par: Lee, Eunsoo, et autres
Publié: (2026) -
NormGenesis: Multicultural Dialogue Generation via Exemplar-Guided Social Norm Modeling and Violation Recovery
par: Hong, Minki, et autres
Publié: (2025) -
Evaluating Consistencies in LLM responses through a Semantic Clustering of Question Answering
par: Lee, Yanggyu, et autres
Publié: (2024) -
Improving LLM Classification of Logical Errors by Integrating Error Relationship into Prompts
par: Lee, Yanggyu, et autres
Publié: (2024) -
PromptOptMe: Error-Aware Prompt Compression for LLM-based MT Evaluation Metrics
par: Larionov, Daniil, et autres
Publié: (2024)