EvalSense: A Framework for Domain-Specific LLM (Meta-)Evaluation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Dejl, Adam, Pearson, Jonathan |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ArgLLM-App: An Interactive System for Argumentative Reasoning with Large Language Models
par: Dejl, Adam, et autres
Publié: (2026)
par: Dejl, Adam, et autres
Publié: (2026)
Identifying Query-Relevant Neurons in Large Language Models for Long-Form Texts
par: Chen, Lihu, et autres
Publié: (2024)
par: Chen, Lihu, et autres
Publié: (2024)
LalaEval: A Holistic Human Evaluation Framework for Domain-Specific Large Language Models
par: Sun, Chongyan, et autres
Publié: (2024)
par: Sun, Chongyan, et autres
Publié: (2024)
Argumentation for Explainable and Globally Contestable Decision Support with LLMs
par: Dejl, Adam, et autres
Publié: (2026)
par: Dejl, Adam, et autres
Publié: (2026)
Comprehensiveness Metrics for Automatic Evaluation of Factual Recall in Text Generation
par: Dejl, Adam, et autres
Publié: (2025)
par: Dejl, Adam, et autres
Publié: (2025)
MM-Eval: A Multilingual Meta-Evaluation Benchmark for LLM-as-a-Judge and Reward Models
par: Son, Guijin, et autres
Publié: (2024)
par: Son, Guijin, et autres
Publié: (2024)
SpecEval: Evaluating Model Adherence to Behavior Specifications
par: Ahmed, Ahmed, et autres
Publié: (2025)
par: Ahmed, Ahmed, et autres
Publié: (2025)
SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation
par: Petrukha, Ivan, et autres
Publié: (2025)
par: Petrukha, Ivan, et autres
Publié: (2025)
HintEval: A Comprehensive Framework for Hint Generation and Evaluation for Questions
par: Mozafari, Jamshid, et autres
Publié: (2025)
par: Mozafari, Jamshid, et autres
Publié: (2025)
Evaluating Uncertainty Quantification Methods in Argumentative Large Language Models
par: Zhou, Kevin, et autres
Publié: (2025)
par: Zhou, Kevin, et autres
Publié: (2025)
FinEval-KR: A Financial Domain Evaluation Framework for Large Language Models' Knowledge and Reasoning
par: Dou, Shaoyu, et autres
Publié: (2025)
par: Dou, Shaoyu, et autres
Publié: (2025)
EVE: A Domain-Specific LLM Framework for Earth Intelligence
par: Atrio, Àlex R., et autres
Publié: (2026)
par: Atrio, Àlex R., et autres
Publié: (2026)
OpenHuEval: Evaluating Large Language Model on Hungarian Specifics
par: Yang, Haote, et autres
Publié: (2025)
par: Yang, Haote, et autres
Publié: (2025)
ConCodeEval: Evaluating Large Language Models for Code Constraints in Domain-Specific Languages
par: Kammakomati, Mehant, et autres
Publié: (2024)
par: Kammakomati, Mehant, et autres
Publié: (2024)
Soda-Eval: Open-Domain Dialogue Evaluation in the age of LLMs
par: Mendonça, John, et autres
Publié: (2024)
par: Mendonça, John, et autres
Publié: (2024)
RepEval: Effective Text Evaluation with LLM Representation
par: Sheng, Shuqian, et autres
Publié: (2024)
par: Sheng, Shuqian, et autres
Publié: (2024)
MT-PingEval: Evaluating Multi-Turn Collaboration with Private Information Games
par: Eisenstein, Jacob, et autres
Publié: (2026)
par: Eisenstein, Jacob, et autres
Publié: (2026)
GraphEval: A Knowledge-Graph Based LLM Hallucination Evaluation Framework
par: Sansford, Hannah, et autres
Publié: (2024)
par: Sansford, Hannah, et autres
Publié: (2024)
OmniEval: An Omnidirectional and Automatic RAG Evaluation Benchmark in Financial Domain
par: Wang, Shuting, et autres
Publié: (2024)
par: Wang, Shuting, et autres
Publié: (2024)
MILE-RefHumEval: A Reference-Free, Multi-Independent LLM Framework for Human-Aligned Evaluation
par: Srun, Nalin, et autres
Publié: (2026)
par: Srun, Nalin, et autres
Publié: (2026)
Eval4Sim: An Evaluation Framework for Persona Simulation
par: Bao, Eliseo, et autres
Publié: (2026)
par: Bao, Eliseo, et autres
Publié: (2026)
BotEval: Facilitating Interactive Human Evaluation
par: Cho, Hyundong, et autres
Publié: (2024)
par: Cho, Hyundong, et autres
Publié: (2024)
One-Eval: An Agentic System for Automated and Traceable LLM Evaluation
par: Shen, Chengyu, et autres
Publié: (2026)
par: Shen, Chengyu, et autres
Publié: (2026)
DiagramEval: Evaluating LLM-Generated Diagrams via Graphs
par: Liang, Chumeng, et autres
Publié: (2025)
par: Liang, Chumeng, et autres
Publié: (2025)
SwanNLP at SemEval-2026 Task 5: An LLM-based Framework for Plausibility Scoring in Narrative Word Sense Disambiguation
par: Sumanathilaka, Deshan, et autres
Publié: (2026)
par: Sumanathilaka, Deshan, et autres
Publié: (2026)
ZeroSumEval: An Extensible Framework For Scaling LLM Evaluation with Inter-Model Competition
par: Alyahya, Hisham A., et autres
Publié: (2025)
par: Alyahya, Hisham A., et autres
Publié: (2025)
AutoEvoEval: An Automated Framework for Evolving Close-Ended LLM Evaluation Data
par: Wu, JiaRu, et autres
Publié: (2025)
par: Wu, JiaRu, et autres
Publié: (2025)
EvalCards: A Framework for Standardized Evaluation Reporting
par: Dhar, Ruchira, et autres
Publié: (2025)
par: Dhar, Ruchira, et autres
Publié: (2025)
AdaptEval: Evaluating Large Language Models on Domain Adaptation for Text Summarization
par: Afzal, Anum, et autres
Publié: (2024)
par: Afzal, Anum, et autres
Publié: (2024)
ReliableEval: A Recipe for Stochastic LLM Evaluation via Method of Moments
par: Lior, Gili, et autres
Publié: (2025)
par: Lior, Gili, et autres
Publié: (2025)
TruthEval: A Dataset to Evaluate LLM Truthfulness and Reliability
par: Khatun, Aisha, et autres
Publié: (2024)
par: Khatun, Aisha, et autres
Publié: (2024)
FeedEval: Pedagogically Aligned Evaluation of LLM-Generated Essay Feedback
par: Chu, Seongyeub, et autres
Publié: (2026)
par: Chu, Seongyeub, et autres
Publié: (2026)
RocketEval: Efficient Automated LLM Evaluation via Grading Checklist
par: Wei, Tianjun, et autres
Publié: (2025)
par: Wei, Tianjun, et autres
Publié: (2025)
AntEval: Evaluation of Social Interaction Competencies in LLM-Driven Agents
par: Liang, Yuanzhi, et autres
Publié: (2024)
par: Liang, Yuanzhi, et autres
Publié: (2024)
PersonaEval: Are LLM Evaluators Human Enough to Judge Role-Play?
par: Zhou, Lingfeng, et autres
Publié: (2025)
par: Zhou, Lingfeng, et autres
Publié: (2025)
CreativEval: Evaluating Creativity of LLM-Based Hardware Code Generation
par: DeLorenzo, Matthew, et autres
Publié: (2024)
par: DeLorenzo, Matthew, et autres
Publié: (2024)
SQLStructEval: Structural Evaluation of LLM Text-to-SQL Generation
par: Zhou, Yixi, et autres
Publié: (2026)
par: Zhou, Yixi, et autres
Publié: (2026)
FinEval: A Chinese Financial Domain Knowledge Evaluation Benchmark for Large Language Models
par: Guo, Xin, et autres
Publié: (2023)
par: Guo, Xin, et autres
Publié: (2023)
Vocabulary Customization for Efficient Domain-Specific LLM Deployment
par: Herold, Christian, et autres
Publié: (2025)
par: Herold, Christian, et autres
Publié: (2025)
SynthTextEval: Synthetic Text Data Generation and Evaluation for High-Stakes Domains
par: Ramesh, Krithika, et autres
Publié: (2025)
par: Ramesh, Krithika, et autres
Publié: (2025)
Documents similaires
-
ArgLLM-App: An Interactive System for Argumentative Reasoning with Large Language Models
par: Dejl, Adam, et autres
Publié: (2026) -
Identifying Query-Relevant Neurons in Large Language Models for Long-Form Texts
par: Chen, Lihu, et autres
Publié: (2024) -
LalaEval: A Holistic Human Evaluation Framework for Domain-Specific Large Language Models
par: Sun, Chongyan, et autres
Publié: (2024) -
Argumentation for Explainable and Globally Contestable Decision Support with LLMs
par: Dejl, Adam, et autres
Publié: (2026) -
Comprehensiveness Metrics for Automatic Evaluation of Factual Recall in Text Generation
par: Dejl, Adam, et autres
Publié: (2025)