Statistical multi-metric evaluation and visualization of LLM system predictive performance
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ackerman, Samuel, Farchi, Eitan, Raz, Orna, Toledo, Assaf |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Using Combinatorial Optimization to Design a High quality LLM Solution
par: Ackerman, Samuel, et autres
Publié: (2024)
par: Ackerman, Samuel, et autres
Publié: (2024)
A Novel Metric for Measuring the Robustness of Large Language Models in Non-adversarial Scenarios
par: Ackerman, Samuel, et autres
Publié: (2024)
par: Ackerman, Samuel, et autres
Publié: (2024)
Detecting LLM-Generated Text with Performance Guarantees
par: Zhou, Hongyi, et autres
Publié: (2026)
par: Zhou, Hongyi, et autres
Publié: (2026)
A meta-analysis on the performance of machine-learning based language models for sentiment analysis
par: Rohde, Elena, et autres
Publié: (2025)
par: Rohde, Elena, et autres
Publié: (2025)
How to Correctly Report LLM-as-a-Judge Evaluations
par: Lee, Chungpa, et autres
Publié: (2025)
par: Lee, Chungpa, et autres
Publié: (2025)
Context-Alignment: Activating and Enhancing LLM Capabilities in Time Series
par: Hu, Yuxiao, et autres
Publié: (2025)
par: Hu, Yuxiao, et autres
Publié: (2025)
Online Reasoning Calibration: Test-Time Training Enables Generalizable Conformal LLM Reasoning
par: Zhou, Cai, et autres
Publié: (2026)
par: Zhou, Cai, et autres
Publié: (2026)
Classification errors distort findings in automated speech processing: examples and solutions from child-development research
par: Gautheron, Lucas, et autres
Publié: (2025)
par: Gautheron, Lucas, et autres
Publié: (2025)
Subjective Perspectives within Learned Representations Predict High-Impact Innovation
par: Cao, Likun, et autres
Publié: (2025)
par: Cao, Likun, et autres
Publié: (2025)
Advanced Crash Causation Analysis for Freeway Safety: A Large Language Model Approach to Identifying Key Contributing Factors
par: Abdelrahman, Ahmed S., et autres
Publié: (2025)
par: Abdelrahman, Ahmed S., et autres
Publié: (2025)
Ensemble Kalman filter for uncertainty in human language comprehension
par: Bhandari, Diksha, et autres
Publié: (2025)
par: Bhandari, Diksha, et autres
Publié: (2025)
Bayesian Evaluation of Large Language Model Behavior
par: Longjohn, Rachel, et autres
Publié: (2025)
par: Longjohn, Rachel, et autres
Publié: (2025)
Extracting Emotion Phrases from Tweets using BART
par: Rezapour, Mahdi
Publié: (2024)
par: Rezapour, Mahdi
Publié: (2024)
The Proxy Presumption: From Semantic Embeddings to Valid Social Measures
par: Li, Baishi, et autres
Publié: (2026)
par: Li, Baishi, et autres
Publié: (2026)
Dynamic Topic Language Model on Heterogeneous Children's Mental Health Clinical Notes
par: Ye, Hanwen, et autres
Publié: (2023)
par: Ye, Hanwen, et autres
Publié: (2023)
Specific language impairment (SLI) detection pipeline from transcriptions of spontaneous narratives
par: Arena, Santiago, et autres
Publié: (2024)
par: Arena, Santiago, et autres
Publié: (2024)
Causal Representation Learning with Generative Artificial Intelligence: Application to Texts as Treatments
par: Imai, Kosuke, et autres
Publié: (2024)
par: Imai, Kosuke, et autres
Publié: (2024)
Explainable Automatic Grading with Neural Additive Models
par: Condor, Aubrey, et autres
Publié: (2024)
par: Condor, Aubrey, et autres
Publié: (2024)
Deep literature reviews: an application of fine-tuned language models to migration research
par: Iacus, Stefano M., et autres
Publié: (2025)
par: Iacus, Stefano M., et autres
Publié: (2025)
A structured regression approach for evaluating model performance across intersectional subgroups
par: Herlihy, Christine, et autres
Publié: (2024)
par: Herlihy, Christine, et autres
Publié: (2024)
A Design-based Solution for Causal Inference with Text: Can a Language Model Be Too Large?
par: Tierney, Graham, et autres
Publié: (2025)
par: Tierney, Graham, et autres
Publié: (2025)
Deep R Programming
par: Gagolewski, Marek
Publié: (2022)
par: Gagolewski, Marek
Publié: (2022)
Predicting First Year Dropout from Pre Enrolment Motivation Statements Using Text Mining
par: Soppe, K. F. B., et autres
Publié: (2025)
par: Soppe, K. F. B., et autres
Publié: (2025)
SigBERT: Combining Narrative Medical Reports and Rough Path Signature Theory for Survival Risk Estimation in Oncology
par: Minchella, Paul, et autres
Publié: (2025)
par: Minchella, Paul, et autres
Publié: (2025)
Dhoroni: Exploring Bengali Climate Change and Environmental Views with a Multi-Perspective News Dataset and Natural Language Processing
par: Wasi, Azmine Toushik, et autres
Publié: (2024)
par: Wasi, Azmine Toushik, et autres
Publié: (2024)
CFTM: Continuous time fractional topic model
par: Nakagawa, Kei, et autres
Publié: (2024)
par: Nakagawa, Kei, et autres
Publié: (2024)
Catalysts of Conversation: Examining Interaction Dynamics Between Topic Initiators and Commentors in Alzheimer's Disease Online Communities
par: Ni, Congning, et autres
Publié: (2024)
par: Ni, Congning, et autres
Publié: (2024)
Using Twitter Data to Understand Public Perceptions of Approved versus Off-label Use for COVID-19-related Medications
par: Hua, Yining, et autres
Publié: (2022)
par: Hua, Yining, et autres
Publié: (2022)
Statistical Multicriteria Evaluation of LLM-Generated Text
par: Arias, Esteban Garces, et autres
Publié: (2025)
par: Arias, Esteban Garces, et autres
Publié: (2025)
On metric choice in dimension reduction for Fréchet regression
par: Soale, Abdul-Nasah, et autres
Publié: (2024)
par: Soale, Abdul-Nasah, et autres
Publié: (2024)
Beyond the Hype: Embeddings vs. Prompting for Multiclass Classification Tasks
par: Kokkodis, Marios, et autres
Publié: (2025)
par: Kokkodis, Marios, et autres
Publié: (2025)
ICE-ID: A Novel Historical Census Dataset for Longitudinal Identity Resolution
par: de Carvalho, Gonçalo Hora, et autres
Publié: (2025)
par: de Carvalho, Gonçalo Hora, et autres
Publié: (2025)
Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints
par: Chittepu, Yaswanth, et autres
Publié: (2025)
par: Chittepu, Yaswanth, et autres
Publié: (2025)
Domain-Shift-Aware Conformal Prediction for Large Language Models
par: Lin, Zhexiao, et autres
Publié: (2025)
par: Lin, Zhexiao, et autres
Publié: (2025)
Reliable and Efficient Amortized Model-based Evaluation
par: Truong, Sang, et autres
Publié: (2025)
par: Truong, Sang, et autres
Publié: (2025)
Uncertainty-Aware Adaptation of Large Language Models for Protein-Protein Interaction Analysis
par: Jantre, Sanket, et autres
Publié: (2025)
par: Jantre, Sanket, et autres
Publié: (2025)
Beyond Words: How Large Language Models Perform in Quantitative Management Problem-Solving
par: Kuzmanko, Jonathan
Publié: (2025)
par: Kuzmanko, Jonathan
Publié: (2025)
How to Choose a Threshold for an Evaluation Metric for Large Language Models
par: Sarmah, Bhaskarjit, et autres
Publié: (2024)
par: Sarmah, Bhaskarjit, et autres
Publié: (2024)
Unified Representation of Genomic and Biomedical Concepts through Multi-Task, Multi-Source Contrastive Learning
par: Yuan, Hongyi, et autres
Publié: (2024)
par: Yuan, Hongyi, et autres
Publié: (2024)
HybridRAG: Integrating Knowledge Graphs and Vector Retrieval Augmented Generation for Efficient Information Extraction
par: Sarmah, Bhaskarjit, et autres
Publié: (2024)
par: Sarmah, Bhaskarjit, et autres
Publié: (2024)
Documents similaires
-
Using Combinatorial Optimization to Design a High quality LLM Solution
par: Ackerman, Samuel, et autres
Publié: (2024) -
A Novel Metric for Measuring the Robustness of Large Language Models in Non-adversarial Scenarios
par: Ackerman, Samuel, et autres
Publié: (2024) -
Detecting LLM-Generated Text with Performance Guarantees
par: Zhou, Hongyi, et autres
Publié: (2026) -
A meta-analysis on the performance of machine-learning based language models for sentiment analysis
par: Rohde, Elena, et autres
Publié: (2025) -
How to Correctly Report LLM-as-a-Judge Evaluations
par: Lee, Chungpa, et autres
Publié: (2025)