ScoringBench: A Benchmark for Evaluating Tabular Foundation Models with Proper Scoring Rules
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Landsgesell, Jonas, Knoll, Pascal, Wenzel, Tizian |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Distributional Regression with Tabular Foundation Models: Evaluating Probabilistic Predictions via Proper Scoring Rules
par: Landsgesell, Jonas, et autres
Publié: (2026)
par: Landsgesell, Jonas, et autres
Publié: (2026)
Joint Optimization of Neural Autoregressors via Scoring rules
par: Landsgesell, Jonas
Publié: (2026)
par: Landsgesell, Jonas
Publié: (2026)
Proper Scoring Rules for Agentic Uncertainty Quantification
par: Raghu, Suresh, et autres
Publié: (2026)
par: Raghu, Suresh, et autres
Publié: (2026)
Teaching Models To Survive: Proper Scoring Rule and Stochastic Optimization with Competing Risks
par: Alberge, Julie, et autres
Publié: (2024)
par: Alberge, Julie, et autres
Publié: (2024)
Survival Models: Proper Scoring Rule and Stochastic Optimization with Competing Risks
par: Alberge, Julie, et autres
Publié: (2024)
par: Alberge, Julie, et autres
Publié: (2024)
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models
par: Lai, Peichao, et autres
Publié: (2025)
par: Lai, Peichao, et autres
Publié: (2025)
Musical Score Understanding Benchmark: Evaluating Large Language Models' Comprehension of Complete Musical Scores
par: Dai, Congren, et autres
Publié: (2025)
par: Dai, Congren, et autres
Publié: (2025)
On Training Survival Models with Scoring Rules
par: Kopper, Philipp, et autres
Publié: (2024)
par: Kopper, Philipp, et autres
Publié: (2024)
Models That Know How Evaluations Are Designed Score Safer
par: Deckenbach, Katharina, et autres
Publié: (2026)
par: Deckenbach, Katharina, et autres
Publié: (2026)
Tabular Foundation Models Can Learn Association Rules
par: Karabulut, Erkan, et autres
Publié: (2026)
par: Karabulut, Erkan, et autres
Publié: (2026)
Abductive and Contrastive Explanations for Scoring Rules in Voting
par: Contet, Clément, et autres
Publié: (2024)
par: Contet, Clément, et autres
Publié: (2024)
EEG-Bench: A Benchmark for EEG Foundation Models in Clinical Applications
par: Kastrati, Ard, et autres
Publié: (2025)
par: Kastrati, Ard, et autres
Publié: (2025)
Aligned Textual Scoring Rules
par: Lu, Yuxuan, et autres
Publié: (2025)
par: Lu, Yuxuan, et autres
Publié: (2025)
RECSIP: REpeated Clustering of Scores Improving the Precision
par: Schamschurko, André, et autres
Publié: (2025)
par: Schamschurko, André, et autres
Publié: (2025)
Evaluating Austrian A-Level German Essays with Large Language Models for Automated Essay Scoring
par: Kubesch, Jonas, et autres
Publié: (2026)
par: Kubesch, Jonas, et autres
Publié: (2026)
Kurtosis-Guided Denoising Score Matching for Tabular Anomaly Detection
par: Livernoche, Victor, et autres
Publié: (2026)
par: Livernoche, Victor, et autres
Publié: (2026)
TabAttackBench: A Benchmark for Adversarial Attacks on Tabular Data
par: He, Zhipeng, et autres
Publié: (2025)
par: He, Zhipeng, et autres
Publié: (2025)
WorldScore: A Unified Evaluation Benchmark for World Generation
par: Duan, Haoyi, et autres
Publié: (2025)
par: Duan, Haoyi, et autres
Publié: (2025)
Can Agent Benchmarks Support Their Scores? Evidence-Supported Bounds for Interactive-Agent Evaluation
par: Gao, Shanshan, et autres
Publié: (2026)
par: Gao, Shanshan, et autres
Publié: (2026)
VeriEquivBench: An Equivalence Score for Ground-Truth-Free Evaluation of Formally Verifiable Code
par: Zeng, Lingfei, et autres
Publié: (2025)
par: Zeng, Lingfei, et autres
Publié: (2025)
LegalScore: Development of a Benchmark for Evaluating AI Models in Legal Career Exams in Brazil
par: Caparroz, Roberto, et autres
Publié: (2025)
par: Caparroz, Roberto, et autres
Publié: (2025)
Robust Tabular Foundation Models
par: Peroni, Matthew, et autres
Publié: (2025)
par: Peroni, Matthew, et autres
Publié: (2025)
Staging by the Book: Automatic Sleep Stage Classification Using Scoring Rules
par: Hardarson, Emil, et autres
Publié: (2026)
par: Hardarson, Emil, et autres
Publié: (2026)
Mars-Bench: A Benchmark for Evaluating Foundation Models for Mars Science Tasks
par: Purohit, Mirali, et autres
Publié: (2025)
par: Purohit, Mirali, et autres
Publié: (2025)
Proper Scoring Rules and Domination
par: Pruss, Alexander
Publié: (2021)
par: Pruss, Alexander
Publié: (2021)
When Tabular Foundation Models Meet Strategic Tabular Data: A Prior Alignment Approach
par: Lv, Xinpeng, et autres
Publié: (2026)
par: Lv, Xinpeng, et autres
Publié: (2026)
IsoBench: Benchmarking Multimodal Foundation Models on Isomorphic Representations
par: Fu, Deqing, et autres
Publié: (2024)
par: Fu, Deqing, et autres
Publié: (2024)
EEG-FM-Bench: A Comprehensive Benchmark for the Systematic Evaluation of EEG Foundation Models
par: Xiong, Wei, et autres
Publié: (2025)
par: Xiong, Wei, et autres
Publié: (2025)
Ran Score: a LLM-based Evaluation Score for Radiology Report Generation
par: Zhang, Ran, et autres
Publié: (2026)
par: Zhang, Ran, et autres
Publié: (2026)
Improving Score Reliability of Multiple Choice Benchmarks with Consistency Evaluation and Altered Answer Choices
par: Cavalin, Paulo, et autres
Publié: (2025)
par: Cavalin, Paulo, et autres
Publié: (2025)
OmniTabBench: Mapping the Empirical Frontiers of GBDTs, Neural Networks, and Foundation Models for Tabular Data at Scale
par: Jiang, Dihong, et autres
Publié: (2026)
par: Jiang, Dihong, et autres
Publié: (2026)
VT-Bench: A Unified Benchmark for Visual-Tabular Multi-Modal Learning
par: Jia, Zi-Yi, et autres
Publié: (2026)
par: Jia, Zi-Yi, et autres
Publié: (2026)
Rank-Then-Score: Enhancing Large Language Models for Automated Essay Scoring
par: Cai, Yida, et autres
Publié: (2025)
par: Cai, Yida, et autres
Publié: (2025)
FedAD-Bench: A Unified Benchmark for Federated Unsupervised Anomaly Detection in Tabular Data
par: Anwar, Ahmed, et autres
Publié: (2024)
par: Anwar, Ahmed, et autres
Publié: (2024)
TrustSQL: Benchmarking Text-to-SQL Reliability with Penalty-Based Scoring
par: Lee, Gyubok, et autres
Publié: (2024)
par: Lee, Gyubok, et autres
Publié: (2024)
From SHAP Scores to Feature Importance Scores
par: Letoffe, Olivier, et autres
Publié: (2024)
par: Letoffe, Olivier, et autres
Publié: (2024)
CALM: A Causal Analysis Language Model for Tabular Data in Complex Systems with Local Scores, Conditional Independence Tests, and Relation Attributes
par: Fan, Zhenjiang, et autres
Publié: (2025)
par: Fan, Zhenjiang, et autres
Publié: (2025)
Light-Weight Benchmarks Reveal the Hidden Hardware Cost of Zero-Shot Tabular Foundation Models
par: Gangwani, Ishaan, et autres
Publié: (2025)
par: Gangwani, Ishaan, et autres
Publié: (2025)
PredictaBoard: Benchmarking LLM Score Predictability
par: Pacchiardi, Lorenzo, et autres
Publié: (2025)
par: Pacchiardi, Lorenzo, et autres
Publié: (2025)
Robust Layerwise Scaling Rules by Proper Weight Decay Tuning
par: Fan, Zhiyuan, et autres
Publié: (2025)
par: Fan, Zhiyuan, et autres
Publié: (2025)
Documents similaires
-
Distributional Regression with Tabular Foundation Models: Evaluating Probabilistic Predictions via Proper Scoring Rules
par: Landsgesell, Jonas, et autres
Publié: (2026) -
Joint Optimization of Neural Autoregressors via Scoring rules
par: Landsgesell, Jonas
Publié: (2026) -
Proper Scoring Rules for Agentic Uncertainty Quantification
par: Raghu, Suresh, et autres
Publié: (2026) -
Teaching Models To Survive: Proper Scoring Rule and Stochastic Optimization with Competing Risks
par: Alberge, Julie, et autres
Publié: (2024) -
Survival Models: Proper Scoring Rule and Stochastic Optimization with Competing Risks
par: Alberge, Julie, et autres
Publié: (2024)