Towards Reliable LLM Evaluation: Correcting the Winner's Curse in Adaptive Benchmarking
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xu, Yang, Zhang, Jiefu, Sun, Haixiang, Zhou, Zihan, Cao, Tianyu, Aggarwal, Vaneet |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Don't Freeze, Don't Crash: Extending the Safe Operating Range of Neural Navigation in Dense Crowds
par: Zhang, Jiefu, et autres
Publié: (2026)
par: Zhang, Jiefu, et autres
Publié: (2026)
Core-Halo Decomposition: Decentralizing Large-Scale Fixed-Point Problems
par: Haixiang, et autres
Publié: (2026)
par: Haixiang, et autres
Publié: (2026)
Reliable and Efficient Amortized Model-based Evaluation
par: Truong, Sang, et autres
Publié: (2025)
par: Truong, Sang, et autres
Publié: (2025)
Robust Generalization with Adaptive Optimal Transport Priors for Decision-Focused Learning
par: Sun, Haixiang, et autres
Publié: (2026)
par: Sun, Haixiang, et autres
Publié: (2026)
Accelerating Quantum Reinforcement Learning with a Quantum Natural Policy Gradient Based Approach
par: Xu, Yang, et autres
Publié: (2025)
par: Xu, Yang, et autres
Publié: (2025)
E-valuator: Reliable Agent Verifiers with Sequential Hypothesis Testing
par: Sadhuka, Shuvom, et autres
Publié: (2025)
par: Sadhuka, Shuvom, et autres
Publié: (2025)
Conditional diffusions for amortized neural posterior estimation
par: Chen, Tianyu, et autres
Publié: (2024)
par: Chen, Tianyu, et autres
Publié: (2024)
When Softmax Fails at the Top: Extreme Value Corrections for InfoNCE
par: Erol, Melihcan, et autres
Publié: (2026)
par: Erol, Melihcan, et autres
Publié: (2026)
A More Realistic Evaluation of Cross-Frequency Transfer Learning and Foundation Forecasting Models
par: Olivares, Kin G., et autres
Publié: (2025)
par: Olivares, Kin G., et autres
Publié: (2025)
Cross-variable Linear Integrated ENhanced Transformer for Photovoltaic power forecasting
par: Gao, Jiaxin, et autres
Publié: (2024)
par: Gao, Jiaxin, et autres
Publié: (2024)
Efficient $Q$-Learning and Actor-Critic Methods for Robust Average Reward Reinforcement Learning
par: Xu, Yang, et autres
Publié: (2025)
par: Xu, Yang, et autres
Publié: (2025)
Breaking the Winner's Curse with Bayesian Hybrid Shrinkage
par: Mudd, Richard, et autres
Publié: (2025)
par: Mudd, Richard, et autres
Publié: (2025)
iSCAN: Identifying Causal Mechanism Shifts among Nonlinear Additive Noise Models
par: Chen, Tianyu, et autres
Publié: (2023)
par: Chen, Tianyu, et autres
Publié: (2023)
Efficient Causal Structure Learning via Modular Subgraph Integration
par: Sun, Haixiang, et autres
Publié: (2026)
par: Sun, Haixiang, et autres
Publié: (2026)
Bridging Performance Gaps for ECG Foundation Models: A Post-Training Strategy
par: Zhou, Ya, et autres
Publié: (2025)
par: Zhou, Ya, et autres
Publié: (2025)
Prune 'n Predict: Optimizing LLM Decision-making with Conformal Prediction
par: Vishwakarma, Harit, et autres
Publié: (2024)
par: Vishwakarma, Harit, et autres
Publié: (2024)
Auto-Regressive Moving Diffusion Models for Time Series Forecasting
par: Gao, Jiaxin, et autres
Publié: (2024)
par: Gao, Jiaxin, et autres
Publié: (2024)
Scalable Stewardship of an LLM-Assisted Clinical Benchmark with Physician Oversight
par: Ye, Junze, et autres
Publié: (2025)
par: Ye, Junze, et autres
Publié: (2025)
Toward Reducing Unproductive Container Moves: Predicting Service Requirements and Dwell Times
par: Villalobos, Elena, et autres
Publié: (2026)
par: Villalobos, Elena, et autres
Publié: (2026)
Wafer-Level Etch Spatial Profiling for Process Monitoring from Time-Series with Time-LLM
par: Kim, Hyunwoo, et autres
Publié: (2026)
par: Kim, Hyunwoo, et autres
Publié: (2026)
Sample Complexity Analysis for Constrained Bilevel Reinforcement Learning
par: Saxena, Naman, et autres
Publié: (2026)
par: Saxena, Naman, et autres
Publié: (2026)
Multi-scale Masked Autoencoder for Electrocardiogram Anomaly Detection
par: Zhou, Ya, et autres
Publié: (2025)
par: Zhou, Ya, et autres
Publié: (2025)
Latency-Response Theory Model: Evaluating Large Language Models via Response Accuracy and Chain-of-Thought Length
par: Xu, Zhiyu, et autres
Publié: (2025)
par: Xu, Zhiyu, et autres
Publié: (2025)
Detecting Structural Heart Disease from Electrocardiograms via a Generalized Additive Model of Interpretable Foundation-Model Predictors
par: Zhou, Ya, et autres
Publié: (2026)
par: Zhou, Ya, et autres
Publié: (2026)
SureMap: Simultaneous Mean Estimation for Single-Task and Multi-Task Disaggregated Evaluation
par: Khodak, Mikhail, et autres
Publié: (2024)
par: Khodak, Mikhail, et autres
Publié: (2024)
Quantum Speedups in Regret Analysis of Infinite Horizon Average-Reward Markov Decision Processes
par: Ganguly, Bhargav, et autres
Publié: (2023)
par: Ganguly, Bhargav, et autres
Publié: (2023)
CVTN: Cross Variable and Temporal Integration for Time Series Forecasting
par: Zhou, Han, et autres
Publié: (2024)
par: Zhou, Han, et autres
Publié: (2024)
KMM-CP: Practical Conformal Prediction under Covariate Shift via Selective Kernel Mean Matching
par: Laghuvarapu, Siddhartha, et autres
Publié: (2026)
par: Laghuvarapu, Siddhartha, et autres
Publié: (2026)
FreDF: Learning to Forecast in the Frequency Domain
par: Wang, Hao, et autres
Publié: (2024)
par: Wang, Hao, et autres
Publié: (2024)
On the Practice of Deep Hierarchical Ensemble Network for Ad Conversion Rate Prediction
par: Zhuang, Jinfeng, et autres
Publié: (2025)
par: Zhuang, Jinfeng, et autres
Publié: (2025)
Curious Causality-Seeking Agents Learn Meta Causal World
par: Zhao, Zhiyu, et autres
Publié: (2025)
par: Zhao, Zhiyu, et autres
Publié: (2025)
Cross-Domain Energy-Guided Diffusion Generation for Off-Dynamics Reinforcement Learning
par: Yang, Yu, et autres
Publié: (2026)
par: Yang, Yu, et autres
Publié: (2026)
Enhancing Uplift Modeling in Multi-Treatment Marketing Campaigns: Leveraging Score Ranking and Calibration Techniques
par: Park, Yoon Tae, et autres
Publié: (2024)
par: Park, Yoon Tae, et autres
Publié: (2024)
Scale-Translation Equivariant Network for Oceanic Internal Solitary Wave Localization
par: Wan, Zhang, et autres
Publié: (2024)
par: Wan, Zhang, et autres
Publié: (2024)
Robustness is Important: Limitations of LLMs for Data Fitting
par: Liu, Hejia, et autres
Publié: (2025)
par: Liu, Hejia, et autres
Publié: (2025)
Bridging the Data Gap in AI Reliability Research and Establishing DR-AIR, a Comprehensive Data Repository for AI Reliability
par: Zheng, Simin, et autres
Publié: (2025)
par: Zheng, Simin, et autres
Publié: (2025)
Online Reasoning Calibration: Test-Time Training Enables Generalizable Conformal LLM Reasoning
par: Zhou, Cai, et autres
Publié: (2026)
par: Zhou, Cai, et autres
Publié: (2026)
Feature Group Tabular Transformer: A Novel Approach to Traffic Crash Modeling and Causality Analysis
par: Lares, Oscar, et autres
Publié: (2024)
par: Lares, Oscar, et autres
Publié: (2024)
Sample-Efficient Constrained Reinforcement Learning with General Parameterization
par: Mondal, Washim Uddin, et autres
Publié: (2024)
par: Mondal, Washim Uddin, et autres
Publié: (2024)
Last-Iterate Convergence of General Parameterized Policies in Constrained MDPs
par: Mondal, Washim Uddin, et autres
Publié: (2024)
par: Mondal, Washim Uddin, et autres
Publié: (2024)
Documents similaires
-
Don't Freeze, Don't Crash: Extending the Safe Operating Range of Neural Navigation in Dense Crowds
par: Zhang, Jiefu, et autres
Publié: (2026) -
Core-Halo Decomposition: Decentralizing Large-Scale Fixed-Point Problems
par: Haixiang, et autres
Publié: (2026) -
Reliable and Efficient Amortized Model-based Evaluation
par: Truong, Sang, et autres
Publié: (2025) -
Robust Generalization with Adaptive Optimal Transport Priors for Decision-Focused Learning
par: Sun, Haixiang, et autres
Publié: (2026) -
Accelerating Quantum Reinforcement Learning with a Quantum Natural Policy Gradient Based Approach
par: Xu, Yang, et autres
Publié: (2025)