How Benchmark Prediction from Fewer Data Misses the Mark
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Guanhua, Dorner, Florian E., Hardt, Moritz |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Don't Label Twice: Quantity Beats Quality when Comparing Binary Classifiers on a Budget
par: Dorner, Florian E., et autres
Publié: (2024)
par: Dorner, Florian E., et autres
Publié: (2024)
Inherent Trade-Offs between Diversity and Stability in Multi-Task Benchmarks
par: Zhang, Guanhua, et autres
Publié: (2024)
par: Zhang, Guanhua, et autres
Publié: (2024)
Limits to scalable evaluation at the frontier: LLM as Judge won't beat twice the data
par: Dorner, Florian E., et autres
Publié: (2024)
par: Dorner, Florian E., et autres
Publié: (2024)
Training on the Test Task Confounds Evaluation and Emergence
par: Dominguez-Olmedo, Ricardo, et autres
Publié: (2024)
par: Dominguez-Olmedo, Ricardo, et autres
Publié: (2024)
Leaderboard Incentives: Model Rankings under Strategic Post-Training
par: Chen, Yatong, et autres
Publié: (2026)
par: Chen, Yatong, et autres
Publié: (2026)
Train-before-Test Harmonizes Language Model Rankings
par: Zhang, Guanhua, et autres
Publié: (2025)
par: Zhang, Guanhua, et autres
Publié: (2025)
Performative Prediction: Past and Future
par: Hardt, Moritz, et autres
Publié: (2023)
par: Hardt, Moritz, et autres
Publié: (2023)
Good Allocations from Bad Estimates
par: Casacuberta, Sílvia, et autres
Publié: (2026)
par: Casacuberta, Sílvia, et autres
Publié: (2026)
Allocation Requires Prediction Only if Inequality Is Low
par: Shirali, Ali, et autres
Publié: (2024)
par: Shirali, Ali, et autres
Publié: (2024)
Test-Time Training on Nearest Neighbors for Large Language Models
par: Hardt, Moritz, et autres
Publié: (2023)
par: Hardt, Moritz, et autres
Publié: (2023)
Do causal predictors generalize better to new domains?
par: Nastl, Vivian Y., et autres
Publié: (2024)
par: Nastl, Vivian Y., et autres
Publié: (2024)
Is your model predicting the past?
par: Hardt, Moritz, et autres
Publié: (2022)
par: Hardt, Moritz, et autres
Publié: (2022)
ROC-n-reroll: How verifier imperfection affects test-time scaling
par: Dorner, Florian E., et autres
Publié: (2025)
par: Dorner, Florian E., et autres
Publié: (2025)
What Makes ImageNet Look Unlike LAION
par: Shirali, Ali, et autres
Publié: (2023)
par: Shirali, Ali, et autres
Publié: (2023)
ImageNot: A contrast with ImageNet preserves model rankings
par: Salaudeen, Olawale, et autres
Publié: (2024)
par: Salaudeen, Olawale, et autres
Publié: (2024)
Limits to Predicting Online Speech Using Large Language Models
par: Remeli, Mina, et autres
Publié: (2024)
par: Remeli, Mina, et autres
Publié: (2024)
Unprocessing Seven Years of Algorithmic Fairness
par: Cruz, André F., et autres
Publié: (2023)
par: Cruz, André F., et autres
Publié: (2023)
Scaling Open-Ended Reasoning to Predict the Future
par: Chandak, Nikhil, et autres
Publié: (2025)
par: Chandak, Nikhil, et autres
Publié: (2025)
Computational Arbitrage in AI Model Markets
par: Olmedo, Ricardo, et autres
Publié: (2026)
par: Olmedo, Ricardo, et autres
Publié: (2026)
Adaptive Optimization for Prediction with Missing Data
par: Bertsimas, Dimitris, et autres
Publié: (2024)
par: Bertsimas, Dimitris, et autres
Publié: (2024)
Pedestrian Trajectory Prediction with Missing Data: Datasets, Imputation, and Benchmarking
par: Chib, Pranav Singh, et autres
Publié: (2024)
par: Chib, Pranav Singh, et autres
Publié: (2024)
Large Language Models Miss the Multi-Agent Mark
par: La Malfa, Emanuele, et autres
Publié: (2025)
par: La Malfa, Emanuele, et autres
Publié: (2025)
Utilizing Autoregressive Networks for Full Lifecycle Data Generation of Rolling Bearings for RUL Prediction
par: Wang, Junliang, et autres
Publié: (2024)
par: Wang, Junliang, et autres
Publié: (2024)
Evaluating language models as risk scores
par: Cruz, André F., et autres
Publié: (2024)
par: Cruz, André F., et autres
Publié: (2024)
Guarantees for Nonlinear Representation Learning: Non-identical Covariates, Dependent Data, Fewer Samples
par: Zhang, Thomas T., et autres
Publié: (2024)
par: Zhang, Thomas T., et autres
Publié: (2024)
Causal Discovery with Fewer Conditional Independence Tests
par: Shiragur, Kirankumar, et autres
Publié: (2024)
par: Shiragur, Kirankumar, et autres
Publié: (2024)
Fewer May Be Better: Enhancing Offline Reinforcement Learning with Reduced Dataset
par: Yang, Yiqin, et autres
Publié: (2025)
par: Yang, Yiqin, et autres
Publié: (2025)
Uncertainty-aware Traffic Prediction under Missing Data
par: Mei, Hao, et autres
Publié: (2023)
par: Mei, Hao, et autres
Publié: (2023)
Fewer is More: A Deep Graph Metric Learning Perspective Using Fewer Proxies
par: Zhu, Yuehua, et autres
Publié: (2020)
par: Zhu, Yuehua, et autres
Publié: (2020)
Longitudinal Missing Data Imputation for Predicting Disability Stage of Patients with Multiple Sclerosis
par: Vazifehdan, Mahin, et autres
Publié: (2025)
par: Vazifehdan, Mahin, et autres
Publié: (2025)
Incentivizing Honesty among Competitors in Collaborative Learning and Optimization
par: Dorner, Florian E., et autres
Publié: (2023)
par: Dorner, Florian E., et autres
Publié: (2023)
Algorithmic Collective Action in Machine Learning
par: Hardt, Moritz, et autres
Publié: (2023)
par: Hardt, Moritz, et autres
Publié: (2023)
A Proposed Paradigm for Imputing Missing Multi-Sensor Data in the Healthcare Domain
par: Gupta, Vaibhav, et autres
Publié: (2026)
par: Gupta, Vaibhav, et autres
Publié: (2026)
Less is More: Convergence Benefits of Fewer Data Weight Updates over Longer Horizon
par: Das, Rudrajit, et autres
Publié: (2026)
par: Das, Rudrajit, et autres
Publié: (2026)
Latent Diffusion for Missing Data
par: Estad, Alberte Heering, et autres
Publié: (2026)
par: Estad, Alberte Heering, et autres
Publié: (2026)
Privacy Amplification by Missing Data
par: Roburin, Simon, et autres
Publié: (2026)
par: Roburin, Simon, et autres
Publié: (2026)
Learning on the Job: Test-Time Curricula for Targeted Reinforcement Learning
par: Hübotter, Jonas, et autres
Publié: (2025)
par: Hübotter, Jonas, et autres
Publié: (2025)
Simple Imputation Rules for Prediction with Missing Data: Contrasting Theoretical Guarantees with Empirical Performance
par: Bertsimas, Dimitris, et autres
Publié: (2021)
par: Bertsimas, Dimitris, et autres
Publié: (2021)
Adam-mini: Use Fewer Learning Rates To Gain More
par: Zhang, Yushun, et autres
Publié: (2024)
par: Zhang, Yushun, et autres
Publié: (2024)
Fewer Truncations Improve Language Modeling
par: Ding, Hantian, et autres
Publié: (2024)
par: Ding, Hantian, et autres
Publié: (2024)
Documents similaires
-
Don't Label Twice: Quantity Beats Quality when Comparing Binary Classifiers on a Budget
par: Dorner, Florian E., et autres
Publié: (2024) -
Inherent Trade-Offs between Diversity and Stability in Multi-Task Benchmarks
par: Zhang, Guanhua, et autres
Publié: (2024) -
Limits to scalable evaluation at the frontier: LLM as Judge won't beat twice the data
par: Dorner, Florian E., et autres
Publié: (2024) -
Training on the Test Task Confounds Evaluation and Emergence
par: Dominguez-Olmedo, Ricardo, et autres
Publié: (2024) -
Leaderboard Incentives: Model Rankings under Strategic Post-Training
par: Chen, Yatong, et autres
Publié: (2026)