ROC-n-reroll: How verifier imperfection affects test-time scaling
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Dorner, Florian E., Chen, Yatong, Cruz, André F., Yang, Fanny |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
How Benchmark Prediction from Fewer Data Misses the Mark
par: Zhang, Guanhua, et autres
Publié: (2025)
par: Zhang, Guanhua, et autres
Publié: (2025)
Don't Label Twice: Quantity Beats Quality when Comparing Binary Classifiers on a Budget
par: Dorner, Florian E., et autres
Publié: (2024)
par: Dorner, Florian E., et autres
Publié: (2024)
Conditional Prediction ROC Bands for Graph Classification
par: Wu, Yujia, et autres
Publié: (2024)
par: Wu, Yujia, et autres
Publié: (2024)
Multiclass ROC
par: Wang, Liang, et autres
Publié: (2024)
par: Wang, Liang, et autres
Publié: (2024)
Limits to scalable evaluation at the frontier: LLM as Judge won't beat twice the data
par: Dorner, Florian E., et autres
Publié: (2024)
par: Dorner, Florian E., et autres
Publié: (2024)
SubROC: AUC-Based Discovery of Exceptional Subgroup Performance for Binary Classifiers
par: Siegl, Tom, et autres
Publié: (2025)
par: Siegl, Tom, et autres
Publié: (2025)
Knee or ROC
par: Wendt, Veronica, et autres
Publié: (2024)
par: Wendt, Veronica, et autres
Publié: (2024)
Strategic Hypothesis Testing
par: Hossain, Safwan, et autres
Publié: (2025)
par: Hossain, Safwan, et autres
Publié: (2025)
A Multiclass ROC Curve
par: Giudici, Paolo, et autres
Publié: (2025)
par: Giudici, Paolo, et autres
Publié: (2025)
Interactive proofs for verifying (quantum) learning and testing
par: Caro, Matthias C., et autres
Publié: (2024)
par: Caro, Matthias C., et autres
Publié: (2024)
Performative Prediction with Bandit Feedback: Learning through Reparameterization
par: Chen, Yatong, et autres
Publié: (2023)
par: Chen, Yatong, et autres
Publié: (2023)
Federated Computation of ROC and PR Curves
par: Xu, Xuefeng, et autres
Publié: (2025)
par: Xu, Xuefeng, et autres
Publié: (2025)
Training on the Test Task Confounds Evaluation and Emergence
par: Dominguez-Olmedo, Ricardo, et autres
Publié: (2024)
par: Dominguez-Olmedo, Ricardo, et autres
Publié: (2024)
FROC: Building Fair ROC from a Trained Classifier
par: Vummintala, Avyukta Manjunatha, et autres
Publié: (2024)
par: Vummintala, Avyukta Manjunatha, et autres
Publié: (2024)
Product distribution learning with imperfect advice
par: Bhattacharyya, Arnab, et autres
Publié: (2025)
par: Bhattacharyya, Arnab, et autres
Publié: (2025)
s1: Simple test-time scaling
par: Muennighoff, Niklas, et autres
Publié: (2025)
par: Muennighoff, Niklas, et autres
Publié: (2025)
Scaling Up ROC-Optimizing Support Vector Machines
par: Bae, Gimun, et autres
Publié: (2025)
par: Bae, Gimun, et autres
Publié: (2025)
FACROC: a fairness measure for FAir Clustering through ROC curves
par: Quy, Tai Le, et autres
Publié: (2025)
par: Quy, Tai Le, et autres
Publié: (2025)
Learning Pareto manifolds in high dimensions: How can regularization help?
par: Wegel, Tobias, et autres
Publié: (2025)
par: Wegel, Tobias, et autres
Publié: (2025)
Incentivizing Honesty among Competitors in Collaborative Learning and Optimization
par: Dorner, Florian E., et autres
Publié: (2023)
par: Dorner, Florian E., et autres
Publié: (2023)
Artificial intelligence for methane detection: from continuous monitoring to verified mitigation
par: Mateo-Garcia, Gonzalo, et autres
Publié: (2025)
par: Mateo-Garcia, Gonzalo, et autres
Publié: (2025)
To Give or Not to Give? The Impacts of Strategically Withheld Recourse
par: Chen, Yatong, et autres
Publié: (2025)
par: Chen, Yatong, et autres
Publié: (2025)
Leaderboard Incentives: Model Rankings under Strategic Post-Training
par: Chen, Yatong, et autres
Publié: (2026)
par: Chen, Yatong, et autres
Publié: (2026)
Area under the ROC Curve has the Most Consistent Evaluation for Binary Classification
par: Li, Jing
Publié: (2024)
par: Li, Jing
Publié: (2024)
Thought calibration: Efficient and confident test-time scaling
par: Wu, Menghua, et autres
Publié: (2025)
par: Wu, Menghua, et autres
Publié: (2025)
Predicting Blood Type: Assessing Model Performance with ROC Analysis
par: Altayar, Malik A., et autres
Publié: (2025)
par: Altayar, Malik A., et autres
Publié: (2025)
Towards a unified and verified understanding of group-operation networks
par: Wu, Wilson, et autres
Publié: (2024)
par: Wu, Wilson, et autres
Publié: (2024)
Interval-Based AUC (iAUC): Extending ROC Analysis to Uncertainty-Aware Classification
par: Li, Yuqi, et autres
Publié: (2026)
par: Li, Yuqi, et autres
Publié: (2026)
Tournament Leave-pair-out Cross-validation for Receiver Operating Characteristic (ROC) Analysis
par: Perez, Ileana Montoya, et autres
Publié: (2018)
par: Perez, Ileana Montoya, et autres
Publié: (2018)
What should post-training optimize? A test-time scaling law perspective
par: Li, Muheng, et autres
Publié: (2026)
par: Li, Muheng, et autres
Publié: (2026)
Delay, Plateau, or Collapse: Evaluating the Impact of Systematic Verification Error on RLVR
par: Egashira, Kazuki, et autres
Publié: (2026)
par: Egashira, Kazuki, et autres
Publié: (2026)
Whose Preferences? Differences in Fairness Preferences and Their Impact on the Fairness of AI Utilizing Human Feedback
par: Lerner, Emilia Agis, et autres
Publié: (2024)
par: Lerner, Emilia Agis, et autres
Publié: (2024)
Efficient line search for optimizing Area Under the ROC Curve in gradient descent
par: Fowler, Jadon, et autres
Publié: (2024)
par: Fowler, Jadon, et autres
Publié: (2024)
How does over-squashing affect the power of GNNs?
par: Di Giovanni, Francesco, et autres
Publié: (2023)
par: Di Giovanni, Francesco, et autres
Publié: (2023)
Imitating from auxiliary imperfect demonstrations via Adversarial Density Weighted Regression
par: Zhang, Ziqi, et autres
Publié: (2024)
par: Zhang, Ziqi, et autres
Publié: (2024)
Connections between reinforcement learning with feedback,test-time scaling, and diffusion guidance: An anthology
par: Jiao, Yuchen, et autres
Publié: (2025)
par: Jiao, Yuchen, et autres
Publié: (2025)
LIME: Link-based user-item Interaction Modeling with decoupled xor attention for Efficient test time scaling
par: Jiang, Yunjiang, et autres
Publié: (2025)
par: Jiang, Yunjiang, et autres
Publié: (2025)
Learning multivariate Gaussians with imperfect advice
par: Bhattacharyya, Arnab, et autres
Publié: (2024)
par: Bhattacharyya, Arnab, et autres
Publié: (2024)
Online bipartite matching with imperfect advice
par: Choo, Davin, et autres
Publié: (2024)
par: Choo, Davin, et autres
Publié: (2024)
Collapsing ROC approach for risk prediction research on both common and rare variants
par: Wei, Changshuai, et autres
Publié: (2025)
par: Wei, Changshuai, et autres
Publié: (2025)
Documents similaires
-
How Benchmark Prediction from Fewer Data Misses the Mark
par: Zhang, Guanhua, et autres
Publié: (2025) -
Don't Label Twice: Quantity Beats Quality when Comparing Binary Classifiers on a Budget
par: Dorner, Florian E., et autres
Publié: (2024) -
Conditional Prediction ROC Bands for Graph Classification
par: Wu, Yujia, et autres
Publié: (2024) -
Multiclass ROC
par: Wang, Liang, et autres
Publié: (2024) -
Limits to scalable evaluation at the frontier: LLM as Judge won't beat twice the data
par: Dorner, Florian E., et autres
Publié: (2024)