Don't Pass@k: A Bayesian Framework for Large Language Model Evaluation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hariri, Mohsen, Samandar, Amirhossein, Hinczewski, Michael, Chaudhary, Vipin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Scorio.jl: A Julia package for ranking stochastic responses
par: Hariri, Mohsen, et autres
Publié: (2026)
par: Hariri, Mohsen, et autres
Publié: (2026)
Ranking Reasoning LLMs under Test-Time Scaling
par: Hariri, Mohsen, et autres
Publié: (2026)
par: Hariri, Mohsen, et autres
Publié: (2026)
A Statistical Hypothesis Testing Framework for Data Misappropriation Detection in Large Language Models
par: Cai, Yinpeng, et autres
Publié: (2025)
par: Cai, Yinpeng, et autres
Publié: (2025)
Foundations of Top-$k$ Decoding For Language Models
par: Noarov, Georgy, et autres
Publié: (2025)
par: Noarov, Georgy, et autres
Publié: (2025)
Reject, Resample, Repeat: Understanding Parallel Reasoning in Language Model Inference
par: Golowich, Noah, et autres
Publié: (2026)
par: Golowich, Noah, et autres
Publié: (2026)
Large Language Models Must Be Taught to Know What They Don't Know
par: Kapoor, Sanyam, et autres
Publié: (2024)
par: Kapoor, Sanyam, et autres
Publié: (2024)
RACER: Risk-Aware Calibrated Efficient Routing for Large Language Models
par: Hao, Sai, et autres
Publié: (2026)
par: Hao, Sai, et autres
Publié: (2026)
Is a Good Foundation Necessary for Efficient Reinforcement Learning? The Computational Role of the Base Model in Exploration
par: Foster, Dylan J., et autres
Publié: (2025)
par: Foster, Dylan J., et autres
Publié: (2025)
Bayesian Mixture-of-Experts: Towards Making LLMs Know What They Don't Know
par: Li, Albus Yizhuo
Publié: (2025)
par: Li, Albus Yizhuo
Publié: (2025)
Towards Bayesian Data Selection
par: Rodemann, Julian
Publié: (2024)
par: Rodemann, Julian
Publié: (2024)
A Comparative Study of DSPy Teleprompter Algorithms for Aligning Large Language Models Evaluation Metrics to Human Evaluation
par: Sarmah, Bhaskarjit, et autres
Publié: (2024)
par: Sarmah, Bhaskarjit, et autres
Publié: (2024)
Counterfactual reasoning: an analysis of in-context emergence
par: Miller, Moritz, et autres
Publié: (2025)
par: Miller, Moritz, et autres
Publié: (2025)
Transformers as Decision Makers: Provable In-Context Reinforcement Learning via Supervised Pretraining
par: Lin, Licong, et autres
Publié: (2023)
par: Lin, Licong, et autres
Publié: (2023)
Towards Efficient Online Exploration for Reinforcement Learning with Human Feedback
par: Li, Gen, et autres
Publié: (2025)
par: Li, Gen, et autres
Publié: (2025)
The Coverage Principle: How Pre-Training Enables Post-Training
par: Chen, Fan, et autres
Publié: (2025)
par: Chen, Fan, et autres
Publié: (2025)
Reasoning with Sampling: Cutting at Decision Points
par: Zhou, Felix, et autres
Publié: (2026)
par: Zhou, Felix, et autres
Publié: (2026)
Unveiling the Statistical Foundations of Chain-of-Thought Prompting Methods
par: Hu, Xinyang, et autres
Publié: (2024)
par: Hu, Xinyang, et autres
Publié: (2024)
Phase Transitions in the Output Distribution of Large Language Models
par: Arnold, Julian, et autres
Publié: (2024)
par: Arnold, Julian, et autres
Publié: (2024)
Reasoning Models Don't Always Say What They Think
par: Chen, Yanda, et autres
Publié: (2025)
par: Chen, Yanda, et autres
Publié: (2025)
Revisiting Padded Transformer Expressivity: Which Architectural Choices Matter and Which Don't
par: Svete, Anej, et autres
Publié: (2026)
par: Svete, Anej, et autres
Publié: (2026)
A Survey on Large Language Model-based Agents for Statistics and Data Science
par: Sun, Maojun, et autres
Publié: (2024)
par: Sun, Maojun, et autres
Publié: (2024)
MESSY Estimation: Maximum-Entropy based Stochastic and Symbolic densitY Estimation
par: Tohme, Tony, et autres
Publié: (2023)
par: Tohme, Tony, et autres
Publié: (2023)
LIBRA: Language Model Informed Bandit Recourse Algorithm for Personalized Treatment Planning
par: Cao, Junyu, et autres
Publié: (2026)
par: Cao, Junyu, et autres
Publié: (2026)
Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models
par: Chen, Zhipeng, et autres
Publié: (2025)
par: Chen, Zhipeng, et autres
Publié: (2025)
PassNet: Scaling Large Language Models for Graph Compiler Pass Generation
par: Liu, Yiqun, et autres
Publié: (2026)
par: Liu, Yiqun, et autres
Publié: (2026)
LLM Cyber Evaluations Don't Capture Real-World Risk
par: Lukošiūtė, Kamilė, et autres
Publié: (2025)
par: Lukošiūtė, Kamilė, et autres
Publié: (2025)
Attention Mechanisms Don't Learn Additive Models: Rethinking Feature Importance for Transformers
par: Leemann, Tobias, et autres
Publié: (2024)
par: Leemann, Tobias, et autres
Publié: (2024)
L$^2$M: Mutual Information Scaling Law for Long-Context Language Modeling
par: Chen, Zhuo, et autres
Publié: (2025)
par: Chen, Zhuo, et autres
Publié: (2025)
A Computational Theory for Efficient Mini Agent Evaluation with Causal Guarantees
par: Yan, Hedong
Publié: (2025)
par: Yan, Hedong
Publié: (2025)
You Don't Need Prompt Engineering Anymore: The Prompting Inversion
par: Khan, Imran
Publié: (2025)
par: Khan, Imran
Publié: (2025)
Don't Trust: Verify -- Grounding LLM Quantitative Reasoning with Autoformalization
par: Zhou, Jin Peng, et autres
Publié: (2024)
par: Zhou, Jin Peng, et autres
Publié: (2024)
Beyond Demand Estimation: Consumer Surplus Evaluation via Cumulative Propensity Weights
par: Bian, Zeyu, et autres
Publié: (2026)
par: Bian, Zeyu, et autres
Publié: (2026)
Don't Shoot The Breeze: Topic Continuity Model Using Nonlinear Naive Bayes With Attention
par: Pi, Shu-Ting, et autres
Publié: (2026)
par: Pi, Shu-Ting, et autres
Publié: (2026)
In-Context Environments Induce Evaluation-Awareness in Language Models
par: Chaudhary, Maheep
Publié: (2026)
par: Chaudhary, Maheep
Publié: (2026)
Perturbative adaptive importance sampling for Bayesian LOO cross-validation
par: Chang, Joshua C, et autres
Publié: (2024)
par: Chang, Joshua C, et autres
Publié: (2024)
Retrieval-Augmented Generation as Noisy In-Context Learning: A Unified Theory and Risk Bounds
par: Guo, Yang, et autres
Publié: (2025)
par: Guo, Yang, et autres
Publié: (2025)
On the Statistical Capacity of Deep Generative Models
par: Tam, Edric, et autres
Publié: (2025)
par: Tam, Edric, et autres
Publié: (2025)
On the Provable Performance Guarantee of Efficient Reasoning Models
par: Zeng, Hao, et autres
Publié: (2025)
par: Zeng, Hao, et autres
Publié: (2025)
Counterfactual Generative Modeling with Variational Causal Inference
par: Wu, Yulun, et autres
Publié: (2024)
par: Wu, Yulun, et autres
Publié: (2024)
Evaluating LLMs When They Do Not Know the Answer: Statistical Evaluation of Mathematical Reasoning via Comparative Signals
par: Dong, Zihan, et autres
Publié: (2026)
par: Dong, Zihan, et autres
Publié: (2026)
Documents similaires
-
Scorio.jl: A Julia package for ranking stochastic responses
par: Hariri, Mohsen, et autres
Publié: (2026) -
Ranking Reasoning LLMs under Test-Time Scaling
par: Hariri, Mohsen, et autres
Publié: (2026) -
A Statistical Hypothesis Testing Framework for Data Misappropriation Detection in Large Language Models
par: Cai, Yinpeng, et autres
Publié: (2025) -
Foundations of Top-$k$ Decoding For Language Models
par: Noarov, Georgy, et autres
Publié: (2025) -
Reject, Resample, Repeat: Understanding Parallel Reasoning in Language Model Inference
par: Golowich, Noah, et autres
Publié: (2026)