Prompt-to-Leaderboard
Fuente:
arXiv
Guardado en:
| Autores principales: | Frick, Evan, Chen, Connor, Tennyson, Joseph, Li, Tianle, Chiang, Wei-Lin, Angelopoulos, Anastasios N., Stoica, Ion |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
How to Evaluate Reward Models for RLHF
por: Frick, Evan, et al.
Publicado: (2024)
por: Frick, Evan, et al.
Publicado: (2024)
From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline
por: Li, Tianle, et al.
Publicado: (2024)
por: Li, Tianle, et al.
Publicado: (2024)
Search Arena: Analyzing Search-Augmented LLMs
por: Miroyan, Mihran, et al.
Publicado: (2025)
por: Miroyan, Mihran, et al.
Publicado: (2025)
Exploring and Mitigating Adversarial Manipulation of Voting-Based Leaderboards
por: Huang, Yangsibo, et al.
Publicado: (2025)
por: Huang, Yangsibo, et al.
Publicado: (2025)
RouteLLM: Learning to Route LLMs with Preference Data
por: Ong, Isaac, et al.
Publicado: (2024)
por: Ong, Isaac, et al.
Publicado: (2024)
Break the Sequential Dependency of LLM Inference Using Lookahead Decoding
por: Fu, Yichao, et al.
Publicado: (2024)
por: Fu, Yichao, et al.
Publicado: (2024)
Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference
por: Chiang, Wei-Lin, et al.
Publicado: (2024)
por: Chiang, Wei-Lin, et al.
Publicado: (2024)
Post-Training Sparse Attention with Double Sparsity
por: Yang, Shuo, et al.
Publicado: (2024)
por: Yang, Shuo, et al.
Publicado: (2024)
The Leaderboard Illusion
por: Singh, Shivalika, et al.
Publicado: (2025)
por: Singh, Shivalika, et al.
Publicado: (2025)
Combee: Scaling Prompt Learning for Self-Improving Language Model Agents
por: Li, Hanchen, et al.
Publicado: (2026)
por: Li, Hanchen, et al.
Publicado: (2026)
AutoEval Done Right: Using Synthetic Data for Model Evaluation
por: Boyeau, Pierre, et al.
Publicado: (2024)
por: Boyeau, Pierre, et al.
Publicado: (2024)
Twilight: Adaptive Attention Sparsity with Hierarchical Top-$p$ Pruning
por: Lin, Chaofan, et al.
Publicado: (2025)
por: Lin, Chaofan, et al.
Publicado: (2025)
BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation
por: Zhu, Alan, et al.
Publicado: (2025)
por: Zhu, Alan, et al.
Publicado: (2025)
R2E-Gym: Procedural Environments and Hybrid Verifiers for Scaling Open-Weights SWE Agents
por: Jain, Naman, et al.
Publicado: (2025)
por: Jain, Naman, et al.
Publicado: (2025)
Textual Gradients are a Flawed Metaphor for Automatic Prompt Optimization
por: Melcer, Daniel, et al.
Publicado: (2025)
por: Melcer, Daniel, et al.
Publicado: (2025)
When Benchmarks are Targets: Revealing the Sensitivity of Large Language Model Leaderboards
por: Alzahrani, Norah, et al.
Publicado: (2024)
por: Alzahrani, Norah, et al.
Publicado: (2024)
Semantic Prompt Learning for Weakly-Supervised Semantic Segmentation
por: Lin, Ci-Siang, et al.
Publicado: (2024)
por: Lin, Ci-Siang, et al.
Publicado: (2024)
Online Speculative Decoding
por: Liu, Xiaoxuan, et al.
Publicado: (2023)
por: Liu, Xiaoxuan, et al.
Publicado: (2023)
LOTUS: A Leaderboard for Detailed Image Captioning from Quality to Societal Bias and User Preferences
por: Hirota, Yusuke, et al.
Publicado: (2025)
por: Hirota, Yusuke, et al.
Publicado: (2025)
Prompting Large Language Models for Clinical Temporal Relation Extraction
por: He, Jianping, et al.
Publicado: (2024)
por: He, Jianping, et al.
Publicado: (2024)
Efficiently Scaling LLM Reasoning with Certaindex
por: Fu, Yichao, et al.
Publicado: (2024)
por: Fu, Yichao, et al.
Publicado: (2024)
Conformal Risk Control for Non-Monotonic Losses
por: Angelopoulos, Anastasios N.
Publicado: (2026)
por: Angelopoulos, Anastasios N.
Publicado: (2026)
GSO: Challenging Software Optimization Tasks for Evaluating SWE-Agents
por: Shetty, Manish, et al.
Publicado: (2025)
por: Shetty, Manish, et al.
Publicado: (2025)
LLMs Meet Finance: Fine-Tuning Foundation Models for the Open FinLLM Leaderboard
por: Rao, Varun, et al.
Publicado: (2025)
por: Rao, Varun, et al.
Publicado: (2025)
The Growing Pains of Frontier Models: When Leaderboards Stop Separating and What to Measure Next
por: Amin, Adil
Publicado: (2026)
por: Amin, Adil
Publicado: (2026)
Specifications: The missing link to making the development of LLM systems an engineering discipline
por: Stoica, Ion, et al.
Publicado: (2024)
por: Stoica, Ion, et al.
Publicado: (2024)
Stylus: Automatic Adapter Selection for Diffusion Models
por: Luo, Michael, et al.
Publicado: (2024)
por: Luo, Michael, et al.
Publicado: (2024)
OR-Bench: An Over-Refusal Benchmark for Large Language Models
por: Cui, Justin, et al.
Publicado: (2024)
por: Cui, Justin, et al.
Publicado: (2024)
The Price Reversal Phenomenon: When Cheaper Reasoning Models Cost More
por: Chen, Lingjiao, et al.
Publicado: (2026)
por: Chen, Lingjiao, et al.
Publicado: (2026)
Beyond the Leaderboard: Rethinking Medical Benchmarks for Large Language Models
por: Chen, Wenting, et al.
Publicado: (2025)
por: Chen, Wenting, et al.
Publicado: (2025)
Optimizing Model Selection for Compound AI Systems
por: Chen, Lingjiao, et al.
Publicado: (2025)
por: Chen, Lingjiao, et al.
Publicado: (2025)
Are More LLM Calls All You Need? Towards Scaling Laws of Compound Inference Systems
por: Chen, Lingjiao, et al.
Publicado: (2024)
por: Chen, Lingjiao, et al.
Publicado: (2024)
Top Leaderboard Ranking = Top Coding Proficiency, Always? EvoEval: Evolving Coding Benchmarks via LLM
por: Xia, Chunqiu Steven, et al.
Publicado: (2024)
por: Xia, Chunqiu Steven, et al.
Publicado: (2024)
$\texttt{SPECS}$: Faster Test-Time Scaling through Speculative Drafts
por: Cemri, Mert, et al.
Publicado: (2025)
por: Cemri, Mert, et al.
Publicado: (2025)
Linear Dynamics in the RLVR Training of Large Language Models
por: Wang, Tianle, et al.
Publicado: (2026)
por: Wang, Tianle, et al.
Publicado: (2026)
JudgeBench: A Benchmark for Evaluating LLM-based Judges
por: Tan, Sijun, et al.
Publicado: (2024)
por: Tan, Sijun, et al.
Publicado: (2024)
xKV: Cross-Layer KV-Cache Compression via Aligned Singular Vector Extraction
por: Chang, Chi-Chih, et al.
Publicado: (2025)
por: Chang, Chi-Chih, et al.
Publicado: (2025)
Mélange: Cost Efficient Large Language Model Serving by Exploiting GPU Heterogeneity
por: Griggs, Tyler, et al.
Publicado: (2024)
por: Griggs, Tyler, et al.
Publicado: (2024)
LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code
por: Jain, Naman, et al.
Publicado: (2024)
por: Jain, Naman, et al.
Publicado: (2024)
Question-Aware Knowledge Graph Prompting for Enhancing Large Language Models
por: Liu, Haochen, et al.
Publicado: (2025)
por: Liu, Haochen, et al.
Publicado: (2025)
Ejemplares similares
-
How to Evaluate Reward Models for RLHF
por: Frick, Evan, et al.
Publicado: (2024) -
From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline
por: Li, Tianle, et al.
Publicado: (2024) -
Search Arena: Analyzing Search-Augmented LLMs
por: Miroyan, Mihran, et al.
Publicado: (2025) -
Exploring and Mitigating Adversarial Manipulation of Voting-Based Leaderboards
por: Huang, Yangsibo, et al.
Publicado: (2025) -
RouteLLM: Learning to Route LLMs with Preference Data
por: Ong, Isaac, et al.
Publicado: (2024)