Shrinking the Generation-Verification Gap with Weak Verifiers
Fuente:
arXiv
Salvato in:
| Autori principali: | Saad-Falcon, Jon, Buchanan, E. Kelly, Chen, Mayee F., Huang, Tzu-Heng, McLaughlin, Brendan, Bhathal, Tanvir, Zhu, Shang, Athiwaratkun, Ben, Sala, Frederic, Linderman, Scott, Mirhoseini, Azalia, Ré, Christopher |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
TRACE: Capability-Targeted Agentic Training
di: Kang, Hangoo, et al.
Pubblicazione: (2026)
di: Kang, Hangoo, et al.
Pubblicazione: (2026)
Archon: An Architecture Search Framework for Inference-Time Techniques
di: Saad-Falcon, Jon, et al.
Pubblicazione: (2024)
di: Saad-Falcon, Jon, et al.
Pubblicazione: (2024)
OpenJarvis: Personal AI, On Personal Devices
di: Saad-Falcon, Jon, et al.
Pubblicazione: (2026)
di: Saad-Falcon, Jon, et al.
Pubblicazione: (2026)
WebSight: A Vision-First Architecture for Robust Web Agents
di: Bhathal, Tanvir, et al.
Pubblicazione: (2025)
di: Bhathal, Tanvir, et al.
Pubblicazione: (2025)
EmissionNet: Air Quality Pollution Forecasting for Agriculture
di: Saligram, Prady, et al.
Pubblicazione: (2025)
di: Saligram, Prady, et al.
Pubblicazione: (2025)
On the Role of Temperature Sampling in Test-Time Scaling
di: Wu, Yuheng, et al.
Pubblicazione: (2025)
di: Wu, Yuheng, et al.
Pubblicazione: (2025)
That Chip Has Sailed: A Critique of Unfounded Skepticism Around AI for Chip Design
di: Goldie, Anna, et al.
Pubblicazione: (2024)
di: Goldie, Anna, et al.
Pubblicazione: (2024)
CodeMonkeys: Scaling Test-Time Compute for Software Engineering
di: Ehrlich, Ryan, et al.
Pubblicazione: (2025)
di: Ehrlich, Ryan, et al.
Pubblicazione: (2025)
2048: Reinforcement Learning in a Delayed Reward Environment
di: Saligram, Prady, et al.
Pubblicazione: (2025)
di: Saligram, Prady, et al.
Pubblicazione: (2025)
Hydragen: High-Throughput LLM Inference with Shared Prefixes
di: Juravsky, Jordan, et al.
Pubblicazione: (2024)
di: Juravsky, Jordan, et al.
Pubblicazione: (2024)
Think, Prune, Train, Improve: Scaling Reasoning without Scaling Models
di: Costello, Caia, et al.
Pubblicazione: (2025)
di: Costello, Caia, et al.
Pubblicazione: (2025)
Time To Impeach LLM-as-a-Judge: Programs are the Future of Evaluation
di: Huang, Tzu-Heng, et al.
Pubblicazione: (2025)
di: Huang, Tzu-Heng, et al.
Pubblicazione: (2025)
ScriptoriumWS: A Code Generation Assistant for Weak Supervision
di: Huang, Tzu-Heng, et al.
Pubblicazione: (2025)
di: Huang, Tzu-Heng, et al.
Pubblicazione: (2025)
Scaling Verification Can Be More Effective than Scaling Policy Learning for Vision-Language-Action Alignment
di: Kwok, Jacky, et al.
Pubblicazione: (2026)
di: Kwok, Jacky, et al.
Pubblicazione: (2026)
Large Language Monkeys: Scaling Inference Compute with Repeated Sampling
di: Brown, Bradley, et al.
Pubblicazione: (2024)
di: Brown, Bradley, et al.
Pubblicazione: (2024)
KernelBench: Can LLMs Write Efficient GPU Kernels?
di: Ouyang, Anne, et al.
Pubblicazione: (2025)
di: Ouyang, Anne, et al.
Pubblicazione: (2025)
Think Deep, Think Fast: Investigating Efficiency of Verifier-free Inference-time-scaling Methods
di: Wang, Junlin, et al.
Pubblicazione: (2025)
di: Wang, Junlin, et al.
Pubblicazione: (2025)
Federation of Experts: Communication Efficient Distributed Inference for Large Language Models
di: Abdurrahman, Muhammad Shahir, et al.
Pubblicazione: (2026)
di: Abdurrahman, Muhammad Shahir, et al.
Pubblicazione: (2026)
ForTIFAI: Fending Off Recursive Training Induced Failure for AI Model Collapse
di: Shabgahi, Soheil Zibakhsh, et al.
Pubblicazione: (2025)
di: Shabgahi, Soheil Zibakhsh, et al.
Pubblicazione: (2025)
Agent JIT Compilation for Latency-Optimizing Web Agent Planning and Scheduling
di: Winston, Caleb, et al.
Pubblicazione: (2026)
di: Winston, Caleb, et al.
Pubblicazione: (2026)
RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models
di: Kwok, Jacky, et al.
Pubblicazione: (2025)
di: Kwok, Jacky, et al.
Pubblicazione: (2025)
Stellar astrophysics
di: Bhathal, Ragbir S
Pubblicazione: (2009)
di: Bhathal, Ragbir S
Pubblicazione: (2009)
The War Correspondent - Second Edition
di: McLaughlin, Greg
Pubblicazione: (2016)
di: McLaughlin, Greg
Pubblicazione: (2016)
Edge of Catastrophe: Erich Fromm, Fascism, and the HolocaustBy Roger Frie, Oxford University Press, 2024. 216 pp. $35 (cloth). ISBN: 9780197748770.
di: Neil McLaughlin
Pubblicazione: (2025)
di: Neil McLaughlin
Pubblicazione: (2025)
Priority Projects: Constituent Spending Demand and the Benefits of Congressional Credit Claiming
di: Peter T. McLaughlin
Pubblicazione: (2025)
di: Peter T. McLaughlin
Pubblicazione: (2025)
La era de Klein / Patricia McLaughlin
di: McLaughlin, Patricia
di: McLaughlin, Patricia
Using Play‐Doh to teach creative data collection
di: Sarah McLaughlin
Pubblicazione: (2024)
di: Sarah McLaughlin
Pubblicazione: (2024)
Visionaries and Crackpots, Maniacs and Saints: Existential Risk and the Politics of Longtermism
di: Alex McLaughlin
Pubblicazione: (2025)
di: Alex McLaughlin
Pubblicazione: (2025)
Kids, Kulture, and Us
di: McLaughlin, Frank
Pubblicazione: (1972)
di: McLaughlin, Frank
Pubblicazione: (1972)
Managing Computer Software Collections. ERIC Digest.
di: McLaughlin, Pamela
Pubblicazione: (1984)
di: McLaughlin, Pamela
Pubblicazione: (1984)
Media Specialists and the Curriculum: A Selected ERIC Bibliography.
di: McLaughlin, Pamela
Pubblicazione: (1985)
di: McLaughlin, Pamela
Pubblicazione: (1985)
Mind the Gap: Detecting Black-box Adversarial Attacks in the Making through Query Update Analysis
di: Park, Jeonghwan, et al.
Pubblicazione: (2025)
di: Park, Jeonghwan, et al.
Pubblicazione: (2025)
The ALCHEmist: Automated Labeling 500x CHEaper Than LLM Data Annotators
di: Huang, Tzu-Heng, et al.
Pubblicazione: (2024)
di: Huang, Tzu-Heng, et al.
Pubblicazione: (2024)
Cookbook: A framework for improving LLM generative abilities via programmatic data generating templates
di: Narayan, Avanika, et al.
Pubblicazione: (2024)
di: Narayan, Avanika, et al.
Pubblicazione: (2024)
Synthetic Data Generation & Multi-Step RL for Reasoning & Tool Use
di: Goldie, Anna, et al.
Pubblicazione: (2025)
di: Goldie, Anna, et al.
Pubblicazione: (2025)
CHESS: Contextual Harnessing for Efficient SQL Synthesis
di: Talaei, Shayan, et al.
Pubblicazione: (2024)
di: Talaei, Shayan, et al.
Pubblicazione: (2024)
CATS: Contextually-Aware Thresholding for Sparsity in Large Language Models
di: Lee, Donghyun, et al.
Pubblicazione: (2024)
di: Lee, Donghyun, et al.
Pubblicazione: (2024)
Benchmarking and Building Long-Context Retrieval Models with LoCo and M2-BERT
di: Saad-Falcon, Jon, et al.
Pubblicazione: (2024)
di: Saad-Falcon, Jon, et al.
Pubblicazione: (2024)
Mind the (Collaborative) Gap: How the Public Symbolically Rewards and Punishes Policy Actors for Their Collaborative Choices
di: Jack Mewhirter, et al.
Pubblicazione: (2025)
di: Jack Mewhirter, et al.
Pubblicazione: (2025)
Test-Time Scaling Makes Overtraining Compute-Optimal
di: Roberts, Nicholas, et al.
Pubblicazione: (2026)
di: Roberts, Nicholas, et al.
Pubblicazione: (2026)
Documenti analoghi
-
TRACE: Capability-Targeted Agentic Training
di: Kang, Hangoo, et al.
Pubblicazione: (2026) -
Archon: An Architecture Search Framework for Inference-Time Techniques
di: Saad-Falcon, Jon, et al.
Pubblicazione: (2024) -
OpenJarvis: Personal AI, On Personal Devices
di: Saad-Falcon, Jon, et al.
Pubblicazione: (2026) -
WebSight: A Vision-First Architecture for Robust Web Agents
di: Bhathal, Tanvir, et al.
Pubblicazione: (2025) -
EmissionNet: Air Quality Pollution Forecasting for Agriculture
di: Saligram, Prady, et al.
Pubblicazione: (2025)