Sketch-and-Verify: Structured Inference-Time Scaling via Program Sketching
Fuente:
arXiv
Salvato in:
| Autori principali: | Jiang, Shan, Yi, Zijian, Zhu, Chenguang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Semantic Voting: Execution-Grounded Consensus for LLM Code Generation
di: Jiang, Shan, et al.
Pubblicazione: (2026)
di: Jiang, Shan, et al.
Pubblicazione: (2026)
VeriScale: Adversarial Test-Suite Scaling for Verifiable Code Generation
di: Bai, Yifan, et al.
Pubblicazione: (2026)
di: Bai, Yifan, et al.
Pubblicazione: (2026)
VeriContest: A Competitive-Programming Benchmark for Verifiable Code Generation
di: Xie, Zichen, et al.
Pubblicazione: (2026)
di: Xie, Zichen, et al.
Pubblicazione: (2026)
Generating executable oracles to check conformance of client code to requirements of JDK Javadocs using LLMs
di: Jiang, Shan, et al.
Pubblicazione: (2024)
di: Jiang, Shan, et al.
Pubblicazione: (2024)
Causal Fuzzing for Verifying Machine Unlearning
di: Mazhar, Anna, et al.
Pubblicazione: (2025)
di: Mazhar, Anna, et al.
Pubblicazione: (2025)
Clover: Closed-Loop Verifiable Code Generation
di: Sun, Chuyue, et al.
Pubblicazione: (2023)
di: Sun, Chuyue, et al.
Pubblicazione: (2023)
Code Generation by Differential Test Time Scaling
di: He, Yifeng, et al.
Pubblicazione: (2026)
di: He, Yifeng, et al.
Pubblicazione: (2026)
Talking with Verifiers: Automatic Specification Generation for Neural Network Verification
di: Elboher, Yizhak Y., et al.
Pubblicazione: (2026)
di: Elboher, Yizhak Y., et al.
Pubblicazione: (2026)
SoundnessBench: A Soundness Benchmark for Neural Network Verifiers
di: Zhou, Xingjian, et al.
Pubblicazione: (2024)
di: Zhou, Xingjian, et al.
Pubblicazione: (2024)
SWE-Replay: Efficient Test-Time Scaling for Software Engineering Agents
di: Ding, Yifeng, et al.
Pubblicazione: (2026)
di: Ding, Yifeng, et al.
Pubblicazione: (2026)
Beyond Verifiable Rewards: Rubric-Based GRM for Reinforced Fine-Tuning SWE Agents
di: Huang, Jiawei, et al.
Pubblicazione: (2026)
di: Huang, Jiawei, et al.
Pubblicazione: (2026)
Your Code Agent Can Grow Alongside You with Structured Memory
di: Deng, Yi-Xuan, et al.
Pubblicazione: (2026)
di: Deng, Yi-Xuan, et al.
Pubblicazione: (2026)
LLM-Vectorizer: LLM-based Verified Loop Vectorizer
di: Taneja, Jubi, et al.
Pubblicazione: (2024)
di: Taneja, Jubi, et al.
Pubblicazione: (2024)
EsoLang-Bench: Evaluating Genuine Reasoning in Large Language Models via Esoteric Programming Languages
di: Sharma, Aman, et al.
Pubblicazione: (2026)
di: Sharma, Aman, et al.
Pubblicazione: (2026)
EGSS: Entropy-guided Stepwise Scaling for Reliable Software Engineering
di: Mao, Chenhui, et al.
Pubblicazione: (2026)
di: Mao, Chenhui, et al.
Pubblicazione: (2026)
Tensor Program Optimization for the RISC-V Vector Extension Using Probabilistic Programs
di: Peccia, Federico Nicolas, et al.
Pubblicazione: (2025)
di: Peccia, Federico Nicolas, et al.
Pubblicazione: (2025)
OBsmith: LLM-Powered JavaScript Obfuscator Testing
di: Jiang, Shan, et al.
Pubblicazione: (2025)
di: Jiang, Shan, et al.
Pubblicazione: (2025)
CodeS: Natural Language to Code Repository via Multi-Layer Sketch
di: Zan, Daoguang, et al.
Pubblicazione: (2024)
di: Zan, Daoguang, et al.
Pubblicazione: (2024)
Scaling Test-Time Compute for Agentic Coding
di: Kim, Joongwon, et al.
Pubblicazione: (2026)
di: Kim, Joongwon, et al.
Pubblicazione: (2026)
Bayesian Program Learning by Decompiling Amortized Knowledge
di: Palmarini, Alessandro B., et al.
Pubblicazione: (2023)
di: Palmarini, Alessandro B., et al.
Pubblicazione: (2023)
Automatic Programming: Large Language Models and Beyond
di: Lyu, Michael R., et al.
Pubblicazione: (2024)
di: Lyu, Michael R., et al.
Pubblicazione: (2024)
Toward Debugging Deep Reinforcement Learning Programs with RLExplorer
di: Bouchoucha, Rached, et al.
Pubblicazione: (2024)
di: Bouchoucha, Rached, et al.
Pubblicazione: (2024)
MIST-RL: Mutation-based Incremental Suite Testing via Reinforcement Learning
di: Zhu, Sicheng, et al.
Pubblicazione: (2026)
di: Zhu, Sicheng, et al.
Pubblicazione: (2026)
APIGen: Automated Pipeline for Generating Verifiable and Diverse Function-Calling Datasets
di: Liu, Zuxin, et al.
Pubblicazione: (2024)
di: Liu, Zuxin, et al.
Pubblicazione: (2024)
Guess & Sketch: Language Model Guided Transpilation
di: Lee, Celine, et al.
Pubblicazione: (2023)
di: Lee, Celine, et al.
Pubblicazione: (2023)
Scaling Down to Scale Up: A Cost-Benefit Analysis of Replacing OpenAI's LLM with Open Source SLMs in Production
di: Irugalbandara, Chandra, et al.
Pubblicazione: (2023)
di: Irugalbandara, Chandra, et al.
Pubblicazione: (2023)
Scoring Verifiers: Evaluating Synthetic Verification for Code and Reasoning
di: Ficek, Aleksander, et al.
Pubblicazione: (2025)
di: Ficek, Aleksander, et al.
Pubblicazione: (2025)
Inference-Time Safety For Code LLMs Via Retrieval-Augmented Revision
di: Mukherjee, Manisha, et al.
Pubblicazione: (2026)
di: Mukherjee, Manisha, et al.
Pubblicazione: (2026)
Accuracy, Stability, and Repeated-Run Reliability of Large Language Models on Deterministic Programming Tasks
di: Zhou, Yongxi, et al.
Pubblicazione: (2026)
di: Zhou, Yongxi, et al.
Pubblicazione: (2026)
Assessing Large Language Models for Automated Feedback Generation in Learning Programming Problem Solving
di: Silva, Priscylla, et al.
Pubblicazione: (2025)
di: Silva, Priscylla, et al.
Pubblicazione: (2025)
APRIL: API Synthesis with Automatic Prompt Optimization and Reinforcement Learning
di: Zhong, Hua, et al.
Pubblicazione: (2025)
di: Zhong, Hua, et al.
Pubblicazione: (2025)
Property-Driven Evaluation of GNN Expressiveness at Scale: Datasets, Framework, and Study
di: Che, Sicong, et al.
Pubblicazione: (2026)
di: Che, Sicong, et al.
Pubblicazione: (2026)
SynthTools: A Framework for Scaling Synthetic Tools for Agent Development
di: Castellani, Tommaso, et al.
Pubblicazione: (2025)
di: Castellani, Tommaso, et al.
Pubblicazione: (2025)
LLM Benchmarking with LLaMA2: Evaluating Code Development Performance Across Multiple Programming Languages
di: Diehl, Patrick, et al.
Pubblicazione: (2025)
di: Diehl, Patrick, et al.
Pubblicazione: (2025)
A Large-Scale Study of Model Integration in ML-Enabled Software Systems
di: Sens, Yorick, et al.
Pubblicazione: (2024)
di: Sens, Yorick, et al.
Pubblicazione: (2024)
MTAD: Tools and Benchmarks for Multivariate Time Series Anomaly Detection
di: Liu, Jinyang, et al.
Pubblicazione: (2024)
di: Liu, Jinyang, et al.
Pubblicazione: (2024)
OpenClassGen: A Large-Scale Corpus of Real-World Python Classes for LLM Research
di: Rahman, Musfiqur, et al.
Pubblicazione: (2025)
di: Rahman, Musfiqur, et al.
Pubblicazione: (2025)
Promise and Peril of Collaborative Code Generation Models: Balancing Effectiveness and Memorization
di: Chen, Zhi, et al.
Pubblicazione: (2024)
di: Chen, Zhi, et al.
Pubblicazione: (2024)
Hardness, Structural Knowledge, and Opportunity: An Analytical Framework for Modular Performance Modeling
di: Gheibi, Omid, et al.
Pubblicazione: (2025)
di: Gheibi, Omid, et al.
Pubblicazione: (2025)
An Exploratory Study of ML Sketches and Visual Code Assistants
di: Gomes, Luís F., et al.
Pubblicazione: (2024)
di: Gomes, Luís F., et al.
Pubblicazione: (2024)
Documenti analoghi
-
Semantic Voting: Execution-Grounded Consensus for LLM Code Generation
di: Jiang, Shan, et al.
Pubblicazione: (2026) -
VeriScale: Adversarial Test-Suite Scaling for Verifiable Code Generation
di: Bai, Yifan, et al.
Pubblicazione: (2026) -
VeriContest: A Competitive-Programming Benchmark for Verifiable Code Generation
di: Xie, Zichen, et al.
Pubblicazione: (2026) -
Generating executable oracles to check conformance of client code to requirements of JDK Javadocs using LLMs
di: Jiang, Shan, et al.
Pubblicazione: (2024) -
Causal Fuzzing for Verifying Machine Unlearning
di: Mazhar, Anna, et al.
Pubblicazione: (2025)