DOCE: Finding the Sweet Spot for Execution-Based Code Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Haau-Sing, Fernandes, Patrick, Gurevych, Iryna, Martins, André F. T. |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
IRCoder: Intermediate Representations Make Language Models Robust Multilingual Code Generators
par: Paul, Indraneil, et autres
Publié: (2024)
par: Paul, Indraneil, et autres
Publié: (2024)
SciCoQA: Quality Assurance for Scientific Paper--Code Alignment
par: Baumgärtner, Tim, et autres
Publié: (2026)
par: Baumgärtner, Tim, et autres
Publié: (2026)
PerfCodeGen: Improving Performance of LLM Generated Code with Execution Feedback
par: Peng, Yun, et autres
Publié: (2024)
par: Peng, Yun, et autres
Publié: (2024)
Reranking Laws for Language Generation: A Communication-Theoretic Perspective
par: Farinhas, António, et autres
Publié: (2024)
par: Farinhas, António, et autres
Publié: (2024)
MAGneT: Coordinated Multi-Agent Generation of Synthetic Multi-Turn Mental Health Counseling Sessions
par: Mandal, Aishik, et autres
Publié: (2025)
par: Mandal, Aishik, et autres
Publié: (2025)
Preemptive Detection and Correction of Misaligned Actions in LLM Agents
par: Fang, Haishuo, et autres
Publié: (2024)
par: Fang, Haishuo, et autres
Publié: (2024)
Towards Privacy-aware Mental Health AI Models: Advances, Challenges, and Opportunities
par: Mandal, Aishik, et autres
Publié: (2025)
par: Mandal, Aishik, et autres
Publié: (2025)
Executing as You Generate: Hiding Execution Latency in LLM Code Generation
par: Sun, Zhensu, et autres
Publié: (2026)
par: Sun, Zhensu, et autres
Publié: (2026)
CodeChain: Towards Modular Code Generation Through Chain of Self-revisions with Representative Sub-modules
par: Le, Hung, et autres
Publié: (2023)
par: Le, Hung, et autres
Publié: (2023)
Multimodal Large Language Models to Support Real-World Fact-Checking
par: Geng, Jiahui, et autres
Publié: (2024)
par: Geng, Jiahui, et autres
Publié: (2024)
Sensitivity, Performance, Robustness: Deconstructing the Effect of Sociodemographic Prompting
par: Beck, Tilman, et autres
Publié: (2023)
par: Beck, Tilman, et autres
Publié: (2023)
FPMoE: A Sparse Mixture-of-Experts Approach to Functional Code Generation
par: Pham, Loc, et autres
Publié: (2026)
par: Pham, Loc, et autres
Publié: (2026)
From Leaky Thoughts to Private Reasoning: Controlling What LRMs Say to Themselves
par: Puerto, Haritz, et autres
Publié: (2026)
par: Puerto, Haritz, et autres
Publié: (2026)
ObscuraCoder: Powering Efficient Code LM Pre-Training Via Obfuscation Grounding
par: Paul, Indraneil, et autres
Publié: (2025)
par: Paul, Indraneil, et autres
Publié: (2025)
PeerQA: A Scientific Question Answering Dataset from Peer Reviews
par: Baumgärtner, Tim, et autres
Publié: (2025)
par: Baumgärtner, Tim, et autres
Publié: (2025)
Factual Self-Awareness in Language Models: Representation, Robustness, and Scaling
par: Tamoyan, Hovhannes, et autres
Publié: (2025)
par: Tamoyan, Hovhannes, et autres
Publié: (2025)
SpaRC and SpaRP: Spatial Reasoning Characterization and Path Generation for Understanding Spatial Reasoning Capability of Large Language Models
par: Rizvi, Md Imbesat Hassan, et autres
Publié: (2024)
par: Rizvi, Md Imbesat Hassan, et autres
Publié: (2024)
VeriThoughts: Enabling Automated Verilog Code Generation using Reasoning and Formal Verification
par: Yubeaton, Patrick, et autres
Publié: (2025)
par: Yubeaton, Patrick, et autres
Publié: (2025)
How Do Humans Write Code? Large Models Do It the Same Way Too
par: Li, Long, et autres
Publié: (2024)
par: Li, Long, et autres
Publié: (2024)
From Code to Correctness: Closing the Last Mile of Code Generation with Hierarchical Debugging
par: Shi, Yuling, et autres
Publié: (2024)
par: Shi, Yuling, et autres
Publié: (2024)
The Good, the Bad and the Constructive: Automatically Measuring Peer Review's Utility for Authors
par: Sadallah, Abdelrahman, et autres
Publié: (2025)
par: Sadallah, Abdelrahman, et autres
Publié: (2025)
Hypothesis-Driven Feature Manifold Analysis in LLMs via Supervised Multi-Dimensional Scaling
par: Tiblias, Federico, et autres
Publié: (2025)
par: Tiblias, Federico, et autres
Publié: (2025)
Is Self-Repair a Silver Bullet for Code Generation?
par: Olausson, Theo X., et autres
Publié: (2023)
par: Olausson, Theo X., et autres
Publié: (2023)
PPM: Automated Generation of Diverse Programming Problems for Benchmarking Code Generation Models
par: Chen, Simin, et autres
Publié: (2024)
par: Chen, Simin, et autres
Publié: (2024)
A Comprehensive Review of Datasets for Clinical Mental Health AI Systems
par: Mandal, Aishik, et autres
Publié: (2025)
par: Mandal, Aishik, et autres
Publié: (2025)
Illusion or Algorithm? Investigating Memorization, Emergence, and Symbolic Processing in In-Context Learning
par: Niu, Jingcheng, et autres
Publié: (2025)
par: Niu, Jingcheng, et autres
Publié: (2025)
Benchmarking LLM Code Generation for Audio Programming with Visual Dataflow Languages
par: Zhang, William, et autres
Publié: (2024)
par: Zhang, William, et autres
Publié: (2024)
$\textbf{PLUM}$: Improving Code LMs with Execution-Guided On-Policy Preference Learning Driven By Synthetic Test Cases
par: Zhang, Dylan, et autres
Publié: (2024)
par: Zhang, Dylan, et autres
Publié: (2024)
XGrammar: Flexible and Efficient Structured Generation Engine for Large Language Models
par: Dong, Yixin, et autres
Publié: (2024)
par: Dong, Yixin, et autres
Publié: (2024)
ReFEree: Reference-Free and Fine-Grained Method for Evaluating Factual Consistency in Real-World Code Summarization
par: Bae, Suyoung, et autres
Publié: (2026)
par: Bae, Suyoung, et autres
Publié: (2026)
SPARE: Single-Pass Annotation with Reference-Guided Evaluation for Automatic Process Supervision and Reward Modelling
par: Rizvi, Md Imbesat Hassan, et autres
Publié: (2025)
par: Rizvi, Md Imbesat Hassan, et autres
Publié: (2025)
Uncertainty-Aware Decoding with Minimum Bayes Risk
par: Daheim, Nico, et autres
Publié: (2025)
par: Daheim, Nico, et autres
Publié: (2025)
CORE-T: COherent REtrieval of Tables for Text-to-SQL
par: Soliman, Hassan, et autres
Publié: (2026)
par: Soliman, Hassan, et autres
Publié: (2026)
A Survey of Confidence Estimation and Calibration in Large Language Models
par: Geng, Jiahui, et autres
Publié: (2023)
par: Geng, Jiahui, et autres
Publié: (2023)
Dafny as Verification-Aware Intermediate Language for Code Generation
par: Li, Yue Chen, et autres
Publié: (2025)
par: Li, Yue Chen, et autres
Publié: (2025)
CodeMind: Evaluating Large Language Models for Code Reasoning
par: Liu, Changshu, et autres
Publié: (2024)
par: Liu, Changshu, et autres
Publié: (2024)
Model Merging by Uncertainty-Based Gradient Matching
par: Daheim, Nico, et autres
Publié: (2023)
par: Daheim, Nico, et autres
Publié: (2023)
Code Broker: A Multi-Agent System for Automated Code Quality Assessment
par: Attrah, Samer
Publié: (2026)
par: Attrah, Samer
Publié: (2026)
From Problem-Solving to Teaching Problem-Solving: Aligning LLMs with Pedagogy using Reinforcement Learning
par: Dinucu-Jianu, David, et autres
Publié: (2025)
par: Dinucu-Jianu, David, et autres
Publié: (2025)
AutoCode: LLMs as Problem Setters for Competitive Programming
par: Zhou, Shang, et autres
Publié: (2025)
par: Zhou, Shang, et autres
Publié: (2025)
Documents similaires
-
IRCoder: Intermediate Representations Make Language Models Robust Multilingual Code Generators
par: Paul, Indraneil, et autres
Publié: (2024) -
SciCoQA: Quality Assurance for Scientific Paper--Code Alignment
par: Baumgärtner, Tim, et autres
Publié: (2026) -
PerfCodeGen: Improving Performance of LLM Generated Code with Execution Feedback
par: Peng, Yun, et autres
Publié: (2024) -
Reranking Laws for Language Generation: A Communication-Theoretic Perspective
par: Farinhas, António, et autres
Publié: (2024) -
MAGneT: Coordinated Multi-Agent Generation of Synthetic Multi-Turn Mental Health Counseling Sessions
par: Mandal, Aishik, et autres
Publié: (2025)