Enregistré dans:
| Auteur principal: | Ball, David |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2512.14761 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
How Robustly do LLMs Understand Execution Semantics?
par: Spiess, Claudio, et autres
Publié: (2026)
par: Spiess, Claudio, et autres
Publié: (2026)
CRUXEval: A Benchmark for Code Reasoning, Understanding and Execution
par: Gu, Alex, et autres
Publié: (2024)
par: Gu, Alex, et autres
Publié: (2024)
Automatic Generation of Executable BPMN Models from Medical Guidelines
par: Sekar, Praveen Kumar Menaka, et autres
Publié: (2026)
par: Sekar, Praveen Kumar Menaka, et autres
Publié: (2026)
Semantic Voting: Execution-Grounded Consensus for LLM Code Generation
par: Jiang, Shan, et autres
Publié: (2026)
par: Jiang, Shan, et autres
Publié: (2026)
Mage: Multi-Axis Evaluation of LLM-Generated Executable Game Scenes Beyond Compile-Pass Rate
par: Liu, Hugh Xuechen, et autres
Publié: (2026)
par: Liu, Hugh Xuechen, et autres
Publié: (2026)
Feedback Over Form: Why Execution Feedback Matters More Than Pipeline Topology in 1-3B Code Generation
par: McAndrews, Charles Junichi
Publié: (2026)
par: McAndrews, Charles Junichi
Publié: (2026)
Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation
par: Yu, Zhuohao, et autres
Publié: (2024)
par: Yu, Zhuohao, et autres
Publié: (2024)
Repo2Run: Automated Building Executable Environment for Code Repository at Scale
par: Hu, Ruida, et autres
Publié: (2025)
par: Hu, Ruida, et autres
Publié: (2025)
$\textbf{PLUM}$: Improving Code LMs with Execution-Guided On-Policy Preference Learning Driven By Synthetic Test Cases
par: Zhang, Dylan, et autres
Publié: (2024)
par: Zhang, Dylan, et autres
Publié: (2024)
Evaluating the Formal Reasoning Capabilities of Large Language Models through Chomsky Hierarchy
par: Dong, Yihong, et autres
Publié: (2026)
par: Dong, Yihong, et autres
Publié: (2026)
CodeEditorBench: Evaluating Code Editing Capability of Large Language Models
par: Guo, Jiawei, et autres
Publié: (2024)
par: Guo, Jiawei, et autres
Publié: (2024)
When Your LLM Reaches End-of-Life: A Framework for Confident Model Migration in Production Systems
par: Casey, Emma, et autres
Publié: (2026)
par: Casey, Emma, et autres
Publié: (2026)
Model Provenance via Model DNA
par: Mu, Xin, et autres
Publié: (2023)
par: Mu, Xin, et autres
Publié: (2023)
Complex Model Transformations by Reinforcement Learning with Uncertain Human Guidance
par: Dagenais, Kyanna, et autres
Publié: (2025)
par: Dagenais, Kyanna, et autres
Publié: (2025)
A Reference Architecture of Reinforcement Learning Frameworks
par: Liu, Xiaoran, et autres
Publié: (2026)
par: Liu, Xiaoran, et autres
Publié: (2026)
PIPer: On-Device Environment Setup via Online Reinforcement Learning
par: Kovrigin, Alexander, et autres
Publié: (2025)
par: Kovrigin, Alexander, et autres
Publié: (2025)
Benchmarking Reward Hack Detection in Code Environments via Contrastive Analysis
par: Deshpande, Darshan, et autres
Publié: (2026)
par: Deshpande, Darshan, et autres
Publié: (2026)
Sketch-and-Verify: Structured Inference-Time Scaling via Program Sketching
par: Jiang, Shan, et autres
Publié: (2026)
par: Jiang, Shan, et autres
Publié: (2026)
Hammer: Robust Function-Calling for On-Device Language Models via Function Masking
par: Lin, Qiqiang, et autres
Publié: (2024)
par: Lin, Qiqiang, et autres
Publié: (2024)
MIST-RL: Mutation-based Incremental Suite Testing via Reinforcement Learning
par: Zhu, Sicheng, et autres
Publié: (2026)
par: Zhu, Sicheng, et autres
Publié: (2026)
Cross-System Categorization of Abnormal Traces in Microservice-Based Systems via Meta-Learning
par: Wang, Yuqing, et autres
Publié: (2024)
par: Wang, Yuqing, et autres
Publié: (2024)
BatCoder: Self-Supervised Bidirectional Code-Documentation Learning via Back-Translation
par: Xu, Jingwen, et autres
Publié: (2026)
par: Xu, Jingwen, et autres
Publié: (2026)
Traversal-as-Policy: Log-Distilled Gated Behavior Trees as Externalized, Verifiable Policies for Safe, Robust, and Efficient Agents
par: Li, Peiran, et autres
Publié: (2026)
par: Li, Peiran, et autres
Publié: (2026)
ADReFT: Adaptive Decision Repair for Safe Autonomous Driving via Reinforcement Fine-Tuning
par: Cheng, Mingfei, et autres
Publié: (2025)
par: Cheng, Mingfei, et autres
Publié: (2025)
PCBSchemaGen: Constraint-Guided Schematic Design via LLM for Printed Circuit Boards (PCB)
par: Zou, Huanghaohe, et autres
Publié: (2026)
par: Zou, Huanghaohe, et autres
Publié: (2026)
EsoLang-Bench: Evaluating Genuine Reasoning in Large Language Models via Esoteric Programming Languages
par: Sharma, Aman, et autres
Publié: (2026)
par: Sharma, Aman, et autres
Publié: (2026)
Towards a Classification of Open-Source ML Models and Datasets for Software Engineering
par: González, Alexandra, et autres
Publié: (2024)
par: González, Alexandra, et autres
Publié: (2024)
Can LLMs Reason Like Automated Theorem Provers for Rust Verification? VCoT-Bench: Evaluating via Verification Chain of Thought
par: Xie, Zichen, et autres
Publié: (2026)
par: Xie, Zichen, et autres
Publié: (2026)
On the Replicability and Reproducibility of Deep Learning in Software Engineering
par: Liu, Chao, et autres
Publié: (2020)
par: Liu, Chao, et autres
Publié: (2020)
Beyond Output Correctness: Benchmarking and Evaluating Large Language Model Reasoning in Coding Tasks
par: Li, Yuangang, et autres
Publié: (2026)
par: Li, Yuangang, et autres
Publié: (2026)
Towards Robust Agentic CUDA Kernel Benchmarking, Verification, and Optimization
par: Lange, Robert Tjarko, et autres
Publié: (2025)
par: Lange, Robert Tjarko, et autres
Publié: (2025)
From paper to benchmark: agentic, framework-based reproduction of under-specified methods in machine health intelligence
par: Theiler, Raffael, et autres
Publié: (2026)
par: Theiler, Raffael, et autres
Publié: (2026)
Towards More Trustworthy and Interpretable LLMs for Code through Syntax-Grounded Explanations
par: Palacio, David N., et autres
Publié: (2024)
par: Palacio, David N., et autres
Publié: (2024)
Deploying Geospatial Foundation Models in the Real World: Lessons from WorldCereal
par: Butsko, Christina, et autres
Publié: (2025)
par: Butsko, Christina, et autres
Publié: (2025)
Adaptation of XAI to Auto-tuning for Numerical Libraries
par: Aoki, Shota, et autres
Publié: (2024)
par: Aoki, Shota, et autres
Publié: (2024)
Eliciting Harmful Capabilities by Fine-Tuning On Safeguarded Outputs
par: Kaunismaa, Jackson, et autres
Publié: (2026)
par: Kaunismaa, Jackson, et autres
Publié: (2026)
GRAPH-GRPO-LEX: Contract Graph Modeling and Reinforcement Learning with Group Relative Policy Optimization
par: Dechtiar, Moriya, et autres
Publié: (2025)
par: Dechtiar, Moriya, et autres
Publié: (2025)
Lita: Light Agent Uncovers the Agentic Coding Capabilities of LLMs
par: Dai, Hankun, et autres
Publié: (2025)
par: Dai, Hankun, et autres
Publié: (2025)
What Makes AI Research Replicable? Executable Knowledge Graphs as Scientific Knowledge Representations
par: Luo, Yujie, et autres
Publié: (2025)
par: Luo, Yujie, et autres
Publié: (2025)
Verify Before You Fix: Agentic Execution Grounding for Trustworthy Cross-Language Code Analysis
par: Gajjar, Jugal
Publié: (2026)
par: Gajjar, Jugal
Publié: (2026)
Documents similaires
-
How Robustly do LLMs Understand Execution Semantics?
par: Spiess, Claudio, et autres
Publié: (2026) -
CRUXEval: A Benchmark for Code Reasoning, Understanding and Execution
par: Gu, Alex, et autres
Publié: (2024) -
Automatic Generation of Executable BPMN Models from Medical Guidelines
par: Sekar, Praveen Kumar Menaka, et autres
Publié: (2026) -
Semantic Voting: Execution-Grounded Consensus for LLM Code Generation
par: Jiang, Shan, et autres
Publié: (2026) -
Mage: Multi-Axis Evaluation of LLM-Generated Executable Game Scenes Beyond Compile-Pass Rate
par: Liu, Hugh Xuechen, et autres
Publié: (2026)