CAPE: Capability Achievement via Policy Execution
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Ball, David |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
How Robustly do LLMs Understand Execution Semantics?
par: Spiess, Claudio, et autres
Publié: (2026)
par: Spiess, Claudio, et autres
Publié: (2026)
CRUXEval: A Benchmark for Code Reasoning, Understanding and Execution
par: Gu, Alex, et autres
Publié: (2024)
par: Gu, Alex, et autres
Publié: (2024)
Automatic Generation of Executable BPMN Models from Medical Guidelines
par: Sekar, Praveen Kumar Menaka, et autres
Publié: (2026)
par: Sekar, Praveen Kumar Menaka, et autres
Publié: (2026)
Semantic Voting: Execution-Grounded Consensus for LLM Code Generation
par: Jiang, Shan, et autres
Publié: (2026)
par: Jiang, Shan, et autres
Publié: (2026)
Mage: Multi-Axis Evaluation of LLM-Generated Executable Game Scenes Beyond Compile-Pass Rate
par: Liu, Hugh Xuechen, et autres
Publié: (2026)
par: Liu, Hugh Xuechen, et autres
Publié: (2026)
Feedback Over Form: Why Execution Feedback Matters More Than Pipeline Topology in 1-3B Code Generation
par: McAndrews, Charles Junichi
Publié: (2026)
par: McAndrews, Charles Junichi
Publié: (2026)
Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation
par: Yu, Zhuohao, et autres
Publié: (2024)
par: Yu, Zhuohao, et autres
Publié: (2024)
Repo2Run: Automated Building Executable Environment for Code Repository at Scale
par: Hu, Ruida, et autres
Publié: (2025)
par: Hu, Ruida, et autres
Publié: (2025)
Model Provenance via Model DNA
par: Mu, Xin, et autres
Publié: (2023)
par: Mu, Xin, et autres
Publié: (2023)
When Your LLM Reaches End-of-Life: A Framework for Confident Model Migration in Production Systems
par: Casey, Emma, et autres
Publié: (2026)
par: Casey, Emma, et autres
Publié: (2026)
Complex Model Transformations by Reinforcement Learning with Uncertain Human Guidance
par: Dagenais, Kyanna, et autres
Publié: (2025)
par: Dagenais, Kyanna, et autres
Publié: (2025)
A Reference Architecture of Reinforcement Learning Frameworks
par: Liu, Xiaoran, et autres
Publié: (2026)
par: Liu, Xiaoran, et autres
Publié: (2026)
PIPer: On-Device Environment Setup via Online Reinforcement Learning
par: Kovrigin, Alexander, et autres
Publié: (2025)
par: Kovrigin, Alexander, et autres
Publié: (2025)
Benchmarking Reward Hack Detection in Code Environments via Contrastive Analysis
par: Deshpande, Darshan, et autres
Publié: (2026)
par: Deshpande, Darshan, et autres
Publié: (2026)
Sketch-and-Verify: Structured Inference-Time Scaling via Program Sketching
par: Jiang, Shan, et autres
Publié: (2026)
par: Jiang, Shan, et autres
Publié: (2026)
Hammer: Robust Function-Calling for On-Device Language Models via Function Masking
par: Lin, Qiqiang, et autres
Publié: (2024)
par: Lin, Qiqiang, et autres
Publié: (2024)
MIST-RL: Mutation-based Incremental Suite Testing via Reinforcement Learning
par: Zhu, Sicheng, et autres
Publié: (2026)
par: Zhu, Sicheng, et autres
Publié: (2026)
Evaluating the Formal Reasoning Capabilities of Large Language Models through Chomsky Hierarchy
par: Dong, Yihong, et autres
Publié: (2026)
par: Dong, Yihong, et autres
Publié: (2026)
CodeEditorBench: Evaluating Code Editing Capability of Large Language Models
par: Guo, Jiawei, et autres
Publié: (2024)
par: Guo, Jiawei, et autres
Publié: (2024)
Cross-System Categorization of Abnormal Traces in Microservice-Based Systems via Meta-Learning
par: Wang, Yuqing, et autres
Publié: (2024)
par: Wang, Yuqing, et autres
Publié: (2024)
BatCoder: Self-Supervised Bidirectional Code-Documentation Learning via Back-Translation
par: Xu, Jingwen, et autres
Publié: (2026)
par: Xu, Jingwen, et autres
Publié: (2026)
$\textbf{PLUM}$: Improving Code LMs with Execution-Guided On-Policy Preference Learning Driven By Synthetic Test Cases
par: Zhang, Dylan, et autres
Publié: (2024)
par: Zhang, Dylan, et autres
Publié: (2024)
ADReFT: Adaptive Decision Repair for Safe Autonomous Driving via Reinforcement Fine-Tuning
par: Cheng, Mingfei, et autres
Publié: (2025)
par: Cheng, Mingfei, et autres
Publié: (2025)
PCBSchemaGen: Constraint-Guided Schematic Design via LLM for Printed Circuit Boards (PCB)
par: Zou, Huanghaohe, et autres
Publié: (2026)
par: Zou, Huanghaohe, et autres
Publié: (2026)
EsoLang-Bench: Evaluating Genuine Reasoning in Large Language Models via Esoteric Programming Languages
par: Sharma, Aman, et autres
Publié: (2026)
par: Sharma, Aman, et autres
Publié: (2026)
Can LLMs Reason Like Automated Theorem Provers for Rust Verification? VCoT-Bench: Evaluating via Verification Chain of Thought
par: Xie, Zichen, et autres
Publié: (2026)
par: Xie, Zichen, et autres
Publié: (2026)
Towards a Classification of Open-Source ML Models and Datasets for Software Engineering
par: González, Alexandra, et autres
Publié: (2024)
par: González, Alexandra, et autres
Publié: (2024)
On the Replicability and Reproducibility of Deep Learning in Software Engineering
par: Liu, Chao, et autres
Publié: (2020)
par: Liu, Chao, et autres
Publié: (2020)
Beyond Output Correctness: Benchmarking and Evaluating Large Language Model Reasoning in Coding Tasks
par: Li, Yuangang, et autres
Publié: (2026)
par: Li, Yuangang, et autres
Publié: (2026)
Towards Robust Agentic CUDA Kernel Benchmarking, Verification, and Optimization
par: Lange, Robert Tjarko, et autres
Publié: (2025)
par: Lange, Robert Tjarko, et autres
Publié: (2025)
From paper to benchmark: agentic, framework-based reproduction of under-specified methods in machine health intelligence
par: Theiler, Raffael, et autres
Publié: (2026)
par: Theiler, Raffael, et autres
Publié: (2026)
Towards More Trustworthy and Interpretable LLMs for Code through Syntax-Grounded Explanations
par: Palacio, David N., et autres
Publié: (2024)
par: Palacio, David N., et autres
Publié: (2024)
Traversal-as-Policy: Log-Distilled Gated Behavior Trees as Externalized, Verifiable Policies for Safe, Robust, and Efficient Agents
par: Li, Peiran, et autres
Publié: (2026)
par: Li, Peiran, et autres
Publié: (2026)
Deploying Geospatial Foundation Models in the Real World: Lessons from WorldCereal
par: Butsko, Christina, et autres
Publié: (2025)
par: Butsko, Christina, et autres
Publié: (2025)
Adaptation of XAI to Auto-tuning for Numerical Libraries
par: Aoki, Shota, et autres
Publié: (2024)
par: Aoki, Shota, et autres
Publié: (2024)
GRAPH-GRPO-LEX: Contract Graph Modeling and Reinforcement Learning with Group Relative Policy Optimization
par: Dechtiar, Moriya, et autres
Publié: (2025)
par: Dechtiar, Moriya, et autres
Publié: (2025)
Challenges and Paths Towards AI for Software Engineering
par: Gu, Alex, et autres
Publié: (2025)
par: Gu, Alex, et autres
Publié: (2025)
DRAFT-ing Architectural Design Decisions using LLMs
par: Dhar, Rudra, et autres
Publié: (2025)
par: Dhar, Rudra, et autres
Publié: (2025)
LLM-based Content Classification Approach for GitHub Repositories by the README Files
par: Mehmood, Malik Uzair, et autres
Publié: (2025)
par: Mehmood, Malik Uzair, et autres
Publié: (2025)
LLMs in Coding and their Impact on the Commercial Software Engineering Landscape
par: Belozerov, Vladislav, et autres
Publié: (2025)
par: Belozerov, Vladislav, et autres
Publié: (2025)
Documents similaires
-
How Robustly do LLMs Understand Execution Semantics?
par: Spiess, Claudio, et autres
Publié: (2026) -
CRUXEval: A Benchmark for Code Reasoning, Understanding and Execution
par: Gu, Alex, et autres
Publié: (2024) -
Automatic Generation of Executable BPMN Models from Medical Guidelines
par: Sekar, Praveen Kumar Menaka, et autres
Publié: (2026) -
Semantic Voting: Execution-Grounded Consensus for LLM Code Generation
par: Jiang, Shan, et autres
Publié: (2026) -
Mage: Multi-Axis Evaluation of LLM-Generated Executable Game Scenes Beyond Compile-Pass Rate
par: Liu, Hugh Xuechen, et autres
Publié: (2026)