Position: Intelligent Coding Systems Should Write Programs with Justifications
Fuente:
arXiv
Saved in:
| Main Authors: | Xu, Xiangzhe, Feng, Shiwei, Su, Zian, Wang, Chengpeng, Zhang, Xiangyu |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
ASTRA: Autonomous Spatial-Temporal Red-teaming for AI Software Assistants
by: Xu, Xiangzhe, et al.
Published: (2025)
by: Xu, Xiangzhe, et al.
Published: (2025)
Source Code Foundation Models are Transferable Binary Analysis Knowledge Bases
by: Su, Zian, et al.
Published: (2024)
by: Su, Zian, et al.
Published: (2024)
ProSec: Fortifying Code LLMs with Proactive Security Alignment
by: Xu, Xiangzhe, et al.
Published: (2024)
by: Xu, Xiangzhe, et al.
Published: (2024)
LLMDFA: Analyzing Dataflow in Code with Large Language Models
by: Wang, Chengpeng, et al.
Published: (2024)
by: Wang, Chengpeng, et al.
Published: (2024)
CodeArt: Better Code Models by Attention Regularization When Symbols Are Lacking
by: Su, Zian, et al.
Published: (2024)
by: Su, Zian, et al.
Published: (2024)
RepoAudit: An Autonomous LLM-Agent for Repository-Level Code Auditing
by: Guo, Jinyao, et al.
Published: (2025)
by: Guo, Jinyao, et al.
Published: (2025)
DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence
by: Guo, Daya, et al.
Published: (2024)
by: Guo, Daya, et al.
Published: (2024)
ROCAS: Root Cause Analysis of Autonomous Driving Accidents via Cyber-Physical Co-mutation
by: Feng, Shiwei, et al.
Published: (2024)
by: Feng, Shiwei, et al.
Published: (2024)
CodeMirage: A Multi-Lingual Benchmark for Detecting AI-Generated and Paraphrased Source Code from Production-Level LLMs
by: Guo, Hanxi, et al.
Published: (2025)
by: Guo, Hanxi, et al.
Published: (2025)
CodeJudge: Evaluating Code Generation with Large Language Models
by: Tong, Weixi, et al.
Published: (2024)
by: Tong, Weixi, et al.
Published: (2024)
LeetCodeDataset: A Temporal Dataset for Robust Evaluation and Efficient Training of Code LLMs
by: Xia, Yunhui, et al.
Published: (2025)
by: Xia, Yunhui, et al.
Published: (2025)
GiFT: Gibbs Fine-Tuning for Code Generation
by: Li, Haochen, et al.
Published: (2025)
by: Li, Haochen, et al.
Published: (2025)
Code to Think, Think to Code: A Survey on Code-Enhanced Reasoning and Reasoning-Driven Code Intelligence in LLMs
by: Yang, Dayu, et al.
Published: (2025)
by: Yang, Dayu, et al.
Published: (2025)
Evaluating Language Models for Efficient Code Generation
by: Liu, Jiawei, et al.
Published: (2024)
by: Liu, Jiawei, et al.
Published: (2024)
LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code
by: Jain, Naman, et al.
Published: (2024)
by: Jain, Naman, et al.
Published: (2024)
SelfCodeAlign: Self-Alignment for Code Generation
by: Wei, Yuxiang, et al.
Published: (2024)
by: Wei, Yuxiang, et al.
Published: (2024)
TAI3: Testing Agent Integrity in Interpreting User Intent
by: Feng, Shiwei, et al.
Published: (2025)
by: Feng, Shiwei, et al.
Published: (2025)
NaturalCodeBench: Examining Coding Performance Mismatch on HumanEval and Natural User Prompts
by: Zhang, Shudan, et al.
Published: (2024)
by: Zhang, Shudan, et al.
Published: (2024)
EVALOOOP: A Self-Consistency-Centered Framework for Assessing Large Language Model Robustness in Programming
by: Fang, Sen, et al.
Published: (2025)
by: Fang, Sen, et al.
Published: (2025)
Aligning the Objective of LLM-based Program Repair
by: Xu, Junjielong, et al.
Published: (2024)
by: Xu, Junjielong, et al.
Published: (2024)
Test Code Generation for Telecom Software Systems using Two-Stage Generative Model
by: Nabeel, Mohamad, et al.
Published: (2024)
by: Nabeel, Mohamad, et al.
Published: (2024)
RepoQA: Evaluating Long Context Code Understanding
by: Liu, Jiawei, et al.
Published: (2024)
by: Liu, Jiawei, et al.
Published: (2024)
IntentCoding: Amplifying User Intent in Code Generation
by: Fang, Zheng, et al.
Published: (2026)
by: Fang, Zheng, et al.
Published: (2026)
Hybrid-Gym: Training Coding Agents to Generalize Across Tasks
by: Xie, Yiqing, et al.
Published: (2026)
by: Xie, Yiqing, et al.
Published: (2026)
Planning-Aware Code Infilling via Horizon-Length Prediction
by: Ding, Yifeng, et al.
Published: (2024)
by: Ding, Yifeng, et al.
Published: (2024)
Learning Code Preference via Synthetic Evolution
by: Liu, Jiawei, et al.
Published: (2024)
by: Liu, Jiawei, et al.
Published: (2024)
Towards Understanding What Code Language Models Learned
by: Ahmed, Toufique, et al.
Published: (2023)
by: Ahmed, Toufique, et al.
Published: (2023)
Suggesting Code Edits in Interactive Machine Learning Notebooks Using Large Language Models
by: Jin, Bihui, et al.
Published: (2025)
by: Jin, Bihui, et al.
Published: (2025)
A Semantic-based Optimization Approach for Repairing LLMs: Case Study on Code Generation
by: Gu, Jian, et al.
Published: (2025)
by: Gu, Jian, et al.
Published: (2025)
Neuron Patching: Semantic-based Neuron-level Language Model Repair for Code Generation
by: Gu, Jian, et al.
Published: (2023)
by: Gu, Jian, et al.
Published: (2023)
CodeUltraFeedback: An LLM-as-a-Judge Dataset for Aligning Large Language Models to Coding Preferences
by: Weyssow, Martin, et al.
Published: (2024)
by: Weyssow, Martin, et al.
Published: (2024)
SceneGenAgent: Precise Industrial Scene Generation with Coding Agent
by: Xia, Xiao, et al.
Published: (2024)
by: Xia, Xiao, et al.
Published: (2024)
Let the Code LLM Edit Itself When You Edit the Code
by: He, Zhenyu, et al.
Published: (2024)
by: He, Zhenyu, et al.
Published: (2024)
Top Leaderboard Ranking = Top Coding Proficiency, Always? EvoEval: Evolving Coding Benchmarks via LLM
by: Xia, Chunqiu Steven, et al.
Published: (2024)
by: Xia, Chunqiu Steven, et al.
Published: (2024)
The Impact of Prompt Programming on Function-Level Code Generation
by: Khojah, Ranim, et al.
Published: (2024)
by: Khojah, Ranim, et al.
Published: (2024)
Large Language Models for Multilingual Code Intelligence: A Survey
by: Jiang, Chao, et al.
Published: (2026)
by: Jiang, Chao, et al.
Published: (2026)
LLMs as Compiler for Arabic Programming Language
by: Sibaee, Serry, et al.
Published: (2024)
by: Sibaee, Serry, et al.
Published: (2024)
CoCoST: Automatic Complex Code Generation with Online Searching and Correctness Testing
by: He, Xinyi, et al.
Published: (2024)
by: He, Xinyi, et al.
Published: (2024)
CONCUR: Benchmarking LLMs for Concurrent Code Generation
by: Huang, Jue, et al.
Published: (2026)
by: Huang, Jue, et al.
Published: (2026)
StackEval: Benchmarking LLMs in Coding Assistance
by: Shah, Nidhish, et al.
Published: (2024)
by: Shah, Nidhish, et al.
Published: (2024)
Similar Items
-
ASTRA: Autonomous Spatial-Temporal Red-teaming for AI Software Assistants
by: Xu, Xiangzhe, et al.
Published: (2025) -
Source Code Foundation Models are Transferable Binary Analysis Knowledge Bases
by: Su, Zian, et al.
Published: (2024) -
ProSec: Fortifying Code LLMs with Proactive Security Alignment
by: Xu, Xiangzhe, et al.
Published: (2024) -
LLMDFA: Analyzing Dataflow in Code with Large Language Models
by: Wang, Chengpeng, et al.
Published: (2024) -
CodeArt: Better Code Models by Attention Regularization When Symbols Are Lacking
by: Su, Zian, et al.
Published: (2024)