Saved in:
| Main Authors: | Grossman, Thomas A., Chen, Yuan, Datuashvili, Sopiko |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2604.25689 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
AppForge: From Assistant to Independent Developer -- Are GPTs Ready for Software Development?
by: Ran, Dezhi, et al.
Published: (2025)
by: Ran, Dezhi, et al.
Published: (2025)
Small Models, Big Tasks: An Exploratory Empirical Study on Small Language Models for Function Calling
by: Kavathekar, Ishan, et al.
Published: (2025)
by: Kavathekar, Ishan, et al.
Published: (2025)
Private GPTs for LLM-driven testing in software development and machine learning
by: Jagielski, Jakub, et al.
Published: (2025)
by: Jagielski, Jakub, et al.
Published: (2025)
PromptPex: Automatic Test Generation for Language Model Prompts
by: Sharma, Reshabh K, et al.
Published: (2025)
by: Sharma, Reshabh K, et al.
Published: (2025)
Task Abstention for Large Language Models in Code Generation
by: Zhou, Yanke, et al.
Published: (2026)
by: Zhou, Yanke, et al.
Published: (2026)
TableTalk: Scaffolding Spreadsheet Development with a Language Agent
by: Liang, Jenny T., et al.
Published: (2025)
by: Liang, Jenny T., et al.
Published: (2025)
TaskEval: Synthesised Evaluation for Foundation-Model Tasks
by: Widanapathiranage, Dilani, et al.
Published: (2025)
by: Widanapathiranage, Dilani, et al.
Published: (2025)
TaskEval: Assessing Difficulty of Code Generation Tasks for Large Language Models
by: Tambon, Florian, et al.
Published: (2024)
by: Tambon, Florian, et al.
Published: (2024)
Experimental Analysis of Productive Interaction Strategy with ChatGPT: User Study on Function and Project-level Code Generation Tasks
by: Hyun, Sangwon, et al.
Published: (2025)
by: Hyun, Sangwon, et al.
Published: (2025)
Rethinking Software Engineering in the Foundation Model Era: From Task-Driven AI Copilots to Goal-Driven AI Pair Programmers
by: Hassan, Ahmed E., et al.
Published: (2024)
by: Hassan, Ahmed E., et al.
Published: (2024)
Breaking the Myth: Can Small Models Infer Postconditions Too?
by: Zhang, Gehao, et al.
Published: (2025)
by: Zhang, Gehao, et al.
Published: (2025)
GPIoT: Tailoring Small Language Models for IoT Program Synthesis and Development
by: Shen, Leming, et al.
Published: (2025)
by: Shen, Leming, et al.
Published: (2025)
LLMParser: An Exploratory Study on Using Large Language Models for Log Parsing
by: Ma, Zeyang, et al.
Published: (2024)
by: Ma, Zeyang, et al.
Published: (2024)
LlamaRestTest: Effective REST API Testing with Small Language Models
by: Kim, Myeongsoo, et al.
Published: (2025)
by: Kim, Myeongsoo, et al.
Published: (2025)
Estimating Difficulty Levels of Programming Problems with Pre-trained Model
by: Wang, Zhiyuan, et al.
Published: (2024)
by: Wang, Zhiyuan, et al.
Published: (2024)
GitTaskBench: A Benchmark for Code Agents Solving Real-World Tasks Through Code Repository Leveraging
by: Ni, Ziyi, et al.
Published: (2025)
by: Ni, Ziyi, et al.
Published: (2025)
SWE-Next: Scalable Real-World Software Engineering Tasks for Agents
by: Liang, Jiarong, et al.
Published: (2026)
by: Liang, Jiarong, et al.
Published: (2026)
Large Language Models as Test Case Generators: Performance Evaluation and Enhancement
by: Li, Kefan, et al.
Published: (2024)
by: Li, Kefan, et al.
Published: (2024)
RA-Gen: A Controllable Code Generation Framework Using ReAct for Multi-Agent Task Execution
by: Liu, Aofan, et al.
Published: (2025)
by: Liu, Aofan, et al.
Published: (2025)
Personality-Guided Code Generation Using Large Language Models
by: Guo, Yaoqi, et al.
Published: (2024)
by: Guo, Yaoqi, et al.
Published: (2024)
SOEN-101: Code Generation by Emulating Software Process Models Using Large Language Model Agents
by: Lin, Feng, et al.
Published: (2024)
by: Lin, Feng, et al.
Published: (2024)
Using Grammar Masking to Ensure Syntactic Validity in LLM-based Modeling Tasks
by: Netz, Lukas, et al.
Published: (2024)
by: Netz, Lukas, et al.
Published: (2024)
GeoCode-GPT: A Large Language Model for Geospatial Code Generation Tasks
by: Hou, Shuyang, et al.
Published: (2024)
by: Hou, Shuyang, et al.
Published: (2024)
Code Red! On the Harmfulness of Applying Off-the-shelf Large Language Models to Programming Tasks
by: Al-Kaswan, Ali, et al.
Published: (2025)
by: Al-Kaswan, Ali, et al.
Published: (2025)
DIVE: Scaling Diversity in Agentic Task Synthesis for Generalizable Tool Use
by: Chen, Aili, et al.
Published: (2026)
by: Chen, Aili, et al.
Published: (2026)
From What to How: Bridging User Requirements with Software Development Using Large Language Models
by: He, Xiao, et al.
Published: (2026)
by: He, Xiao, et al.
Published: (2026)
Schedule-and-Calibrate: Utility-Guided Multi-Task Reinforcement Learning for Code LLMs
by: Chen, Yujia, et al.
Published: (2026)
by: Chen, Yujia, et al.
Published: (2026)
Seed-CTS: Unleashing the Power of Tree Search for Superior Performance in Competitive Coding Tasks
by: Wang, Hao, et al.
Published: (2024)
by: Wang, Hao, et al.
Published: (2024)
Evaluating LLMs for Visualization Tasks
by: Khan, Saadiq Rauf, et al.
Published: (2025)
by: Khan, Saadiq Rauf, et al.
Published: (2025)
Transducer Tuning: Efficient Model Adaptation for Software Tasks Using Code Property Graphs
by: Yusuf, Imam Nur Bani, et al.
Published: (2024)
by: Yusuf, Imam Nur Bani, et al.
Published: (2024)
CABENCH: Benchmarking Composable AI for Solving Complex Tasks through Composing Ready-to-Use Models
by: Pham, Tung-Thuy, et al.
Published: (2025)
by: Pham, Tung-Thuy, et al.
Published: (2025)
Energy-Aware Code Generation with LLMs: Benchmarking Small vs. Large Language Models for Sustainable AI Programming
by: Ashraf, Humza, et al.
Published: (2025)
by: Ashraf, Humza, et al.
Published: (2025)
LibreLog: Accurate and Efficient Unsupervised Log Parsing Using Open-Source Large Language Models
by: Ma, Zeyang, et al.
Published: (2024)
by: Ma, Zeyang, et al.
Published: (2024)
RepoMaster: Autonomous Exploration and Understanding of GitHub Repositories for Complex Task Solving
by: Wang, Huacan, et al.
Published: (2025)
by: Wang, Huacan, et al.
Published: (2025)
Terminus-4B: Can a Smaller Model Replace Frontier LLMs at Agentic Execution Tasks?
by: Garg, Spandan, et al.
Published: (2026)
by: Garg, Spandan, et al.
Published: (2026)
RepoDebug: Repository-Level Multi-Task and Multi-Language Debugging Evaluation of Large Language Models
by: Liu, Jingjing, et al.
Published: (2025)
by: Liu, Jingjing, et al.
Published: (2025)
ModiGen: A Large Language Model-Based Workflow for Multi-Task Modelica Code Generation
by: Xiang, Jiahui, et al.
Published: (2025)
by: Xiang, Jiahui, et al.
Published: (2025)
When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions
by: Larbi, Maya, et al.
Published: (2025)
by: Larbi, Maya, et al.
Published: (2025)
Spreadsheet Engineering: A Research Framework
by: Grossman, Thomas A.
Published: (2007)
by: Grossman, Thomas A.
Published: (2007)
Geo-FuB: A Method for Constructing an Operator-Function Knowledge Base for Geospatial Code Generation Tasks Using Large Language Models
by: Hou, Shuyang, et al.
Published: (2024)
by: Hou, Shuyang, et al.
Published: (2024)
Similar Items
-
AppForge: From Assistant to Independent Developer -- Are GPTs Ready for Software Development?
by: Ran, Dezhi, et al.
Published: (2025) -
Small Models, Big Tasks: An Exploratory Empirical Study on Small Language Models for Function Calling
by: Kavathekar, Ishan, et al.
Published: (2025) -
Private GPTs for LLM-driven testing in software development and machine learning
by: Jagielski, Jakub, et al.
Published: (2025) -
PromptPex: Automatic Test Generation for Language Model Prompts
by: Sharma, Reshabh K, et al.
Published: (2025) -
Task Abstention for Large Language Models in Code Generation
by: Zhou, Yanke, et al.
Published: (2026)