Breaking the Myth: Can Small Models Infer Postconditions Too?
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Gehao, Wang, Zhenting, Zhai, Juan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
POSTCONDBENCH: Benchmarking Correctness and Completeness in Formal Postcondition Inference
por: Zhang, Gehao, et al.
Publicado: (2026)
por: Zhang, Gehao, et al.
Publicado: (2026)
Can Large Language Models Transform Natural Language Intent into Formal Method Postconditions?
por: Endres, Madeline, et al.
Publicado: (2023)
por: Endres, Madeline, et al.
Publicado: (2023)
Beyond Postconditions: Can Large Language Models infer Formal Contracts for Automatic Software Verification?
por: Richter, Cedric, et al.
Publicado: (2025)
por: Richter, Cedric, et al.
Publicado: (2025)
REPOFUSE: Repository-Level Code Completion with Fused Dual Context
por: Liang, Ming, et al.
Publicado: (2024)
por: Liang, Ming, et al.
Publicado: (2024)
Beyond Code Generation: Assessing Code LLM Maturity with Postconditions
por: He, Fusen, et al.
Publicado: (2024)
por: He, Fusen, et al.
Publicado: (2024)
Inferring Pluggable Types with Machine Learning
por: Siddiqui, Kazi Amanul Islam, et al.
Publicado: (2024)
por: Siddiqui, Kazi Amanul Islam, et al.
Publicado: (2024)
Inferring Code Correctness from Specification
por: Florian, Tambon, et al.
Publicado: (2026)
por: Florian, Tambon, et al.
Publicado: (2026)
Efficient DNN-Powered Software with Fair Sparse Models
por: Gao, Xuanqi, et al.
Publicado: (2024)
por: Gao, Xuanqi, et al.
Publicado: (2024)
Deploy-Master: Automating the Deployment of 50,000+ Agent-Ready Scientific Tools in One Day
por: Wang, Yi, et al.
Publicado: (2026)
por: Wang, Yi, et al.
Publicado: (2026)
DREAM: Debugging and Repairing AutoML Pipelines
por: Zhang, Xiaoyu, et al.
Publicado: (2023)
por: Zhang, Xiaoyu, et al.
Publicado: (2023)
Small Models, Big Tasks: An Exploratory Empirical Study on Small Language Models for Function Calling
por: Kavathekar, Ishan, et al.
Publicado: (2025)
por: Kavathekar, Ishan, et al.
Publicado: (2025)
CodeCircuit: Toward Inferring LLM-Generated Code Correctness via Attribution Graphs
por: He, Yicheng, et al.
Publicado: (2026)
por: He, Yicheng, et al.
Publicado: (2026)
Breaking the Illusion of Identity in LLM Tooling
por: Miller, Marek
Publicado: (2026)
por: Miller, Marek
Publicado: (2026)
Breaking Android with AI: A Deep Dive into LLM-Powered Exploitation
por: Perera, Wanni Vidulige Ishan, et al.
Publicado: (2025)
por: Perera, Wanni Vidulige Ishan, et al.
Publicado: (2025)
This Is Taking Too Long -- Investigating Time as a Proxy for Energy Consumption of LLMs
por: Krupp, Lars, et al.
Publicado: (2026)
por: Krupp, Lars, et al.
Publicado: (2026)
Reasoning over Precedents Alongside Statutes: Case-Augmented Deliberative Alignment for LLM Safety
por: Jin, Can, et al.
Publicado: (2026)
por: Jin, Can, et al.
Publicado: (2026)
Accuracy Can Lie: On the Impact of Surrogate Model in Configuration Tuning
por: Chen, Pengzhou, et al.
Publicado: (2025)
por: Chen, Pengzhou, et al.
Publicado: (2025)
Breaking Barriers in Software Testing: The Power of AI-Driven Automation
por: Naqvi, Saba, et al.
Publicado: (2025)
por: Naqvi, Saba, et al.
Publicado: (2025)
Large Language Models for In-File Vulnerability Localization Can Be "Lost in the End"
por: Sovrano, Francesco, et al.
Publicado: (2025)
por: Sovrano, Francesco, et al.
Publicado: (2025)
ProgramBench: Can Language Models Rebuild Programs From Scratch?
por: Yang, John, et al.
Publicado: (2026)
por: Yang, John, et al.
Publicado: (2026)
GPIoT: Tailoring Small Language Models for IoT Program Synthesis and Development
por: Shen, Leming, et al.
Publicado: (2025)
por: Shen, Leming, et al.
Publicado: (2025)
ASSURE: Metamorphic Testing for AI-powered Browser Extensions
por: Gao, Xuanqi, et al.
Publicado: (2025)
por: Gao, Xuanqi, et al.
Publicado: (2025)
LlamaRestTest: Effective REST API Testing with Small Language Models
por: Kim, Myeongsoo, et al.
Publicado: (2025)
por: Kim, Myeongsoo, et al.
Publicado: (2025)
Spreadsheet Modeling Experiments Using GPTs on Small Problem Statements and the Wall Task
por: Grossman, Thomas A., et al.
Publicado: (2026)
por: Grossman, Thomas A., et al.
Publicado: (2026)
EduBot -- Can LLMs Solve Personalized Learning and Programming Assignments?
por: Wang, Yibin, et al.
Publicado: (2025)
por: Wang, Yibin, et al.
Publicado: (2025)
When the Code Autopilot Breaks: Why LLMs Falter in Embedded Machine Learning
por: Morabito, Roberto, et al.
Publicado: (2025)
por: Morabito, Roberto, et al.
Publicado: (2025)
I Can Find You in Seconds! Leveraging Large Language Models for Code Authorship Attribution
por: Choi, Soohyeon, et al.
Publicado: (2025)
por: Choi, Soohyeon, et al.
Publicado: (2025)
Can AI Models Direct Each Other? Organizational Structure as a Probe into Training Limitations
por: Liu, Rui
Publicado: (2026)
por: Liu, Rui
Publicado: (2026)
Can Agents Fix Agent Issues?
por: Rahardja, Alfin Wijaya, et al.
Publicado: (2025)
por: Rahardja, Alfin Wijaya, et al.
Publicado: (2025)
Terminus-4B: Can a Smaller Model Replace Frontier LLMs at Agentic Execution Tasks?
por: Garg, Spandan, et al.
Publicado: (2026)
por: Garg, Spandan, et al.
Publicado: (2026)
Neuro-Symbolic Generation and Validation of Memory-Aware Formal Function Specifications
por: Zhang, Liao, et al.
Publicado: (2026)
por: Zhang, Liao, et al.
Publicado: (2026)
Safer Builders, Risky Maintainers: A Comparative Study of Breaking Changes in Human vs Agentic PRs
por: Ferdous, K M, et al.
Publicado: (2026)
por: Ferdous, K M, et al.
Publicado: (2026)
Energy-Aware Code Generation with LLMs: Benchmarking Small vs. Large Language Models for Sustainable AI Programming
por: Ashraf, Humza, et al.
Publicado: (2025)
por: Ashraf, Humza, et al.
Publicado: (2025)
Can Github issues be solved with Tree Of Thoughts?
por: La Rosa, Ricardo, et al.
Publicado: (2024)
por: La Rosa, Ricardo, et al.
Publicado: (2024)
False Friends in the Shell: Unveiling the Emoticon Semantic Confusion in Large Language Models
por: Jiang, Weipeng, et al.
Publicado: (2026)
por: Jiang, Weipeng, et al.
Publicado: (2026)
Can GPT-O1 Kill All Bugs? An Evaluation of GPT-Family LLMs on QuixBugs
por: Hu, Haichuan, et al.
Publicado: (2024)
por: Hu, Haichuan, et al.
Publicado: (2024)
Can LLMs Replace Human Evaluators? An Empirical Study of LLM-as-a-Judge in Software Engineering
por: Wang, Ruiqi, et al.
Publicado: (2025)
por: Wang, Ruiqi, et al.
Publicado: (2025)
Let the Barbarians In: How AI Can Accelerate Systems Performance Research
por: Cheng, Audrey, et al.
Publicado: (2025)
por: Cheng, Audrey, et al.
Publicado: (2025)
Can LLMs Replace Humans During Code Chunking?
por: Glasz, Christopher, et al.
Publicado: (2025)
por: Glasz, Christopher, et al.
Publicado: (2025)
Can LLM Generate Regression Tests for Software Commits?
por: Liu, Jing, et al.
Publicado: (2025)
por: Liu, Jing, et al.
Publicado: (2025)
Ejemplares similares
-
POSTCONDBENCH: Benchmarking Correctness and Completeness in Formal Postcondition Inference
por: Zhang, Gehao, et al.
Publicado: (2026) -
Can Large Language Models Transform Natural Language Intent into Formal Method Postconditions?
por: Endres, Madeline, et al.
Publicado: (2023) -
Beyond Postconditions: Can Large Language Models infer Formal Contracts for Automatic Software Verification?
por: Richter, Cedric, et al.
Publicado: (2025) -
REPOFUSE: Repository-Level Code Completion with Fused Dual Context
por: Liang, Ming, et al.
Publicado: (2024) -
Beyond Code Generation: Assessing Code LLM Maturity with Postconditions
por: He, Fusen, et al.
Publicado: (2024)