The Constraint Tax: Measuring Validity-Correctness Tradeoffs in Structured Outputs for Small Language Models
Fuente:
arXiv
Saved in:
| Main Author: | Ray, Jaideep |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Carbon-Taxed Transformers: A Green Compression Pipeline for Overgrown Language Models
by: Alam, Ajmain Inqiad, et al.
Published: (2026)
by: Alam, Ajmain Inqiad, et al.
Published: (2026)
Using Small Language Models to Reverse-Engineer Machine Learning Pipelines Structures
by: Lacroix, Nicolas, et al.
Published: (2026)
by: Lacroix, Nicolas, et al.
Published: (2026)
Beyond Output Correctness: Benchmarking and Evaluating Large Language Model Reasoning in Coding Tasks
by: Li, Yuangang, et al.
Published: (2026)
by: Li, Yuangang, et al.
Published: (2026)
Calibration and Correctness of Language Models for Code
by: Spiess, Claudio, et al.
Published: (2024)
by: Spiess, Claudio, et al.
Published: (2024)
Towards a Small Language Model Lifecycle Framework
by: Miraghaei, Parsa, et al.
Published: (2025)
by: Miraghaei, Parsa, et al.
Published: (2025)
COSMosFL: Ensemble of Small Language Models for Fault Localisation
by: Cho, Hyunjoon, et al.
Published: (2025)
by: Cho, Hyunjoon, et al.
Published: (2025)
DocuMint: Docstring Generation for Python using Small Language Models
by: Poudel, Bibek, et al.
Published: (2024)
by: Poudel, Bibek, et al.
Published: (2024)
Correctness Assessment of Code Generated by Large Language Models Using Internal Representations
by: Bui, Tuan-Dung, et al.
Published: (2025)
by: Bui, Tuan-Dung, et al.
Published: (2025)
How to Sustainably Monitor ML-Enabled Systems? Accuracy and Energy Efficiency Tradeoffs in Concept Drift Detection
by: Omar, Rafiullah, et al.
Published: (2024)
by: Omar, Rafiullah, et al.
Published: (2024)
Integrating Large Language Models for Automated Structural Analysis
by: Liang, Haoran, et al.
Published: (2025)
by: Liang, Haoran, et al.
Published: (2025)
Prompt Smells: An Omen for Undesirable Generative AI Outputs
by: Ronanki, Krishna, et al.
Published: (2024)
by: Ronanki, Krishna, et al.
Published: (2024)
Generating Streamlining Constraints with Large Language Models
by: Voboril, Florentina, et al.
Published: (2024)
by: Voboril, Florentina, et al.
Published: (2024)
HackerRank-ASTRA: Evaluating Correctness & Consistency of Large Language Models on cross-domain multi-file project problems
by: Xing, Jun, et al.
Published: (2025)
by: Xing, Jun, et al.
Published: (2025)
Program Structure-aware Language Models: Targeted Software Testing beyond Textual Semantics
by: Tran, Khang, et al.
Published: (2026)
by: Tran, Khang, et al.
Published: (2026)
DEM: A Method for Certifying Deep Neural Network Classifier Outputs in Aerospace
by: Katz, Guy, et al.
Published: (2024)
by: Katz, Guy, et al.
Published: (2024)
MatchFixAgent: Language-Agnostic Autonomous Repository-Level Code Translation Validation and Repair
by: Ibrahimzada, Ali Reza, et al.
Published: (2025)
by: Ibrahimzada, Ali Reza, et al.
Published: (2025)
Ensuring Functional Correctness of Large Code Models with Selective Generation
by: Jeong, Jaewoo, et al.
Published: (2025)
by: Jeong, Jaewoo, et al.
Published: (2025)
ReCodeAgent: A Multi-Agent Workflow for Language-agnostic Translation and Validation of Large-scale Repositories
by: Ibrahimzada, Ali Reza, et al.
Published: (2026)
by: Ibrahimzada, Ali Reza, et al.
Published: (2026)
Automatic Programming: Large Language Models and Beyond
by: Lyu, Michael R., et al.
Published: (2024)
by: Lyu, Michael R., et al.
Published: (2024)
FunPRM: Function-as-Step Process Reward Model with Meta Reward Correction for Code Generation
by: Zhang, Ruiyi, et al.
Published: (2026)
by: Zhang, Ruiyi, et al.
Published: (2026)
Otter: Generating Tests from Issues to Validate SWE Patches
by: Ahmed, Toufique, et al.
Published: (2025)
by: Ahmed, Toufique, et al.
Published: (2025)
ExplainFuzz: Explainable and Constraint-Conditioned Test Generation with Probabilistic Circuits
by: Baiget, Annaëlle, et al.
Published: (2026)
by: Baiget, Annaëlle, et al.
Published: (2026)
Unsupervised Evaluation of Code LLMs with Round-Trip Correctness
by: Allamanis, Miltiadis, et al.
Published: (2024)
by: Allamanis, Miltiadis, et al.
Published: (2024)
A Large Scale Survey of Motivation in Software Development and Analysis of its Validity
by: Amit, Idan, et al.
Published: (2024)
by: Amit, Idan, et al.
Published: (2024)
Unlearning Trojans in Large Language Models: A Comparison Between Natural Language and Source Code
by: Kazemi, Mahdi, et al.
Published: (2024)
by: Kazemi, Mahdi, et al.
Published: (2024)
GLLM: Self-Corrective G-Code Generation using Large Language Models with User Feedback
by: Abdelaal, Mohamed, et al.
Published: (2025)
by: Abdelaal, Mohamed, et al.
Published: (2025)
Mechanistic Interpretability of Code Correctness in LLMs via Sparse Autoencoders
by: Tahimic, Kriz, et al.
Published: (2025)
by: Tahimic, Kriz, et al.
Published: (2025)
LEANCODE: Understanding Models Better for Code Simplification of Pre-trained Large Language Models
by: Wang, Yan, et al.
Published: (2025)
by: Wang, Yan, et al.
Published: (2025)
Applying Large Language Models to Issue Classification: Revisiting with Extended Data and New Models
by: Aracena, Gabriel, et al.
Published: (2025)
by: Aracena, Gabriel, et al.
Published: (2025)
Models That Prove Their Own Correctness
by: Amit, Noga, et al.
Published: (2024)
by: Amit, Noga, et al.
Published: (2024)
Large Language Models for Software Engineering: A Reproducibility Crisis
by: Siddiq, Mohammed Latif, et al.
Published: (2025)
by: Siddiq, Mohammed Latif, et al.
Published: (2025)
Revisiting the Plastic Surgery Hypothesis via Large Language Models
by: Xia, Chunqiu Steven, et al.
Published: (2023)
by: Xia, Chunqiu Steven, et al.
Published: (2023)
Automatic Semantic Augmentation of Language Model Prompts (for Code Summarization)
by: Ahmed, Toufique, et al.
Published: (2023)
by: Ahmed, Toufique, et al.
Published: (2023)
Fuzz4All: Universal Fuzzing with Large Language Models
by: Xia, Chunqiu Steven, et al.
Published: (2023)
by: Xia, Chunqiu Steven, et al.
Published: (2023)
Can Code Language Models Learn Clarification-Seeking Behaviors?
by: Wu, Jie JW, et al.
Published: (2025)
by: Wu, Jie JW, et al.
Published: (2025)
AlphaTrans: A Neuro-Symbolic Compositional Approach for Repository-Level Code Translation and Validation
by: Ibrahimzada, Ali Reza, et al.
Published: (2024)
by: Ibrahimzada, Ali Reza, et al.
Published: (2024)
Large Language Models for Analyzing Enterprise Architecture Debt in Unstructured Documentation
by: Pagels, Christin, et al.
Published: (2026)
by: Pagels, Christin, et al.
Published: (2026)
Enhancing Large Language Models with Faster Code Preprocessing for Vulnerability Detection
by: Gonçalves, José, et al.
Published: (2025)
by: Gonçalves, José, et al.
Published: (2025)
Using Large Language Models to Generate JUnit Tests: An Empirical Study
by: Siddiq, Mohammed Latif, et al.
Published: (2023)
by: Siddiq, Mohammed Latif, et al.
Published: (2023)
CARGO: A Framework for Confidence-Aware Routing of Large Language Models
by: Barrak, Amine, et al.
Published: (2025)
by: Barrak, Amine, et al.
Published: (2025)
Similar Items
-
Carbon-Taxed Transformers: A Green Compression Pipeline for Overgrown Language Models
by: Alam, Ajmain Inqiad, et al.
Published: (2026) -
Using Small Language Models to Reverse-Engineer Machine Learning Pipelines Structures
by: Lacroix, Nicolas, et al.
Published: (2026) -
Beyond Output Correctness: Benchmarking and Evaluating Large Language Model Reasoning in Coding Tasks
by: Li, Yuangang, et al.
Published: (2026) -
Calibration and Correctness of Language Models for Code
by: Spiess, Claudio, et al.
Published: (2024) -
Towards a Small Language Model Lifecycle Framework
by: Miraghaei, Parsa, et al.
Published: (2025)