The Constraint Tax: Measuring Validity-Correctness Tradeoffs in Structured Outputs for Small Language Models
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Ray, Jaideep |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Carbon-Taxed Transformers: A Green Compression Pipeline for Overgrown Language Models
par: Alam, Ajmain Inqiad, et autres
Publié: (2026)
par: Alam, Ajmain Inqiad, et autres
Publié: (2026)
Using Small Language Models to Reverse-Engineer Machine Learning Pipelines Structures
par: Lacroix, Nicolas, et autres
Publié: (2026)
par: Lacroix, Nicolas, et autres
Publié: (2026)
Beyond Output Correctness: Benchmarking and Evaluating Large Language Model Reasoning in Coding Tasks
par: Li, Yuangang, et autres
Publié: (2026)
par: Li, Yuangang, et autres
Publié: (2026)
Calibration and Correctness of Language Models for Code
par: Spiess, Claudio, et autres
Publié: (2024)
par: Spiess, Claudio, et autres
Publié: (2024)
Towards a Small Language Model Lifecycle Framework
par: Miraghaei, Parsa, et autres
Publié: (2025)
par: Miraghaei, Parsa, et autres
Publié: (2025)
COSMosFL: Ensemble of Small Language Models for Fault Localisation
par: Cho, Hyunjoon, et autres
Publié: (2025)
par: Cho, Hyunjoon, et autres
Publié: (2025)
DocuMint: Docstring Generation for Python using Small Language Models
par: Poudel, Bibek, et autres
Publié: (2024)
par: Poudel, Bibek, et autres
Publié: (2024)
Correctness Assessment of Code Generated by Large Language Models Using Internal Representations
par: Bui, Tuan-Dung, et autres
Publié: (2025)
par: Bui, Tuan-Dung, et autres
Publié: (2025)
How to Sustainably Monitor ML-Enabled Systems? Accuracy and Energy Efficiency Tradeoffs in Concept Drift Detection
par: Omar, Rafiullah, et autres
Publié: (2024)
par: Omar, Rafiullah, et autres
Publié: (2024)
Integrating Large Language Models for Automated Structural Analysis
par: Liang, Haoran, et autres
Publié: (2025)
par: Liang, Haoran, et autres
Publié: (2025)
Prompt Smells: An Omen for Undesirable Generative AI Outputs
par: Ronanki, Krishna, et autres
Publié: (2024)
par: Ronanki, Krishna, et autres
Publié: (2024)
Generating Streamlining Constraints with Large Language Models
par: Voboril, Florentina, et autres
Publié: (2024)
par: Voboril, Florentina, et autres
Publié: (2024)
HackerRank-ASTRA: Evaluating Correctness & Consistency of Large Language Models on cross-domain multi-file project problems
par: Xing, Jun, et autres
Publié: (2025)
par: Xing, Jun, et autres
Publié: (2025)
Program Structure-aware Language Models: Targeted Software Testing beyond Textual Semantics
par: Tran, Khang, et autres
Publié: (2026)
par: Tran, Khang, et autres
Publié: (2026)
DEM: A Method for Certifying Deep Neural Network Classifier Outputs in Aerospace
par: Katz, Guy, et autres
Publié: (2024)
par: Katz, Guy, et autres
Publié: (2024)
MatchFixAgent: Language-Agnostic Autonomous Repository-Level Code Translation Validation and Repair
par: Ibrahimzada, Ali Reza, et autres
Publié: (2025)
par: Ibrahimzada, Ali Reza, et autres
Publié: (2025)
Ensuring Functional Correctness of Large Code Models with Selective Generation
par: Jeong, Jaewoo, et autres
Publié: (2025)
par: Jeong, Jaewoo, et autres
Publié: (2025)
ReCodeAgent: A Multi-Agent Workflow for Language-agnostic Translation and Validation of Large-scale Repositories
par: Ibrahimzada, Ali Reza, et autres
Publié: (2026)
par: Ibrahimzada, Ali Reza, et autres
Publié: (2026)
Automatic Programming: Large Language Models and Beyond
par: Lyu, Michael R., et autres
Publié: (2024)
par: Lyu, Michael R., et autres
Publié: (2024)
FunPRM: Function-as-Step Process Reward Model with Meta Reward Correction for Code Generation
par: Zhang, Ruiyi, et autres
Publié: (2026)
par: Zhang, Ruiyi, et autres
Publié: (2026)
Otter: Generating Tests from Issues to Validate SWE Patches
par: Ahmed, Toufique, et autres
Publié: (2025)
par: Ahmed, Toufique, et autres
Publié: (2025)
ExplainFuzz: Explainable and Constraint-Conditioned Test Generation with Probabilistic Circuits
par: Baiget, Annaëlle, et autres
Publié: (2026)
par: Baiget, Annaëlle, et autres
Publié: (2026)
Unsupervised Evaluation of Code LLMs with Round-Trip Correctness
par: Allamanis, Miltiadis, et autres
Publié: (2024)
par: Allamanis, Miltiadis, et autres
Publié: (2024)
A Large Scale Survey of Motivation in Software Development and Analysis of its Validity
par: Amit, Idan, et autres
Publié: (2024)
par: Amit, Idan, et autres
Publié: (2024)
Unlearning Trojans in Large Language Models: A Comparison Between Natural Language and Source Code
par: Kazemi, Mahdi, et autres
Publié: (2024)
par: Kazemi, Mahdi, et autres
Publié: (2024)
GLLM: Self-Corrective G-Code Generation using Large Language Models with User Feedback
par: Abdelaal, Mohamed, et autres
Publié: (2025)
par: Abdelaal, Mohamed, et autres
Publié: (2025)
Mechanistic Interpretability of Code Correctness in LLMs via Sparse Autoencoders
par: Tahimic, Kriz, et autres
Publié: (2025)
par: Tahimic, Kriz, et autres
Publié: (2025)
LEANCODE: Understanding Models Better for Code Simplification of Pre-trained Large Language Models
par: Wang, Yan, et autres
Publié: (2025)
par: Wang, Yan, et autres
Publié: (2025)
Applying Large Language Models to Issue Classification: Revisiting with Extended Data and New Models
par: Aracena, Gabriel, et autres
Publié: (2025)
par: Aracena, Gabriel, et autres
Publié: (2025)
Models That Prove Their Own Correctness
par: Amit, Noga, et autres
Publié: (2024)
par: Amit, Noga, et autres
Publié: (2024)
Large Language Models for Software Engineering: A Reproducibility Crisis
par: Siddiq, Mohammed Latif, et autres
Publié: (2025)
par: Siddiq, Mohammed Latif, et autres
Publié: (2025)
Revisiting the Plastic Surgery Hypothesis via Large Language Models
par: Xia, Chunqiu Steven, et autres
Publié: (2023)
par: Xia, Chunqiu Steven, et autres
Publié: (2023)
Automatic Semantic Augmentation of Language Model Prompts (for Code Summarization)
par: Ahmed, Toufique, et autres
Publié: (2023)
par: Ahmed, Toufique, et autres
Publié: (2023)
Fuzz4All: Universal Fuzzing with Large Language Models
par: Xia, Chunqiu Steven, et autres
Publié: (2023)
par: Xia, Chunqiu Steven, et autres
Publié: (2023)
Can Code Language Models Learn Clarification-Seeking Behaviors?
par: Wu, Jie JW, et autres
Publié: (2025)
par: Wu, Jie JW, et autres
Publié: (2025)
AlphaTrans: A Neuro-Symbolic Compositional Approach for Repository-Level Code Translation and Validation
par: Ibrahimzada, Ali Reza, et autres
Publié: (2024)
par: Ibrahimzada, Ali Reza, et autres
Publié: (2024)
Large Language Models for Analyzing Enterprise Architecture Debt in Unstructured Documentation
par: Pagels, Christin, et autres
Publié: (2026)
par: Pagels, Christin, et autres
Publié: (2026)
Enhancing Large Language Models with Faster Code Preprocessing for Vulnerability Detection
par: Gonçalves, José, et autres
Publié: (2025)
par: Gonçalves, José, et autres
Publié: (2025)
Using Large Language Models to Generate JUnit Tests: An Empirical Study
par: Siddiq, Mohammed Latif, et autres
Publié: (2023)
par: Siddiq, Mohammed Latif, et autres
Publié: (2023)
CARGO: A Framework for Confidence-Aware Routing of Large Language Models
par: Barrak, Amine, et autres
Publié: (2025)
par: Barrak, Amine, et autres
Publié: (2025)
Documents similaires
-
Carbon-Taxed Transformers: A Green Compression Pipeline for Overgrown Language Models
par: Alam, Ajmain Inqiad, et autres
Publié: (2026) -
Using Small Language Models to Reverse-Engineer Machine Learning Pipelines Structures
par: Lacroix, Nicolas, et autres
Publié: (2026) -
Beyond Output Correctness: Benchmarking and Evaluating Large Language Model Reasoning in Coding Tasks
par: Li, Yuangang, et autres
Publié: (2026) -
Calibration and Correctness of Language Models for Code
par: Spiess, Claudio, et autres
Publié: (2024) -
Towards a Small Language Model Lifecycle Framework
par: Miraghaei, Parsa, et autres
Publié: (2025)