On the Limitations of Embedding Based Methods for Measuring Functional Correctness for Code Generation
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Naik, Atharva |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
An Empirical Study on Strong-Weak Model Collaboration for Repo-level Code Generation
par: Gandhi, Shubham, et autres
Publié: (2025)
par: Gandhi, Shubham, et autres
Publié: (2025)
CRScore: Grounding Automated Evaluation of Code Review Comments in Code Claims and Smells
par: Naik, Atharva, et autres
Publié: (2024)
par: Naik, Atharva, et autres
Publié: (2024)
Beyond Functional Correctness: Exploring Hallucinations in LLM-Generated Code
par: Liu, Fang, et autres
Publié: (2024)
par: Liu, Fang, et autres
Publié: (2024)
Towards Better Correctness and Efficiency in Code Generation
par: Feng, Yunlong, et autres
Publié: (2025)
par: Feng, Yunlong, et autres
Publié: (2025)
Benchmarking Correctness and Security in Multi-Turn Code Generation
par: Rawal, Ruchit, et autres
Publié: (2025)
par: Rawal, Ruchit, et autres
Publié: (2025)
CodeCircuit: Toward Inferring LLM-Generated Code Correctness via Attribution Graphs
par: He, Yicheng, et autres
Publié: (2026)
par: He, Yicheng, et autres
Publié: (2026)
Beyond Functional Correctness: Investigating Coding Style Inconsistencies in Large Language Models
par: Wang, Yanlin, et autres
Publié: (2024)
par: Wang, Yanlin, et autres
Publié: (2024)
Is Functional Correctness Enough to Evaluate Code Language Models? Exploring Diversity of Generated Codes
par: Chon, Heejae, et autres
Publié: (2024)
par: Chon, Heejae, et autres
Publié: (2024)
Correctness isnt Efficiency: Runtime Memory Divergence in LLM-Generated Code
par: Rajput, Prateek, et autres
Publié: (2026)
par: Rajput, Prateek, et autres
Publié: (2026)
Correct Code, Vulnerable Dependencies: A Large Scale Measurement Study of LLM-Specified Library Versions
par: Wang, Chengjie, et autres
Publié: (2026)
par: Wang, Chengjie, et autres
Publié: (2026)
Detecting and Correcting Hallucinations in LLM-Generated Code via Deterministic AST Analysis
par: Khati, Dipin, et autres
Publié: (2026)
par: Khati, Dipin, et autres
Publié: (2026)
AI Code in the Wild: Measuring Security Risks and Ecosystem Shifts of AI-Generated Code in Modern Software
par: Wang, Bin, et autres
Publié: (2025)
par: Wang, Bin, et autres
Publié: (2025)
LLMs in Web Development: Evaluating LLM-Generated PHP Code Unveiling Vulnerabilities and Limitations
par: Tóth, Rebeka, et autres
Publié: (2024)
par: Tóth, Rebeka, et autres
Publié: (2024)
Inferring Code Correctness from Specification
par: Florian, Tambon, et autres
Publié: (2026)
par: Florian, Tambon, et autres
Publié: (2026)
An Effective Approach to Embedding Source Code by Combining Large Language and Sentence Embedding Models
par: Xian, Zixiang, et autres
Publié: (2024)
par: Xian, Zixiang, et autres
Publié: (2024)
Do LLMs Favor Their Providers? Measuring Vertical Integration Bias in Code Generation
par: Catal, Melih, et autres
Publié: (2026)
par: Catal, Melih, et autres
Publié: (2026)
Eliminating Hallucination-Induced Errors in LLM Code Generation with Functional Clustering
par: Ravuri, Chaitanya, et autres
Publié: (2025)
par: Ravuri, Chaitanya, et autres
Publié: (2025)
TransformCode: A Contrastive Learning Framework for Code Embedding via Subtree Transformation
par: Xian, Zixiang, et autres
Publié: (2023)
par: Xian, Zixiang, et autres
Publié: (2023)
Enhancing Cross-Language Code Translation via Task-Specific Embedding Alignment in Retrieval-Augmented Generation
par: Bhattarai, Manish, et autres
Publié: (2024)
par: Bhattarai, Manish, et autres
Publié: (2024)
Geo-FuB: A Method for Constructing an Operator-Function Knowledge Base for Geospatial Code Generation Tasks Using Large Language Models
par: Hou, Shuyang, et autres
Publié: (2024)
par: Hou, Shuyang, et autres
Publié: (2024)
CodeXEmbed: A Generalist Embedding Model Family for Multiligual and Multi-task Code Retrieval
par: Liu, Ye, et autres
Publié: (2024)
par: Liu, Ye, et autres
Publié: (2024)
Towards Specification-Driven LLM-Based Generation of Embedded Automotive Software
par: Patil, Minal Suresh, et autres
Publié: (2024)
par: Patil, Minal Suresh, et autres
Publié: (2024)
CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation
par: Yang, Guang, et autres
Publié: (2025)
par: Yang, Guang, et autres
Publié: (2025)
Beyond Functional Correctness: Design Issues in AI IDE-Generated Large-Scale Projects
par: Kashif, Syed Mohammad, et autres
Publié: (2026)
par: Kashif, Syed Mohammad, et autres
Publié: (2026)
Understanding the Limits of Automated Evaluation for Code Review Bots in Practice
par: Karakaya, Veli, et autres
Publié: (2026)
par: Karakaya, Veli, et autres
Publié: (2026)
Hallucination in LLM-Based Code Generation: An Automotive Case Study
par: Pavel, Marc, et autres
Publié: (2025)
par: Pavel, Marc, et autres
Publié: (2025)
GenCode: A Generic Data Augmentation Framework for Boosting Deep Learning-Based Code Understanding
par: Dong, Zeming, et autres
Publié: (2024)
par: Dong, Zeming, et autres
Publié: (2024)
Automating the Correctness Assessment of AI-generated Code for Security Contexts
par: Cotroneo, Domenico, et autres
Publié: (2023)
par: Cotroneo, Domenico, et autres
Publié: (2023)
ScenEval: A Benchmark for Scenario-Based Evaluation of Code Generation
par: Paul, Debalina Ghosh, et autres
Publié: (2024)
par: Paul, Debalina Ghosh, et autres
Publié: (2024)
Defective Task Descriptions in LLM-Based Code Generation: Detection and Analysis
par: Akli, Amal, et autres
Publié: (2026)
par: Akli, Amal, et autres
Publié: (2026)
When the Code Autopilot Breaks: Why LLMs Falter in Embedded Machine Learning
par: Morabito, Roberto, et autres
Publié: (2025)
par: Morabito, Roberto, et autres
Publié: (2025)
RedCode: Risky Code Execution and Generation Benchmark for Code Agents
par: Guo, Chengquan, et autres
Publié: (2024)
par: Guo, Chengquan, et autres
Publié: (2024)
HLSDebugger: Identification and Correction of Logic Bugs in HLS Code with LLM Solutions
par: Wang, Jing, et autres
Publié: (2025)
par: Wang, Jing, et autres
Publié: (2025)
Function-to-Style Guidance of LLMs for Code Translation
par: Zhang, Longhui, et autres
Publié: (2025)
par: Zhang, Longhui, et autres
Publié: (2025)
From Natural Language to Verified Code: Toward AI Assisted Problem-to-Code Generation with Dafny-Based Formal Verification
par: Erfan, Md, et autres
Publié: (2026)
par: Erfan, Md, et autres
Publié: (2026)
RobuNFR: Evaluating the Robustness of Large Language Models on Non-Functional Requirements Aware Code Generation
par: Lin, Feng, et autres
Publié: (2025)
par: Lin, Feng, et autres
Publié: (2025)
CodeFort: Robust Training for Code Generation Models
par: Zhang, Yuhao, et autres
Publié: (2024)
par: Zhang, Yuhao, et autres
Publié: (2024)
CodeCoT: Tackling Code Syntax Errors in CoT Reasoning for Code Generation
par: Huang, Dong, et autres
Publié: (2023)
par: Huang, Dong, et autres
Publié: (2023)
An Evaluation of Context Length Extrapolation in Long Code via Positional Embeddings and Efficient Attention
par: Ghosh, Madhusudan, et autres
Publié: (2026)
par: Ghosh, Madhusudan, et autres
Publié: (2026)
Leveraging LLMs, IDEs, and Semantic Embeddings for Automated Move Method Refactoring
par: Bellur, Abhiram, et autres
Publié: (2025)
par: Bellur, Abhiram, et autres
Publié: (2025)
Documents similaires
-
An Empirical Study on Strong-Weak Model Collaboration for Repo-level Code Generation
par: Gandhi, Shubham, et autres
Publié: (2025) -
CRScore: Grounding Automated Evaluation of Code Review Comments in Code Claims and Smells
par: Naik, Atharva, et autres
Publié: (2024) -
Beyond Functional Correctness: Exploring Hallucinations in LLM-Generated Code
par: Liu, Fang, et autres
Publié: (2024) -
Towards Better Correctness and Efficiency in Code Generation
par: Feng, Yunlong, et autres
Publié: (2025) -
Benchmarking Correctness and Security in Multi-Turn Code Generation
par: Rawal, Ruchit, et autres
Publié: (2025)