EVALOOOP: A Self-Consistency-Centered Framework for Assessing Large Language Model Robustness in Programming
Fuente:
arXiv
Salvato in:
| Autori principali: | Fang, Sen, Ding, Weiyuan, Zhang, Mengshi, Chen, Zihao, Xu, Bowen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Smaller = Weaker? Benchmarking Robustness of Quantized LLMs in Code Generation
di: Fang, Sen, et al.
Pubblicazione: (2025)
di: Fang, Sen, et al.
Pubblicazione: (2025)
Assessing the Latent Automated Program Repair Capabilities of Large Language Models using Round-Trip Translation
di: Ruiz, Fernando Vallecillos, et al.
Pubblicazione: (2024)
di: Ruiz, Fernando Vallecillos, et al.
Pubblicazione: (2024)
MoTCoder: Elevating Large Language Models with Modular of Thought for Challenging Programming Tasks
di: Li, Jingyao, et al.
Pubblicazione: (2023)
di: Li, Jingyao, et al.
Pubblicazione: (2023)
Assured Automatic Programming via Large Language Models
di: Mirchev, Martin, et al.
Pubblicazione: (2024)
di: Mirchev, Martin, et al.
Pubblicazione: (2024)
LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code
di: Jain, Naman, et al.
Pubblicazione: (2024)
di: Jain, Naman, et al.
Pubblicazione: (2024)
DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence
di: Guo, Daya, et al.
Pubblicazione: (2024)
di: Guo, Daya, et al.
Pubblicazione: (2024)
Beyond Accuracy: Evaluating Self-Consistency of Code Large Language Models with IdentityChain
di: Min, Marcus J., et al.
Pubblicazione: (2023)
di: Min, Marcus J., et al.
Pubblicazione: (2023)
LPR: Large Language Models-Aided Program Reduction
di: Zhang, Mengxiao, et al.
Pubblicazione: (2023)
di: Zhang, Mengxiao, et al.
Pubblicazione: (2023)
ReflexiCoder: Teaching Large Language Models to Self-Reflect on Generated Code and Self-Correct It via Reinforcement Learning
di: Jiang, Juyong, et al.
Pubblicazione: (2026)
di: Jiang, Juyong, et al.
Pubblicazione: (2026)
Enhancing Large Language Models in Coding Through Multi-Perspective Self-Consistency
di: Huang, Baizhou, et al.
Pubblicazione: (2023)
di: Huang, Baizhou, et al.
Pubblicazione: (2023)
GLLM: Self-Corrective G-Code Generation using Large Language Models with User Feedback
di: Abdelaal, Mohamed, et al.
Pubblicazione: (2025)
di: Abdelaal, Mohamed, et al.
Pubblicazione: (2025)
AEGIS: From Clues to Verdicts -- Graph-Guided Deep Vulnerability Reasoning via Dialectics and Meta-Auditing
di: Fang, Sen, et al.
Pubblicazione: (2026)
di: Fang, Sen, et al.
Pubblicazione: (2026)
CodeJudge: Evaluating Code Generation with Large Language Models
di: Tong, Weixi, et al.
Pubblicazione: (2024)
di: Tong, Weixi, et al.
Pubblicazione: (2024)
CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios
di: Huang, Shiting, et al.
Pubblicazione: (2025)
di: Huang, Shiting, et al.
Pubblicazione: (2025)
Optimizing Case-Based Reasoning System for Functional Test Script Generation with Large Language Models
di: Guo, Siyuan, et al.
Pubblicazione: (2025)
di: Guo, Siyuan, et al.
Pubblicazione: (2025)
Large Language Models for Multilingual Code Intelligence: A Survey
di: Jiang, Chao, et al.
Pubblicazione: (2026)
di: Jiang, Chao, et al.
Pubblicazione: (2026)
Evaluating Language Models for Efficient Code Generation
di: Liu, Jiawei, et al.
Pubblicazione: (2024)
di: Liu, Jiawei, et al.
Pubblicazione: (2024)
OptLLM: Optimal Assignment of Queries to Large Language Models
di: Liu, Yueyue, et al.
Pubblicazione: (2024)
di: Liu, Yueyue, et al.
Pubblicazione: (2024)
The Impact of Fine-tuning Large Language Models on Automated Program Repair
di: Macháček, Roman, et al.
Pubblicazione: (2025)
di: Macháček, Roman, et al.
Pubblicazione: (2025)
EquiBench: Benchmarking Large Language Models' Reasoning about Program Semantics via Equivalence Checking
di: Wei, Anjiang, et al.
Pubblicazione: (2025)
di: Wei, Anjiang, et al.
Pubblicazione: (2025)
LLMs as Compiler for Arabic Programming Language
di: Sibaee, Serry, et al.
Pubblicazione: (2024)
di: Sibaee, Serry, et al.
Pubblicazione: (2024)
Strengthening Programming Comprehension in Large Language Models through Code Generation
di: Ren, Xiaoning, et al.
Pubblicazione: (2025)
di: Ren, Xiaoning, et al.
Pubblicazione: (2025)
WhiteFox: White-Box Compiler Fuzzing Empowered by Large Language Models
di: Yang, Chenyuan, et al.
Pubblicazione: (2023)
di: Yang, Chenyuan, et al.
Pubblicazione: (2023)
Evaluation and Improvement of Fault Detection for Large Language Models
di: Hu, Qiang, et al.
Pubblicazione: (2024)
di: Hu, Qiang, et al.
Pubblicazione: (2024)
Uncertainty Awareness of Large Language Models Under Code Distribution Shifts: A Benchmark Study
di: Li, Yufei, et al.
Pubblicazione: (2024)
di: Li, Yufei, et al.
Pubblicazione: (2024)
code_transformed: The Influence of Large Language Models on Code
di: Xu, Yuliang, et al.
Pubblicazione: (2025)
di: Xu, Yuliang, et al.
Pubblicazione: (2025)
Evaluating the Process Modeling Abilities of Large Language Models -- Preliminary Foundations and Results
di: Fettke, Peter, et al.
Pubblicazione: (2025)
di: Fettke, Peter, et al.
Pubblicazione: (2025)
Evaluating the Generalization Capabilities of Large Language Models on Code Reasoning
di: Yang, Rem, et al.
Pubblicazione: (2025)
di: Yang, Rem, et al.
Pubblicazione: (2025)
SelfCodeAlign: Self-Alignment for Code Generation
di: Wei, Yuxiang, et al.
Pubblicazione: (2024)
di: Wei, Yuxiang, et al.
Pubblicazione: (2024)
Assessing Coherency and Consistency of Code Execution Reasoning by Large Language Models
di: Liu, Changshu, et al.
Pubblicazione: (2025)
di: Liu, Changshu, et al.
Pubblicazione: (2025)
Functional Consistency of LLM Code Embeddings: A Self-Evolving Data Synthesis Framework for Benchmarking
di: Li, Zhuohao, et al.
Pubblicazione: (2025)
di: Li, Zhuohao, et al.
Pubblicazione: (2025)
SIMCOPILOT: Evaluating Large Language Models for Copilot-Style Code Generation
di: Jiang, Mingchao, et al.
Pubblicazione: (2025)
di: Jiang, Mingchao, et al.
Pubblicazione: (2025)
SODBench: A Large Language Model Approach to Documenting Spreadsheet Operations
di: Indika, Amila, et al.
Pubblicazione: (2025)
di: Indika, Amila, et al.
Pubblicazione: (2025)
Exploring Large Language Models for Translating Romanian Computational Problems into English
di: Dumitran, Adrian Marius, et al.
Pubblicazione: (2025)
di: Dumitran, Adrian Marius, et al.
Pubblicazione: (2025)
Position: Intelligent Coding Systems Should Write Programs with Justifications
di: Xu, Xiangzhe, et al.
Pubblicazione: (2025)
di: Xu, Xiangzhe, et al.
Pubblicazione: (2025)
Prompting and Fine-tuning Large Language Models for Automated Code Review Comment Generation
di: Haider, Md. Asif, et al.
Pubblicazione: (2024)
di: Haider, Md. Asif, et al.
Pubblicazione: (2024)
Suggesting Code Edits in Interactive Machine Learning Notebooks Using Large Language Models
di: Jin, Bihui, et al.
Pubblicazione: (2025)
di: Jin, Bihui, et al.
Pubblicazione: (2025)
Exploring Parameter-Efficient Fine-Tuning Techniques for Code Generation with Large Language Models
di: Weyssow, Martin, et al.
Pubblicazione: (2023)
di: Weyssow, Martin, et al.
Pubblicazione: (2023)
Neuron Patching: Semantic-based Neuron-level Language Model Repair for Code Generation
di: Gu, Jian, et al.
Pubblicazione: (2023)
di: Gu, Jian, et al.
Pubblicazione: (2023)
NExT: Teaching Large Language Models to Reason about Code Execution
di: Ni, Ansong, et al.
Pubblicazione: (2024)
di: Ni, Ansong, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Smaller = Weaker? Benchmarking Robustness of Quantized LLMs in Code Generation
di: Fang, Sen, et al.
Pubblicazione: (2025) -
Assessing the Latent Automated Program Repair Capabilities of Large Language Models using Round-Trip Translation
di: Ruiz, Fernando Vallecillos, et al.
Pubblicazione: (2024) -
MoTCoder: Elevating Large Language Models with Modular of Thought for Challenging Programming Tasks
di: Li, Jingyao, et al.
Pubblicazione: (2023) -
Assured Automatic Programming via Large Language Models
di: Mirchev, Martin, et al.
Pubblicazione: (2024) -
LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code
di: Jain, Naman, et al.
Pubblicazione: (2024)