Evaluate-and-Purify: Fortifying Code Language Models Against Adversarial Attacks Using LLM-as-a-Judge
Fuente:
arXiv
Guardado en:
| Autores principales: | Mu, Wenhan, Xu, Ling, Pei, Shuren, Mi, Le, Zhou, Huichi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Don't Judge Code by Its Cover: Exploring Biases in LLM Judges for Code Evaluation
por: Moon, Jiwon, et al.
Publicado: (2025)
por: Moon, Jiwon, et al.
Publicado: (2025)
CodeJudge-Eval: Can Large Language Models be Good Judges in Code Understanding?
por: Zhao, Yuwei, et al.
Publicado: (2024)
por: Zhao, Yuwei, et al.
Publicado: (2024)
CodeJudge: Evaluating Code Generation with Large Language Models
por: Tong, Weixi, et al.
Publicado: (2024)
por: Tong, Weixi, et al.
Publicado: (2024)
CodeUltraFeedback: An LLM-as-a-Judge Dataset for Aligning Large Language Models to Coding Preferences
por: Weyssow, Martin, et al.
Publicado: (2024)
por: Weyssow, Martin, et al.
Publicado: (2024)
CodeJudgeBench: Benchmarking LLM-as-a-Judge for Coding Tasks
por: Jiang, Hongchao, et al.
Publicado: (2025)
por: Jiang, Hongchao, et al.
Publicado: (2025)
ProSec: Fortifying Code LLMs with Proactive Security Alignment
por: Xu, Xiangzhe, et al.
Publicado: (2024)
por: Xu, Xiangzhe, et al.
Publicado: (2024)
Stellis: A Strategy Language for Purifying Separation Logic Entailments
por: Wang, Zhiyi, et al.
Publicado: (2025)
por: Wang, Zhiyi, et al.
Publicado: (2025)
LLM-as-a-Judge for Reference-less Automatic Code Validation and Refinement for Natural Language to Bash in IT Automation
por: Vo, Ngoc Phuoc An, et al.
Publicado: (2025)
por: Vo, Ngoc Phuoc An, et al.
Publicado: (2025)
Python Symbolic Execution with LLM-powered Code Generation
por: Wang, Wenhan, et al.
Publicado: (2024)
por: Wang, Wenhan, et al.
Publicado: (2024)
Adversarial Attacks on Code Models with Discriminative Graph Patterns
por: Nguyen, Thanh-Dat, et al.
Publicado: (2023)
por: Nguyen, Thanh-Dat, et al.
Publicado: (2023)
Black-Box Adversarial Attacks on LLM-Based Code Completion
por: Jenko, Slobodan, et al.
Publicado: (2024)
por: Jenko, Slobodan, et al.
Publicado: (2024)
ArtifactsBench: Bridging the Visual-Interactive Gap in LLM Code Generation Evaluation
por: Zhang, Chenchen, et al.
Publicado: (2025)
por: Zhang, Chenchen, et al.
Publicado: (2025)
Evaluating and Achieving Controllable Code Completion in Code LLM
por: Zhang, Jiajun, et al.
Publicado: (2026)
por: Zhang, Jiajun, et al.
Publicado: (2026)
Beyond Code Pairs: Dialogue-Based Data Generation for LLM Code Translation
por: Chen, Le, et al.
Publicado: (2025)
por: Chen, Le, et al.
Publicado: (2025)
Comparing Developer and LLM Biases in Code Evaluation
por: Mittal, Aditya, et al.
Publicado: (2026)
por: Mittal, Aditya, et al.
Publicado: (2026)
An LLM-as-Judge Metric for Bridging the Gap with Human Evaluation in SE Tasks
por: Zhou, Xin, et al.
Publicado: (2025)
por: Zhou, Xin, et al.
Publicado: (2025)
CodeMirage: Hallucinations in Code Generated by Large Language Models
por: Agarwal, Vibhor, et al.
Publicado: (2024)
por: Agarwal, Vibhor, et al.
Publicado: (2024)
Learning to Focus: Context Extraction for Efficient Code Vulnerability Detection with Language Models
por: Zheng, Xinran, et al.
Publicado: (2025)
por: Zheng, Xinran, et al.
Publicado: (2025)
AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators
por: Chou, Jason, et al.
Publicado: (2025)
por: Chou, Jason, et al.
Publicado: (2025)
Is Your AI-Generated Code Really Safe? Evaluating Large Language Models on Secure Code Generation with CodeSecEval
por: Wang, Jiexin, et al.
Publicado: (2024)
por: Wang, Jiexin, et al.
Publicado: (2024)
Perish or Flourish? A Holistic Evaluation of Large Language Models for Code Generation in Functional Programming
por: Lang, Nguyet-Anh H., et al.
Publicado: (2026)
por: Lang, Nguyet-Anh H., et al.
Publicado: (2026)
Adversarial Attack Classification and Robustness Testing for Large Language Models for Code
por: Liu, Yang, et al.
Publicado: (2025)
por: Liu, Yang, et al.
Publicado: (2025)
Rethinking Code Refinement: Learning to Judge Code Efficiency
por: Seo, Minju, et al.
Publicado: (2024)
por: Seo, Minju, et al.
Publicado: (2024)
CodeMind: Evaluating Large Language Models for Code Reasoning
por: Liu, Changshu, et al.
Publicado: (2024)
por: Liu, Changshu, et al.
Publicado: (2024)
Automatically Benchmarking LLM Code Agents through Agent-Driven Annotation and Evaluation
por: Fu, Lingyue, et al.
Publicado: (2025)
por: Fu, Lingyue, et al.
Publicado: (2025)
BiasScope: Towards Automated Detection of Bias in LLM-as-a-Judge Evaluation
por: Lai, Peng, et al.
Publicado: (2026)
por: Lai, Peng, et al.
Publicado: (2026)
CodeOCR: On the Effectiveness of Vision Language Models in Code Understanding
por: Shi, Yuling, et al.
Publicado: (2026)
por: Shi, Yuling, et al.
Publicado: (2026)
Evaluating Language Models for Efficient Code Generation
por: Liu, Jiawei, et al.
Publicado: (2024)
por: Liu, Jiawei, et al.
Publicado: (2024)
Novel Preprocessing Technique for Data Embedding in Engineering Code Generation Using Large Language Model
por: Lin, Yu-Chen, et al.
Publicado: (2023)
por: Lin, Yu-Chen, et al.
Publicado: (2023)
LongCodeZip: Compress Long Context for Code Language Models
por: Shi, Yuling, et al.
Publicado: (2025)
por: Shi, Yuling, et al.
Publicado: (2025)
Bridging Code Graphs and Large Language Models for Better Code Understanding
por: Chen, Zeqi, et al.
Publicado: (2025)
por: Chen, Zeqi, et al.
Publicado: (2025)
Mercury: A Code Efficiency Benchmark for Code Large Language Models
por: Du, Mingzhe, et al.
Publicado: (2024)
por: Du, Mingzhe, et al.
Publicado: (2024)
HumanEval Pro and MBPP Pro: Evaluating Large Language Models on Self-invoking Code Generation
por: Yu, Zhaojian, et al.
Publicado: (2024)
por: Yu, Zhaojian, et al.
Publicado: (2024)
Genetic Auto-prompt Learning for Pre-trained Code Intelligence Language Models
por: Feng, Chengzhe, et al.
Publicado: (2024)
por: Feng, Chengzhe, et al.
Publicado: (2024)
Code Fingerprints: Disentangled Attribution of LLM-Generated Code
por: Guo, Jiaxun, et al.
Publicado: (2026)
por: Guo, Jiaxun, et al.
Publicado: (2026)
InstructCoder: Instruction Tuning Large Language Models for Code Editing
por: Li, Kaixin, et al.
Publicado: (2023)
por: Li, Kaixin, et al.
Publicado: (2023)
ScaleBox: Enabling High-Fidelity and Scalable Code Verification for Large Language Models
por: Zheng, Jiasheng, et al.
Publicado: (2026)
por: Zheng, Jiasheng, et al.
Publicado: (2026)
Using Large Language Models for Student-Code Guided Test Case Generation in Computer Science Education
por: Kumar, Nischal Ashok, et al.
Publicado: (2024)
por: Kumar, Nischal Ashok, et al.
Publicado: (2024)
ConCodeEval: Evaluating Large Language Models for Code Constraints in Domain-Specific Languages
por: Kammakomati, Mehant, et al.
Publicado: (2024)
por: Kammakomati, Mehant, et al.
Publicado: (2024)
Calibration of Large Language Models on Code Summarization
por: Virk, Yuvraj, et al.
Publicado: (2024)
por: Virk, Yuvraj, et al.
Publicado: (2024)
Ejemplares similares
-
Don't Judge Code by Its Cover: Exploring Biases in LLM Judges for Code Evaluation
por: Moon, Jiwon, et al.
Publicado: (2025) -
CodeJudge-Eval: Can Large Language Models be Good Judges in Code Understanding?
por: Zhao, Yuwei, et al.
Publicado: (2024) -
CodeJudge: Evaluating Code Generation with Large Language Models
por: Tong, Weixi, et al.
Publicado: (2024) -
CodeUltraFeedback: An LLM-as-a-Judge Dataset for Aligning Large Language Models to Coding Preferences
por: Weyssow, Martin, et al.
Publicado: (2024) -
CodeJudgeBench: Benchmarking LLM-as-a-Judge for Coding Tasks
por: Jiang, Hongchao, et al.
Publicado: (2025)