LLM-as-a-Judge for Human-AI Co-Creation: A Reliability-Aware Evaluation Framework for Coding
Fuente:
arXiv
Saved in:
| Main Authors: | Amin, Md Faizul Ibne, Watanobe, Yutaka, Muepu, Daniel M., Suzuki, Haruto, Nanaumi, Kenta, Rahman, Md Mostafizer |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Error Understanding in Program Code With LLM-DL for Multi-label Classification
by: Amin, Md Faizul Ibne, et al.
Published: (2026)
by: Amin, Md Faizul Ibne, et al.
Published: (2026)
Code Refactoring with LLM: A Comprehensive Evaluation With Few-Shot Settings
by: Tapader, Md. Raihan, et al.
Published: (2025)
by: Tapader, Md. Raihan, et al.
Published: (2025)
CodeT5-RNN: Reinforcing Contextual Embeddings for Enhanced Code Comprehension
by: Rahman, Md Mostafizer, et al.
Published: (2026)
by: Rahman, Md Mostafizer, et al.
Published: (2026)
Rule-Based Error Classification for Analyzing Differences in Frequent Errors
by: Shirafuji, Atsushi, et al.
Published: (2023)
by: Shirafuji, Atsushi, et al.
Published: (2023)
Large Language Models for Education and Research: An Empirical and User Survey-based Analysis
by: Rahman, Md Mostafizer, et al.
Published: (2025)
by: Rahman, Md Mostafizer, et al.
Published: (2025)
RoBERTa-BiLSTM: A Context-Aware Hybrid Model for Sentiment Analysis
by: Rahman, Md. Mostafizer, et al.
Published: (2024)
by: Rahman, Md. Mostafizer, et al.
Published: (2024)
PyGen: A Collaborative Human-AI Approach to Python Package Creation
by: Barua, Saikat, et al.
Published: (2024)
by: Barua, Saikat, et al.
Published: (2024)
Deduplicating and Ranking Solution Programs for Suggesting Reference Solutions
by: Shirafuji, Atsushi, et al.
Published: (2023)
by: Shirafuji, Atsushi, et al.
Published: (2023)
Towards a Human-in-the-Loop Framework for Reliable Patch Evaluation Using an LLM-as-a-Judge
by: Shi, Sherry, et al.
Published: (2025)
by: Shi, Sherry, et al.
Published: (2025)
From Natural Language to Verified Code: Toward AI Assisted Problem-to-Code Generation with Dafny-Based Formal Verification
by: Erfan, Md, et al.
Published: (2026)
by: Erfan, Md, et al.
Published: (2026)
Refactoring Programs Using Large Language Models with Few-Shot Examples
by: Shirafuji, Atsushi, et al.
Published: (2023)
by: Shirafuji, Atsushi, et al.
Published: (2023)
Relative Positioning Based Code Chunking Method For Rich Context Retrieval In Repository Level Code Completion Task With Code Language Model
by: Rahman, Imranur, et al.
Published: (2025)
by: Rahman, Imranur, et al.
Published: (2025)
A Task-Level Evaluation of AI Agents in Open-Source Projects
by: Rahman, Shojibur, et al.
Published: (2026)
by: Rahman, Shojibur, et al.
Published: (2026)
Do Automatic Comment Generation Techniques Fall Short? Exploring the Influence of Method Dependencies on Code Understanding
by: Billah, Md Mustakim, et al.
Published: (2025)
by: Billah, Md Mustakim, et al.
Published: (2025)
EvaluateXAI: A Framework to Evaluate the Reliability and Consistency of Rule-based XAI Techniques for Software Analytics Tasks
by: Awal, Md Abdul, et al.
Published: (2024)
by: Awal, Md Abdul, et al.
Published: (2024)
Enhanced LLM-Based Framework for Predicting Null Pointer Dereference in Source Code
by: Sultan, Md. Fahim, et al.
Published: (2024)
by: Sultan, Md. Fahim, et al.
Published: (2024)
BanglaForge: LLM Collaboration with Self-Refinement for Bangla Code Generation
by: Dihan, Mahir Labib, et al.
Published: (2025)
by: Dihan, Mahir Labib, et al.
Published: (2025)
Don't Judge Code by Its Cover: Exploring Biases in LLM Judges for Code Evaluation
by: Moon, Jiwon, et al.
Published: (2025)
by: Moon, Jiwon, et al.
Published: (2025)
SWE-Shepherd: Advancing PRMs for Reinforcing Code Agents
by: Dihan, Mahir Labib, et al.
Published: (2026)
by: Dihan, Mahir Labib, et al.
Published: (2026)
ConceptCoder: Improve Code Reasoning via Concept Learning
by: Rahman, Md Mahbubur, et al.
Published: (2026)
by: Rahman, Md Mahbubur, et al.
Published: (2026)
Is LLM-Generated Code More Maintainable \& Reliable than Human-Written Code?
by: Molison, Alfred Santa, et al.
Published: (2025)
by: Molison, Alfred Santa, et al.
Published: (2025)
ChatGPT and Human Synergy in Black-Box Testing: A Comparative Analysis
by: Kirinuki, Hiroyuki, et al.
Published: (2024)
by: Kirinuki, Hiroyuki, et al.
Published: (2024)
Software Metric Based Impact Analysis of Code Smells ‐ A Large Scale Empirical Study
by: Md. Masudur Rahman, et al.
Published: (2025)
by: Md. Masudur Rahman, et al.
Published: (2025)
Understanding Dominant Themes in Reviewing Agentic AI-authored Code
by: Haider, Md. Asif, et al.
Published: (2026)
by: Haider, Md. Asif, et al.
Published: (2026)
Context Before Code: An Experience Report on Vibe Coding in Practice
by: Shuvo, Md Nasir Uddin, et al.
Published: (2026)
by: Shuvo, Md Nasir Uddin, et al.
Published: (2026)
Context-Aware CodeLLM Eviction for AI-assisted Coding
by: Thangarajah, Kishanthan, et al.
Published: (2025)
by: Thangarajah, Kishanthan, et al.
Published: (2025)
From Code to Career: Assessing Competitive Programmers for Industry Placement
by: Akib, Md Imranur Rahman, et al.
Published: (2025)
by: Akib, Md Imranur Rahman, et al.
Published: (2025)
Measuring Impacts of Poisoning on Model Parameters and Embeddings for Large Language Models of Code
by: Hussain, Aftab, et al.
Published: (2024)
by: Hussain, Aftab, et al.
Published: (2024)
An Empirical Evaluation of LLM-Based Approaches for Code Vulnerability Detection: RAG, SFT, and Dual-Agent Systems
by: Saju, Md Hasan, et al.
Published: (2026)
by: Saju, Md Hasan, et al.
Published: (2026)
Beyond Single Reports: Evaluating Automated ATT&CK Technique Extraction in Multi-Report Campaign Settings
by: Haque, Md Nazmul, et al.
Published: (2026)
by: Haque, Md Nazmul, et al.
Published: (2026)
Engineering hyper-personalization: Software challenges and brand performance in AI-driven digital marketing management: An empirical study
by: Haider, Raiyan, et al.
Published: (2025)
by: Haider, Raiyan, et al.
Published: (2025)
LLM-as-a-Judge for Scalable Test Coverage Evaluation: Accuracy, Operational Reliability, and Cost
by: Huang, Donghao, et al.
Published: (2025)
by: Huang, Donghao, et al.
Published: (2025)
Detecting Proxy Gaming in RL and LLM Alignment via Evaluator Stress Tests
by: Shihab, Ibne Farabi, et al.
Published: (2025)
by: Shihab, Ibne Farabi, et al.
Published: (2025)
Programming with AI: Evaluating ChatGPT, Gemini, AlphaCode, and GitHub Copilot for Programmers
by: Siam, Md Kamrul, et al.
Published: (2024)
by: Siam, Md Kamrul, et al.
Published: (2024)
CodeJudgeBench: Benchmarking LLM-as-a-Judge for Coding Tasks
by: Jiang, Hongchao, et al.
Published: (2025)
by: Jiang, Hongchao, et al.
Published: (2025)
Exploring Sustainability in Scientific Software through Code Quality & Test Coverage Metrics
by: Rahman, Sheikh Md. Mushfiqur, et al.
Published: (2026)
by: Rahman, Sheikh Md. Mushfiqur, et al.
Published: (2026)
Automated Personnel Selection for Software Engineers Using LLM-Based Profile Evaluation
by: Karim, Ahmed Akib Jawad, et al.
Published: (2024)
by: Karim, Ahmed Akib Jawad, et al.
Published: (2024)
ChatGPT vs. DeepSeek: A Comparative Study on AI-Based Code Generation
by: Manik, Md Motaleb Hossen
Published: (2025)
by: Manik, Md Motaleb Hossen
Published: (2025)
Secret Breach Detection in Source Code with Large Language Models
by: Rahman, Md Nafiu, et al.
Published: (2025)
by: Rahman, Md Nafiu, et al.
Published: (2025)
Best Practices for Facing the Security Challenges of Internet of Things Devices Focusing on Software Development Life Cycle
by: Islam, Md Rafid, et al.
Published: (2024)
by: Islam, Md Rafid, et al.
Published: (2024)
Similar Items
-
Error Understanding in Program Code With LLM-DL for Multi-label Classification
by: Amin, Md Faizul Ibne, et al.
Published: (2026) -
Code Refactoring with LLM: A Comprehensive Evaluation With Few-Shot Settings
by: Tapader, Md. Raihan, et al.
Published: (2025) -
CodeT5-RNN: Reinforcing Contextual Embeddings for Enhanced Code Comprehension
by: Rahman, Md Mostafizer, et al.
Published: (2026) -
Rule-Based Error Classification for Analyzing Differences in Frequent Errors
by: Shirafuji, Atsushi, et al.
Published: (2023) -
Large Language Models for Education and Research: An Empirical and User Survey-based Analysis
by: Rahman, Md Mostafizer, et al.
Published: (2025)