Code Review Without Borders: Evaluating Synthetic vs. Real Data for Review Recommendation
Fuente:
arXiv
Salvato in:
| Autori principali: | Cohen, Yogev, Ohayon, Dudi, Somkin, Romy, Aperstein, Yehudit, Apartsin, Alexander |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Controlled Synthetic Benchmark for Educational Aspect-Based Sentiment Analysis
di: Aperstein, Yehudit, et al.
Pubblicazione: (2026)
di: Aperstein, Yehudit, et al.
Pubblicazione: (2026)
Quality Matters: Evaluating Synthetic Data for Tool-Using LLMs
di: Iskander, Shadi, et al.
Pubblicazione: (2024)
di: Iskander, Shadi, et al.
Pubblicazione: (2024)
RovoDev Code Reviewer: A Large-Scale Online Evaluation of LLM-based Code Review Automation at Atlassian
di: Tantithamthavorn, Kla, et al.
Pubblicazione: (2026)
di: Tantithamthavorn, Kla, et al.
Pubblicazione: (2026)
DeepCRCEval: Revisiting the Evaluation of Code Review Comment Generation
di: Lu, Junyi, et al.
Pubblicazione: (2024)
di: Lu, Junyi, et al.
Pubblicazione: (2024)
Learning Code Preference via Synthetic Evolution
di: Liu, Jiawei, et al.
Pubblicazione: (2024)
di: Liu, Jiawei, et al.
Pubblicazione: (2024)
Do Large Language Models Need Intent? Revisiting Response Generation Strategies for Service Assistant
di: Bolshinsky, Inbal, et al.
Pubblicazione: (2025)
di: Bolshinsky, Inbal, et al.
Pubblicazione: (2025)
Scoring Verifiers: Evaluating Synthetic Verification for Code and Reasoning
di: Ficek, Aleksander, et al.
Pubblicazione: (2025)
di: Ficek, Aleksander, et al.
Pubblicazione: (2025)
Prompting and Fine-tuning Large Language Models for Automated Code Review Comment Generation
di: Haider, Md. Asif, et al.
Pubblicazione: (2024)
di: Haider, Md. Asif, et al.
Pubblicazione: (2024)
SynAE: A Framework for Measuring the Quality of Synthetic Data for Tool-Calling Agent Evaluations
di: Wang, Shuaiqi, et al.
Pubblicazione: (2026)
di: Wang, Shuaiqi, et al.
Pubblicazione: (2026)
Beyond Words: Interjection Classification for Improved Human-Computer Interaction
di: Goren, Yaniv, et al.
Pubblicazione: (2025)
di: Goren, Yaniv, et al.
Pubblicazione: (2025)
CodeJudge: Evaluating Code Generation with Large Language Models
di: Tong, Weixi, et al.
Pubblicazione: (2024)
di: Tong, Weixi, et al.
Pubblicazione: (2024)
Towards Practical Defect-Focused Automated Code Review
di: Lu, Junyi, et al.
Pubblicazione: (2025)
di: Lu, Junyi, et al.
Pubblicazione: (2025)
Evaluating Language Models for Efficient Code Generation
di: Liu, Jiawei, et al.
Pubblicazione: (2024)
di: Liu, Jiawei, et al.
Pubblicazione: (2024)
LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code
di: Jain, Naman, et al.
Pubblicazione: (2024)
di: Jain, Naman, et al.
Pubblicazione: (2024)
LeetCodeDataset: A Temporal Dataset for Robust Evaluation and Efficient Training of Code LLMs
di: Xia, Yunhui, et al.
Pubblicazione: (2025)
di: Xia, Yunhui, et al.
Pubblicazione: (2025)
Language Models for Code Completion: A Practical Evaluation
di: Izadi, Maliheh, et al.
Pubblicazione: (2024)
di: Izadi, Maliheh, et al.
Pubblicazione: (2024)
RepoQA: Evaluating Long Context Code Understanding
di: Liu, Jiawei, et al.
Pubblicazione: (2024)
di: Liu, Jiawei, et al.
Pubblicazione: (2024)
Leveraging Reviewer Experience in Code Review Comment Generation
di: Lin, Hong Yi, et al.
Pubblicazione: (2024)
di: Lin, Hong Yi, et al.
Pubblicazione: (2024)
Evaluating the Generalization Capabilities of Large Language Models on Code Reasoning
di: Yang, Rem, et al.
Pubblicazione: (2025)
di: Yang, Rem, et al.
Pubblicazione: (2025)
Quantifying Contamination in Evaluating Code Generation Capabilities of Language Models
di: Riddell, Martin, et al.
Pubblicazione: (2024)
di: Riddell, Martin, et al.
Pubblicazione: (2024)
Data Augmentation for Code Translation with Comparable Corpora and Multiple References
di: Xie, Yiqing, et al.
Pubblicazione: (2023)
di: Xie, Yiqing, et al.
Pubblicazione: (2023)
Grounding Data Science Code Generation with Input-Output Specifications
di: Wen, Yeming, et al.
Pubblicazione: (2024)
di: Wen, Yeming, et al.
Pubblicazione: (2024)
SIMCOPILOT: Evaluating Large Language Models for Copilot-Style Code Generation
di: Jiang, Mingchao, et al.
Pubblicazione: (2025)
di: Jiang, Mingchao, et al.
Pubblicazione: (2025)
CWEval: Outcome-driven Evaluation on Functionality and Security of LLM Code Generation
di: Peng, Jinjun, et al.
Pubblicazione: (2025)
di: Peng, Jinjun, et al.
Pubblicazione: (2025)
GrowthHacker: Automated Off-Policy Evaluation Optimization Using Code-Modifying LLM Agents
di: Wu, Jie JW, et al.
Pubblicazione: (2025)
di: Wu, Jie JW, et al.
Pubblicazione: (2025)
What can Large Language Models Capture about Code Functional Equivalence?
di: Maveli, Nickil, et al.
Pubblicazione: (2024)
di: Maveli, Nickil, et al.
Pubblicazione: (2024)
IntentCoding: Amplifying User Intent in Code Generation
di: Fang, Zheng, et al.
Pubblicazione: (2026)
di: Fang, Zheng, et al.
Pubblicazione: (2026)
SelfCodeAlign: Self-Alignment for Code Generation
di: Wei, Yuxiang, et al.
Pubblicazione: (2024)
di: Wei, Yuxiang, et al.
Pubblicazione: (2024)
SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation
di: Petrukha, Ivan, et al.
Pubblicazione: (2025)
di: Petrukha, Ivan, et al.
Pubblicazione: (2025)
Beyond Synthetic Benchmarks: Evaluating LLM Performance on Real-World Class-Level Code Generation
di: Rahman, Musfiqur, et al.
Pubblicazione: (2025)
di: Rahman, Musfiqur, et al.
Pubblicazione: (2025)
NaturalCodeBench: Examining Coding Performance Mismatch on HumanEval and Natural User Prompts
di: Zhang, Shudan, et al.
Pubblicazione: (2024)
di: Zhang, Shudan, et al.
Pubblicazione: (2024)
CodeUltraFeedback: An LLM-as-a-Judge Dataset for Aligning Large Language Models to Coding Preferences
di: Weyssow, Martin, et al.
Pubblicazione: (2024)
di: Weyssow, Martin, et al.
Pubblicazione: (2024)
HexaCoder: Secure Code Generation via Oracle-Guided Synthetic Training Data
di: Hajipour, Hossein, et al.
Pubblicazione: (2024)
di: Hajipour, Hossein, et al.
Pubblicazione: (2024)
Leveraging Reward Models for Guiding Code Review Comment Generation
di: Sghaier, Oussama Ben, et al.
Pubblicazione: (2025)
di: Sghaier, Oussama Ben, et al.
Pubblicazione: (2025)
Prompt-Driven Code Summarization: A Systematic Literature Review
di: Farjana, Afia, et al.
Pubblicazione: (2026)
di: Farjana, Afia, et al.
Pubblicazione: (2026)
Trained Without My Consent: Detecting Code Inclusion In Language Models Trained on Code
di: Majdinasab, Vahid, et al.
Pubblicazione: (2024)
di: Majdinasab, Vahid, et al.
Pubblicazione: (2024)
CodeEditorBench: Evaluating Code Editing Capability of Large Language Models
di: Guo, Jiawei, et al.
Pubblicazione: (2024)
di: Guo, Jiawei, et al.
Pubblicazione: (2024)
Confucius Code Agent: Scalable Agent Scaffolding for Real-World Codebases
di: Wong, Sherman, et al.
Pubblicazione: (2025)
di: Wong, Sherman, et al.
Pubblicazione: (2025)
CONCUR: Benchmarking LLMs for Concurrent Code Generation
di: Huang, Jue, et al.
Pubblicazione: (2026)
di: Huang, Jue, et al.
Pubblicazione: (2026)
StackEval: Benchmarking LLMs in Coding Assistance
di: Shah, Nidhish, et al.
Pubblicazione: (2024)
di: Shah, Nidhish, et al.
Pubblicazione: (2024)
Documenti analoghi
-
A Controlled Synthetic Benchmark for Educational Aspect-Based Sentiment Analysis
di: Aperstein, Yehudit, et al.
Pubblicazione: (2026) -
Quality Matters: Evaluating Synthetic Data for Tool-Using LLMs
di: Iskander, Shadi, et al.
Pubblicazione: (2024) -
RovoDev Code Reviewer: A Large-Scale Online Evaluation of LLM-based Code Review Automation at Atlassian
di: Tantithamthavorn, Kla, et al.
Pubblicazione: (2026) -
DeepCRCEval: Revisiting the Evaluation of Code Review Comment Generation
di: Lu, Junyi, et al.
Pubblicazione: (2024) -
Learning Code Preference via Synthetic Evolution
di: Liu, Jiawei, et al.
Pubblicazione: (2024)