Delulu: A Verified Multi-Lingual Benchmark for Code Hallucination Detection in Fill-in-the-Middle Tasks
Fuente:
arXiv
Salvato in:
| Autori principali: | Erfanian, Mahdi, Troncoso, Nelson Daniel, Garg, Aashna, Gale, Amabel, Liu, Xiaoyu, Golnari, Pareesa Ameneh, Fu, Shengyu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DevBench: A Realistic, Developer-Informed Benchmark for Code Generation Models
di: Kumarappan, Adarsh, et al.
Pubblicazione: (2026)
di: Kumarappan, Adarsh, et al.
Pubblicazione: (2026)
HyDRA: Hybrid Dynamic Routing Architecture for Heterogeneous LLM Pools
di: Garg, Aashna, et al.
Pubblicazione: (2026)
di: Garg, Aashna, et al.
Pubblicazione: (2026)
Evaluation of LLMs on Syntax-Aware Code Fill-in-the-Middle Tasks
di: Gong, Linyuan, et al.
Pubblicazione: (2024)
di: Gong, Linyuan, et al.
Pubblicazione: (2024)
NeedleDB: A Generative-AI Based System for Accurate and Efficient Image Retrieval using Complex Natural Language Queries
di: Erfanian, Mahdi, et al.
Pubblicazione: (2026)
di: Erfanian, Mahdi, et al.
Pubblicazione: (2026)
Adaptive Real-Time Multi-Loss Function Optimization Using Dynamic Memory Fusion Framework: A Case Study on Breast Cancer Segmentation
di: Golnari, Amin, et al.
Pubblicazione: (2024)
di: Golnari, Amin, et al.
Pubblicazione: (2024)
Mid-Tertiary cooling ages in the Precambrian Oaxacan Complex of southern Mexico: indication of exhumation and inland arc migration
di: Amabel Ortega Rivera
Pubblicazione: (2004)
di: Amabel Ortega Rivera
Pubblicazione: (2004)
Needle: A Generative AI-Powered Multi-modal Database for Answering Complex Natural Language Queries
di: Erfanian, Mahdi, et al.
Pubblicazione: (2024)
di: Erfanian, Mahdi, et al.
Pubblicazione: (2024)
Chameleon: Foundation Models for Fairness-aware Multi-modal Data Augmentation to Enhance Coverage of Minorities
di: Erfanian, Mahdi, et al.
Pubblicazione: (2024)
di: Erfanian, Mahdi, et al.
Pubblicazione: (2024)
Neotectónica de un sector de la falla de Agua Blanca, Valle de Agua Blanca (Rancho la Cocina-Rancho Agua Blanca), Baja California, México
di: María Amabel Ortega Rivera
Pubblicazione: (1988)
di: María Amabel Ortega Rivera
Pubblicazione: (1988)
Alignment with Fill-In-the-Middle for Enhancing Code Generation
di: Ren, Houxing, et al.
Pubblicazione: (2025)
di: Ren, Houxing, et al.
Pubblicazione: (2025)
Structure-Aware Fill-in-the-Middle Pretraining for Code
di: Gong, Linyuan, et al.
Pubblicazione: (2025)
di: Gong, Linyuan, et al.
Pubblicazione: (2025)
LEXTREME: A Multi-Lingual and Multi-Task Benchmark for the Legal Domain
di: Niklaus, Joel, et al.
Pubblicazione: (2023)
di: Niklaus, Joel, et al.
Pubblicazione: (2023)
An Efficient Matrix Multiplication Algorithm for Accelerating Inference in Binary and Ternary Neural Networks
di: Dehghankar, Mohsen, et al.
Pubblicazione: (2024)
di: Dehghankar, Mohsen, et al.
Pubblicazione: (2024)
Exploring the Effectiveness of Social Truth Queries to Address Online Misinformation in a Polarized Context
di: Amabel Y. Jeon, et al.
Pubblicazione: (2026)
di: Amabel Y. Jeon, et al.
Pubblicazione: (2026)
CodeMirage: A Multi-Lingual Benchmark for Detecting AI-Generated and Paraphrased Source Code from Production-Level LLMs
di: Guo, Hanxi, et al.
Pubblicazione: (2025)
di: Guo, Hanxi, et al.
Pubblicazione: (2025)
CCHall: A Novel Benchmark for Joint Cross-Lingual and Cross-Modal Hallucinations Detection in Large Language Models
di: Zhang, Yongheng, et al.
Pubblicazione: (2025)
di: Zhang, Yongheng, et al.
Pubblicazione: (2025)
An Execution-Verified Multi-Language Benchmark for Code Semantic Reasoning
di: Li, Yikun, et al.
Pubblicazione: (2026)
di: Li, Yikun, et al.
Pubblicazione: (2026)
HalluMix: A Task-Agnostic, Multi-Domain Benchmark for Real-World Hallucination Detection
di: Emery, Deanna, et al.
Pubblicazione: (2025)
di: Emery, Deanna, et al.
Pubblicazione: (2025)
LOCUS: A System and Method for Low-Cost Customization for Universal Specialization
di: Sundararaman, Dhanasekar, et al.
Pubblicazione: (2025)
di: Sundararaman, Dhanasekar, et al.
Pubblicazione: (2025)
VERINA: Benchmarking Verifiable Code Generation
di: Ye, Zhe, et al.
Pubblicazione: (2025)
di: Ye, Zhe, et al.
Pubblicazione: (2025)
Physiologically Grounded Driver Behavior Classification: SHAP-Driven Elite Feature Selection and Hybrid Gradient Boosting for Multimodal Physiological Signals
di: Askari, Sahar, et al.
Pubblicazione: (2026)
di: Askari, Sahar, et al.
Pubblicazione: (2026)
Goldbach Conjecture: Violation Probability and Generalization to Prime-like Distributions
di: Farhadian, Ameneh
Pubblicazione: (2025)
di: Farhadian, Ameneh
Pubblicazione: (2025)
Predicting of borderline personality disorder (BPD) based on emotional intelligence, apathy and empathy among the soldiers admitted to a military hospital
di: Ameneh Bakhshizadeh
Pubblicazione: (2019)
di: Ameneh Bakhshizadeh
Pubblicazione: (2019)
The impact of U.S. economic sanctions on corporate innovation and fraud
di: Ameneh Bazrafshan
Pubblicazione: (2024)
di: Ameneh Bazrafshan
Pubblicazione: (2024)
Foreign language learning and identity reconstruction: understanding of interaction of the self
di: Ameneh Nejabat
Pubblicazione: (2021)
di: Ameneh Nejabat
Pubblicazione: (2021)
ANHALTEN: Cross-Lingual Transfer for German Token-Level Reference-Free Hallucination Detection
di: Herrlein, Janek, et al.
Pubblicazione: (2024)
di: Herrlein, Janek, et al.
Pubblicazione: (2024)
Bridging Developer Instructions and Code Completion Through Instruction-Aware Fill-in-the-Middle Paradigm
di: Sun, Zhensu, et al.
Pubblicazione: (2025)
di: Sun, Zhensu, et al.
Pubblicazione: (2025)
Exploring Multi-Lingual Bias of Large Code Models in Code Generation
di: Wang, Chaozheng, et al.
Pubblicazione: (2024)
di: Wang, Chaozheng, et al.
Pubblicazione: (2024)
Multi-Lingual Implicit Discourse Relation Recognition with Multi-Label Hierarchical Learning
di: Costa, Nelson Filipe, et al.
Pubblicazione: (2025)
di: Costa, Nelson Filipe, et al.
Pubblicazione: (2025)
Memorization Dynamics of Fill-in-the-Middle Pretraining
di: von Arx, Tobias, et al.
Pubblicazione: (2026)
di: von Arx, Tobias, et al.
Pubblicazione: (2026)
MathFimer: Enhancing Mathematical Reasoning by Expanding Reasoning Steps through Fill-in-the-Middle Task
di: Yan, Yuchen, et al.
Pubblicazione: (2025)
di: Yan, Yuchen, et al.
Pubblicazione: (2025)
QiVC-Net: Quantum-Inspired Variational Convolutional Network, with Application to Biosignal Classification
di: Golnari, Amin, et al.
Pubblicazione: (2025)
di: Golnari, Amin, et al.
Pubblicazione: (2025)
Proving the Coding Interview: A Benchmark for Formally Verified Code Generation
di: Dougherty, Quinn, et al.
Pubblicazione: (2025)
di: Dougherty, Quinn, et al.
Pubblicazione: (2025)
EH-Benchmark Ophthalmic Hallucination Benchmark and Agent-Driven Top-Down Traceable Reasoning Workflow
di: Pan, Xiaoyu, et al.
Pubblicazione: (2025)
di: Pan, Xiaoyu, et al.
Pubblicazione: (2025)
De-Hallucinator: Mitigating LLM Hallucinations in Code Generation Tasks via Iterative Grounding
di: Eghbali, Aryaz, et al.
Pubblicazione: (2024)
di: Eghbali, Aryaz, et al.
Pubblicazione: (2024)
CoDet-M4: Detecting Machine-Generated Code in Multi-Lingual, Multi-Generator and Multi-Domain Settings
di: Orel, Daniil, et al.
Pubblicazione: (2025)
di: Orel, Daniil, et al.
Pubblicazione: (2025)
FairEM360: A Suite for Responsible Entity Matching
di: Shahbazi, Nima, et al.
Pubblicazione: (2024)
di: Shahbazi, Nima, et al.
Pubblicazione: (2024)
CodeAssistBench (CAB): Dataset & Benchmarking for Multi-turn Chat-Based Code Assistance
di: Kim, Myeongsoo, et al.
Pubblicazione: (2025)
di: Kim, Myeongsoo, et al.
Pubblicazione: (2025)
DetailVerifyBench: A Benchmark for Dense Hallucination Localization in Long Image Captions
di: Wang, Xinran, et al.
Pubblicazione: (2026)
di: Wang, Xinran, et al.
Pubblicazione: (2026)
ERBench: An Entity-Relationship based Automatically Verifiable Hallucination Benchmark for Large Language Models
di: Oh, Jio, et al.
Pubblicazione: (2024)
di: Oh, Jio, et al.
Pubblicazione: (2024)
Documenti analoghi
-
DevBench: A Realistic, Developer-Informed Benchmark for Code Generation Models
di: Kumarappan, Adarsh, et al.
Pubblicazione: (2026) -
HyDRA: Hybrid Dynamic Routing Architecture for Heterogeneous LLM Pools
di: Garg, Aashna, et al.
Pubblicazione: (2026) -
Evaluation of LLMs on Syntax-Aware Code Fill-in-the-Middle Tasks
di: Gong, Linyuan, et al.
Pubblicazione: (2024) -
NeedleDB: A Generative-AI Based System for Accurate and Efficient Image Retrieval using Complex Natural Language Queries
di: Erfanian, Mahdi, et al.
Pubblicazione: (2026) -
Adaptive Real-Time Multi-Loss Function Optimization Using Dynamic Memory Fusion Framework: A Case Study on Breast Cancer Segmentation
di: Golnari, Amin, et al.
Pubblicazione: (2024)